返回技术与思考
问题重构与判断观点与分析7 分钟阅读

“普通人”不是背景介绍,而是比较问题的核心条件

在比较就业与经营等路径前,先把起点、分母、时间范围和结果口径说清。总体分布为什么不能直接回答一个具体人的实现难度。

“获得一份较高收入的工作,和经营一门收入不错的生意,哪个更难?”如果只比较两个最终数字,讨论很快就会变成互相举例:有人靠工作达到,有人靠小生意做到。

但我真正想追问的是:对起点普通、资源有限的人,结论是否仍然成立?

这篇文章讨论比较问题的方法,不估计现实收入分布,也不判断某个人应该就业还是经营。我的兴趣在于:一个看起来已经被数据回答的问题,可能还没有定义清楚它要回答谁。

“普通”需要拆成可讨论的条件

出身、能力和资源普通,是一种直观描述,却不能直接作为分析变量。教育、技能、地区、可投入时间、家庭责任、可承受损失和现有关系,都可能影响可选择的路径。

它们也不一定同步。一个人资金少但有很强的行业经验,另一个人有一点储蓄却无法承担收入中断,不能因为都叫“普通人”就默认面对相同机会。

我会先选出可能改变结论的几个条件,并说明其他条件暂时怎样处理。这样比较会变窄,却更接近实际问题。

同时要防止把条件收得过细,以至于只剩一个无法找到材料的虚构人物。分析的作用是识别关键差异;缺少数据时,应当保留不确定,而不是为每个条件编出一个概率。

当前结果的分布,不等于从起点出发的机会

“已有经营者里多少人达到某收入”,分母是当前被观察到的经营者。“从某种起点开始,多少人能在若干年后达到”,分母则是选择进入这条路径的一群人。

如果只看到仍在经营的人,退出者的经历可能没有进入同一统计。就业数据也要看是在全体人口、在职人员,还是某个职业样本里计算。

同样,成功者可能与准备进入的人在经验、资金、选择条件上不同。把成功人群的平均特点直接移给新进入者,不能得到可靠的实现难度。

Hernán 与 Robins 对选择偏差和因果比较的讨论,有助于理解样本形成过程与比较条件为什么重要;这里没有据此推导就业或经营的现实胜率。Causal Inference: What If

我需要先问的是:资料里的谁被看见了,谁没有进入比较,以及缺失是否影响我们正在回答的问题。

两个收入数字也未必在同一尺度上

工资收入、营业收入、经营利润和可支配所得,不是可以随意互换的口径。劳动时间、额外资本投入、波动与持续性,也可能藏在一个年收入数字后面。

比较前应明确计算期间、是否持续达到、包含哪些成本,以及个人劳动怎样计入。这里不需要先做复杂模型,只需要避免把不同意义的数字放在同一条线上。

“难”本身也有多种含义:进入门槛高,达到目标的比例低,需要时间长,还是失败后果难以承受?两条路径在不同尺度上可能排序不同。

若双方说的难度不同,争论不会因为增加成功故事而结束。

时间和失败路径应该进入比较

一个最终目标相同的路径,可能需要更长准备,也可能中途收入波动更大。对有家庭责任的人,等待期间的条件本身就会影响路径是否可行。

失败也不只有“没有达到目标”。还要看投入能否撤回,积累的能力是否能转用,以及退出后有哪些选择。这些是需要收集的信息,不是预先认定某条路径一定更安全。

我会用情境比较代替单一结论:假如时间约束更紧,哪项因素开始主导;假如已有专业经验,哪些门槛改变;假如无法承担收入中断,原来的排序是否还适用。

这种方法不直接给出行动建议,却能说明我们还缺什么证据,以及哪项条件值得先核查。

调查没覆盖到的部分,既不能忽略,也不能任意补上

现实中可能存在公开样本不容易覆盖的经营活动或收入形式。这值得检查调查对象、抽样方式、问题定义与非应答情况。

但“可能遗漏”不能直接推出“遗漏了大量更容易的机会”。遗漏部分可能表现更好,也可能更差,甚至因为口径不同根本无法直接加入。

我会把数据缺口写成具体问题:哪类对象没有覆盖,有没有补充资料,资料之间能否对齐,以及缺口扩大或缩小时会不会改变判断。

如果关键部分没有可靠材料,就先不给精确概率。用非常确定的数字装饰一个未知分母,比承认不知道更容易误导。

这个习惯也适用于技术比较

“哪个模型更好”,要追问对什么任务、输入和评价方式;“哪种研究方法更有效”,要看对什么人群、情境和决定;“这个自动化很省时间”,要检查谁省了时间、谁增加了维护。

这些看起来是不同领域的问题,却共享一个要求:结论的适用条件应该跟着结论一起出现。

我希望一个比较最后能留下可讨论的陈述:在这些前提下,这个选择有这些优势;某项条件改变后,原判断需要重看。它可能没有一句“哪个更好”那么痛快,却更容易进入实际决策。

系统背后的决策过程连起来,下一层问题是:除了个人起点,谁还能改变我们面对的机会与规则?