思考,快与慢
第 4 章 · 18 分钟

回归均值:一条被当成心理现象的算术

本书最干净的一段,也是最容易被误读的一段。

概念地图
回归均值
极端之后趋近平均,是相关不完全的算术后果。
深色为本章概念,浅色为其他章
陪练模式
不想只是读?让它带你走一遍。
导师把这一章拆成小步,每一步先问你,再讲;你用自己的话答,它先认下对的部分再纠偏。用你自己的 AI,对话只存在这台设备上。
对话只存在本机
定位01

延伸阅读

高尔顿 · 十九世纪末 · 向平庸回归
从父子身高数据中发现极端值的后代趋近平均,反对的是把遗传当作逐代放大的看法。代价是他一度把这当成一种生物学力量,而它其实是相关不完全的算术后果——这个误读此后重复了一百多年。
奠基
特沃斯基与卡尼曼 · 1974 年 · 以色列空军教官案例
用飞行训练中「表扬后变差、批评后变好」的观察说明:教官把回归误读成了自己干预的效果。这一步把一条统计性质变成了可操作的诊断工具。
转向
坎贝尔与斯坦利 · 上世纪六十年代 · 准实验设计
把回归列为对内部效度的标准威胁之一,并给出对照组设计作为解法。这是对同一问题的方法论回应,比心理学解释更早也更彻底。
修正
卡尼曼 · 2011 年 · 论回归与因果叙事的几章
把回归与「所见即全部」连起来:人对任何变化都要一个因果故事,而回归不提供故事。本章处理的是这条论证里唯一承担经验风险的一步。
本课对象
机制02

回归是算术不是力量

高尔顿从父子身高里第一次看到它,并误以为发现了一种把后代拉向平庸的力量。他看到的其实是回归均值。这个误读此后被重复了一百多年,本章后面那条推导就是用来拆掉它的:没有任何东西在「拉」,只要成绩里含一点运气成分,这条就成立,运气占多大比重都不影响它是否成立,只影响幅度。

机制不完全的相关通过让极端观测里的运气成分不重复出现使下一次观测趋近均值。
可迁移性测试
换到考试:一次考得特别好的学生,下次多半掉一点,因为那次的分数里含了一部分当天状态与题目碰巧。不同构的地方在于教学干预确实存在,所以现实中回归与真实进步混在一起,必须靠对照组分开。
机制03

因果叙事填空

回归本身不提供故事,而判断系统要故事。于是「表扬之后成绩下降」被填成「表扬让人松懈」,「批评之后成绩上升」被填成「批评有效」。这是第 2 章的连贯性优先在这里的直接后果:任何一段变化都会被配上一个原因,而回归恰恰是没有原因的那一类变化。

机制一段无原因的变化通过被配上因果解释让人高估干预的效果。
可迁移性测试
换到运维:某次告警后重启了服务,指标恢复正常,团队记下「重启有效」。若指标本来就在波动,这条经验会被重复写进操作手册。不同构的地方在于运维可以做 A/B 对照,而对个人的表扬与批评通常无法设对照组。
推导04

从相关不完全到「干预效果被系统性高估」

本章要推出的是这条机制在实践中的后果:凡是按极端值挑出对象再施加干预的评估,都会高估效果。

两次测量的相关系数 (读作「相关」)满足
这是选的,但几乎总成立:只要测量含噪声,相关就不为一。
对象按第一次测量的极端值挑出
这是选的,也是现实里绝大多数评估的做法:挑成绩最差的补课、挑最不健康的干预。
两次测量之间除干预外没有其他系统性变化
这是选的:把成熟、季节等其他因素排除在外。
推导 · 0 / 4
裂缝05

本章框架的裂缝

争议地形06
本书主张
人无法接受没有原因的变化,因此把回归读成干预的效果;识别回归是纠正这类错误因果归因的关键一步。
另一种看法
方法论一线主张:问题不在于人的因果叙事偏好,而在于研究设计。有对照组时回归自动被扣除,没有对照组时再怎么提醒也不解决问题——因此这是设计问题,不是认知问题。
分歧扎在
分歧扎在「补救的入口在哪一层」这一条上:认知层(提醒判断者)还是制度层(要求对照设计)。两边对回归本身的算术没有异议。
什么证据能裁决
能裁决它的是干预实验:给一组评估者做回归识别培训,另一组不培训,两组都在没有对照组的数据上做效果判断,比较其判断偏差。若培训组偏差显著更小,认知层入口有效;若相当,说明只能靠设计。
目前的证据把天平压向「设计更有效」:单纯的统计培训对实际判断的改善有限,而强制对照设计能直接消除这部分偏差。还差的是把「培训强度」量化的手段——现有研究里培训的内容与时长差异很大。
可证伪化07

把「因果叙事填空」写成可预注册的检验

要检验的是「因果叙事填空」:一段无原因的变化通过被配上因果解释让人高估干预的效果。

数据源:新收集的评估判断数据,底层序列由已知参数的随机过程生成
只有生成数据才能保证真实效果为零,从而把高估量直接读出来。
样本范围:事前算好的评估者样本量全部纳入,不按专业背景剔除
按背景剔除会把结论变成对某一人群的描述。
时间窗口:单次实验,每位评估者判断固定数量的序列
序列数量事前定死,避免看到结果再加序列。
判据阈值:评估者报告的干预效果显著大于零,且幅度接近
不仅要求方向,还要求幅度接近算术预测——这才是这条机制的独有含义。
失败条件:报告效果不显著异于零,或幅度与算术预测系统性不符
第二种同样按推翻处理:那说明高估来自别的东西。
推导 · 0 / 3
接口08
挂在哪个槽位
挂在哪个槽位你已有的那条结论多半是「换了做法之后指标变好了,说明新做法有效」——一条关于前后对比的判断。本章要动的正是它。
本章对你已有的结构做的是 (a) 替换「前后对比能说明效果」这条结论,还是 (b) 约束它:先问对象是不是按极端值挑出来的?
慢变量登记两个慢变量:你手上按「最差的那批」启动的改进项目数量,以及其中设了对照组的比例。三天后先看第二个。
小结09
本章小结
01回归均值是相关不完全的算术后果,没有任何力量在拉。
02「极端值之后期望向均值移动 」是恒等式,不需要解释。
03唯一承担经验风险的是「不设对照组会把这块记成效果」。
04按极端值挑选对象是这条机制生效的必要条件;随机抽样不受影响。
05不独立估出相关系数时,回归能解释任意比例的前后差,因而不可证伪。
提取练习 · 合上书,先自己答一遍。
?「给定第一次观测,第二次的期望是 」是 (a) 恒等式 还是 (b) 经验命题?
?随机对照试验不受回归影响,靠的是推翻 (a) 第二条假设(按极端值挑选)还是 (b) 第一条假设(相关不为一)?
受迫二选一10

B 标签辨识

「极端值之后第二次观测的期望更靠近均值」这一步是什么?
二选一
受迫二选一11

D 接口判断

哪一条能挂进你已有的结构?
二选一
读到这里,把它记为已读。