数学与统计 · 5/12
回归均值Regression to the Mean
当表现夹杂随机波动时,极端成绩之后的平均表现会更接近常态。
一次差表现之后的进步,很容易被教练算在批评头上。20 世纪 60 年代中期,心理学家丹尼尔·卡尼曼在以色列给空军飞行教官讲课。一位资深教官反驳他:学员完成漂亮的飞行动作,受到表扬后,下次就差了;动作做坏了,挨骂后,下次反而进步。卡尼曼发现,教官专挑特别好或特别坏的表现作出反应。学员下一次只要回到平常水平,教官眼里就成了表扬使人退步、批评使人进步。同一个学员,连能力都不必改变,就能让教官反复得到这套结论。
为什么成立
极端成绩把稳定水平和偶然波动一起选了出来
一个平时考 70 分的人,有次考了 90 分,其中一部分来自恰好考到熟悉的题。题目重新抽一遍,这份额外优势就难以照搬。回归均值说的是:按极端成绩挑出的对象,再测一次,平均结果会更接近原本的常态。
极端筛选是关键。若把成绩拆成稳定水平与随机波动,挑最高分时,两部分都会被挑高;挑最低分时,两部分都会被挑低。稳定水平可以延续,偶然波动却不会原样延续。两次表现越难重复,回归就越明显。
下一次的预测要缩小这一次的偏离
在两次测量均值、标准差相同,且条件平均数呈线性关系时,有:
这里, 是可比人群的平均成绩, 是两次成绩的相关系数。白话说,预测下一次时,只保留这次偏离均值的 倍。若平均分是 70,两次成绩的相关系数是 0.5,首次考 90 的那组人,第二次平均预测为 80。这里预测的是这一组人的平均成绩,组内仍会有人考得更高。
表扬和批评恰好站在回落与回升之前
表扬常跟在超常发挥之后,批评常跟在异常失误之后。即使反馈毫无效果,随后也会出现平均回落或回升。判断反馈是否有效,要比较起点同样极端、却接受不同反馈的人。 只看接受反馈者的前后变化,会把自然回归算成干预的功劳或过错。
出处
回归均值属于数学与统计,源于弗朗西斯·高尔顿的遗传研究。他在 1885 年报告、1886 年发表《遗传身高向平庸回归》。父母身高极端的家庭,其成年子女的平均身高更接近人群均值,这是经典证据。后来卡尼曼用飞行教官的经历说明,人会把这种统计现象误读成奖惩的效果。
换个领域看
体育
开季手感会降温
赛季初的极端打击率,不宜直接当成整季水平。1970 年,美国棒球大联盟球员克莱门特前 45 次打数的打击率为 40%,余下赛季为 34.6%;阿尔维斯则从 15.6% 升到 20%。埃弗龙与莫里斯把这些数据用于经典研究:高端回落,低端回升,克莱门特仍保持着高水平。
商业
别拿旺月定指标
按最好一个月定销售指标,会把一次性订单写成长期要求。一家门店平时每月卖 100 万元,年底接到大客户订单,冲到 160 万元。经理据此把次月指标定为 160 万元,门店后来卖了 110 万元,反而被认定退步。定目标时,把那笔额外订单单列,再看能重复取得的销售额。
投资
冠军收益要打折
仅凭一年冠军成绩选基金,会把那年特别顺的行情带进未来预测。一位投资者按年度收益榜挑基金,冠军恰好重仓当年暴涨的行业。预测下一年时,他应把这次领先幅度向同类基金的长期水平收回,而不是原样延长收益曲线;基金跨不同市场阶段反复领先,才更支持保留较大的领先幅度。
遇事时问自己
- 我关注这个人或这次结果,是不是因为它刚好特别好或特别坏?
- 这次极端表现里,哪些条件下次还能重复,哪些只是临时出现?
- 与它真正可比的人或时期,平常表现是什么水平?
- 如果我什么都不做,下一次是否也会朝常态移动?
- 有没有起点同样极端、却没接受这项干预的人,可以用来比较?
边界与误用
回归均值适用于可比条件下、夹杂不能完全重复的波动的测量。更换工艺、持续训练或行业衰退改变了稳定水平,旧均值就失去参照价值。参照还必须选对:优秀球员的正常水平高于普通人,不能把他拉向所有人的平均数。回归均值不是欠账补偿。 连续失败不会积攒下一次成功的机会,跌得多的股票也不会因此必然反弹。它描述极端筛选之后的条件平均变化,既不保证单个对象回归,也不规定回归需要多久。
练一练
支付平台的值班工程师每天记录各台服务器的响应时间。周一,他挑出当天最慢的20台,统一调整缓存参数。周二,这批服务器的平均响应时间缩短了30%。两天没有更换硬件,但各台服务器收到的请求量和请求类型都有波动。
哪种做法最能判断缓存调整是否有效?
两组都从同样异常的起点出发,自然改善会同时影响它们。随机分组后,两组的平均差异更能反映调整的效果。
多观察几天能减少单日波动的影响。但周一可能本来就是偶发高峰,随后保持正常仍不能单独证明调整有效。
加入另一组看似有了对照。但两组分别来自最慢和最快的一端,差距自然缩小也不能证明调整有效。
前后比较很直观。但它们是按当天最慢挑出的,即使不调整,下一天也可能因请求波动而改善。
值班工程师按一天的极端表现挑服务器,也挑中了当天不利的请求波动。下一天这部分波动未必延续,恢复正常就容易被算成调整的功劳。判断效果,要比较起点同样极端、接受不同处理的对象。
一名急诊护士想缩短骑车上早班的时间。她在八个工作日的同一时刻出发,把家到医院的八条路线各骑了一次。最快路线比八次用时的平均值少6分钟,她准备以后固定走这条路。各路线的长期用时尚未测过,红灯等待和路口拥堵每天都有变化。
预测这条路线今后的平均用时,哪种判断最站得住?
从八次骑行中选最快的一次,也容易选中一次好运。先收回部分领先幅度,再用重复骑行判断有多少优势能够延续。
去掉偶然优势的方向有道理。但这条路线可能确实更短或路口更少,不能把真实优势也全部抹掉。
好运之后容易让人预期坏运气。但这次少等红灯,不会让以后多等红灯的机会增加。
亲自骑出的时间很有说服力。但最快的一次可能恰好少遇到红灯,不能把全部优势都当成路线本身的优势。
最快的一次用时混合了路线特点和当天路况。重新骑行时,有利路况未必重复,预测应收回部分优势。收回多少取决于路线差异和路况波动,不能直接认定八条路线一样快。
镇供水站过去十年一直监测上游河水,污染物浓度长期偏高。唯一排放这种污染物的电镀厂永久关闭后,污染河段完成清理。随后三个月,多处监测点的浓度持续处于低位。供水站复核报告时,有人提出:“最近低得反常,预测明年的浓度还是应该靠近过去十年的平均值。”
对明年的浓度,哪种判断最站得住?
覆盖完整季节有助于估计新水平。但污染源已经消失,等待满一年不会让排污时期的旧均值重新成为合适参照。
低读数有持续的条件变化作支撑。预测应估计关闭后的正常水平及其波动,不能直接拉回排污时期的平均值。
较长的记录通常能减少偶然误差。但旧记录来自工厂持续排污的时期,数据更多也不能消除条件改变的影响。
多处读数一致,支持污染水平已经降低。但降雨和水流仍会变化,不能把当前平均值当成全年每次的读数。
极端读数之后更接近常态,需要前后条件可比。这里污染源永久关闭,长期水平已经改变,持续低位不能被当成一次偶然偏低。旧均值失去参照价值,应根据新条件下的监测重新估计。