回归谬误
忽略了事物在遭遇极端异常波动后会自然回落到平均值这一统计学规律(均值回归),反而将这种自然的回落错归因于期间所采取的某种人为干预或干预疗法。
寓言故事
周老师的钢琴课,八年来没有换过地方——老城区的居民楼一楼,客厅改成琴房,窗外是一棵泡桐。夏天叶子太密,光线暗得要靠台灯看谱。冬天叶子落光了,阳光穿过光秃秃的枝丫,在琴键上切出一道道细长的亮条。
小梅是星期三下午三点的课。十二岁,学琴三年。不笨,不用功——每周来的时候,曲子练到什么程度,完全看那一周作业多不多、家里有没有吵架、她妈妈有没有想起来催她。周老师心里有一条看不见的平均线:小梅大概就是七分。回课好的时候八分,差的时候六分。
那条线,周老师从来没有画出来过。但她知道它在哪里。
二月第三个星期三,小梅弹得一塌糊涂。音阶跑快了右手跟不上左手,练习曲的第三段连节奏型都丢了——弹的是附点,但一个个音之间隔得一样长,像有人在用湿抹布擦琴键。周老师让她停下来。她看着谱架,镜片后面的眼睛难得没有笑意。
「上星期根本没练吧。」
小梅低着头。周老师把她的手从琴键上拿下来,放在大腿上,像拔掉一个插头。然后她自己坐下来,把那首练习曲从头弹了一遍,中间停了一次,把小梅弹错的那三个小节单独挑出来,弹了两遍,很慢,像在教一块木头听节奏。
「回去,每天至少一个小时。下星期我不要听到一个错音。」
小梅走后,周老师把琴盖合上,泡了杯茶。窗外泡桐的秃枝在风里晃。她端起杯子,嘴唇碰到杯沿之前,心里想了一句话——她没说出来,但每个字都清清楚楚:有些孩子,不凶两句就是不开窍。
下一个星期三,小梅弹得很好。不是「还可以」——是真的很好。练习曲一气呵成,附点节奏准得像用尺子量过的,连最难的那段跨指都没有停顿。周老师坐在琴凳旁边的靠背椅上,身体往后一靠,嘴一张——是她给过的最响亮的表扬。
「看到没有?!就是要这个手感。上星期骂你一顿是对的——你这星期回去是不是练了?」
小梅说嗯。她说嗯的时候没有抬头看老师——她正在翻下一首曲子的谱。
三月第一个星期三,小梅弹得很差。不是上次那种——不一样。上次是错,这次是散。上周表扬的那首曲子才过了几天,手指已经像不认识了。练习曲的第三段又塌了。周老师在椅子上把身体坐直——那个动作很轻,但在安静的琴房里,椅子腿蹭过地板的声响像一个很小的警报。
「一表扬你就飘。」她把保温杯放下,没喝。「上星期夸了你几句,这星期是不是又没练?」
小梅没有说嗯。她把乐谱往前翻了一页,翻到一首还没开始学的曲子。
那天下午只有小梅一个学生。周老师上完课坐在沙发上,把保温杯拧开又拧上。她脑子里有一条她从来没有怀疑过的因果链:批评等于提升,表扬等于下滑。
走廊那边,陈姨坐在前台的高脚凳上填数独。她是琴行的前台兼茶水阿姨,在这栋楼里坐了六年,六个老师的课她都听过,隔着一层薄薄的墙。墙上有块巴掌大的地方,腻子裂了一条缝——不用贴上去,坐在这把高脚凳上刚好能听见隔壁琴房的动静。她不偷听——只是坐在那里,日积月累,比任何老师都更清楚每周回课的质量像潮水一样涨落,毫无规律可循。
她抬起头,看了一眼墙上的裂缝。
傍晚关门前,陈姨把周老师琴房的垃圾袋拎了出去。桶里有一团揉皱的纸——她把纸团展开,是小梅上周的练琴记录卡。上面写了六行「一小时」,但墨水是同一个颜色——一次写完的。
陈姨把纸重新揉成团,扔进黑色垃圾袋。风推开走廊尽头的窗,把墙上的海报吹得啪啪响了一下。
春分过后,泡桐开始发芽。周老师的星期三轮到了,小梅像往常一样背着书包推开了玻璃门。
表现不会在极端间跳跃,它总是在回归均值。
核心定义
回归谬误是指这样一种推理错误:当一个变量在一次测量中出现了极端值(特别好或特别差),下一次测量时它自然地朝平均值方向回落,而观察者错误地将这种回落归因于某种外部干预——批评、奖励、政策、治疗——而非统计学上的必然趋势。它的核心机制是:把「均值回归」这个纯粹的统计现象,错误地编码为「X 导致了 Y」的因果叙事——因为大脑不能接受「没有原因的变化」。
回归现象由英国科学家弗朗西斯·高尔顿在 1886 年首次系统描述。他在研究豌豆和人类身高的遗传规律时发现:特别高的父母,孩子的身高倾向于比父母矮(更接近平均值);特别矮的父母,孩子倾向于更高。高尔顿将这个现象命名为「回归到平庸」,并在后续几十年里反复论证这不是生物学上的退化,而是任何一个存在双向因果和随机波动的系统都会自然呈现的统计规律。一个世纪后,阿莫斯·特沃斯基和丹尼尔·卡尼曼在 1974 年的经典论文中证实:即使是受过统计训练的人,在真实场景中也会系统性地忽略均值回归——他们会为每一次「反弹」或「回落」寻找一个故事,而那个故事几乎从不包含「纯属统计波动」这个选项。
回归谬误之所以危险,不是因为它的因果推断是错的——在复杂世界中,大部分因果推断都可能出错。它的危险在于:每一次「碰巧正确」的干预都会强化一个错误的信念。当一个学生考砸后被骂、下次考好了,当一只股票暴跌后你买它、第二天涨了,当一种疗法在症状最严重时使用、随后症状减轻了——大脑接收到的信号不是「统计回归发生过一次」,而是「我的方法生效了一次」。而每一次「生效」都在为下一次更坚定的干预充值——直到某一天,回归不再眷顾,而你手里的方法已经变成了一个你深信不疑的真理。
边界上,回归谬误不是一般的「前后相继就当因果」,它只发生在一个变量先出现极端值、随后自然回到较常见范围的场景里。后此谬误关注的是时间先后,回归谬误关注的是极端值之后的统计回落;单因谬误关注原因数量被压缩,回归谬误关注的是本来未必需要外部原因的变化被强行归功于某个干预。
高尔顿最初用「回归」这个词时,是在描述一个纯粹的生物学现象——他测量了亲子身高的数据之后,在散点图上发现了一种「斜向平均数」的趋势。后来「回归」被统计学家借用为回归分析的术语,而「均值回归」则保留为对原始现象的指称。卡尼曼在《思考,快与慢》中回忆过一个让他醍醐灌顶的时刻:他在给以色列空军飞行教官做讲座时,一位教官告诉他「每次表扬之后飞行员的表现都会变差,而批评之后就会改善」。卡尼曼当场意识到——这不是批评有效,而是均值回归在上演。教官们把天然的统计波动当成了自己管理风格的勋章,而这个勋章他们已经反复佩戴了数十年。
常见表现形式
「批评有效」幻觉
在表现最差的时候施加负面反馈,随后表现回升——把回归均值当成批评的疗效。
「表扬无效」幻觉
在表现最好的时候给予正面反馈,随后自然回落——把回归均值当成表扬让当事人松懈了。
「疗法应验」错觉
在症状最严重的时刻开始一种新疗法,随后症状减轻——把病程的自然波动当成治疗的因果关系。
真实案例
那个「不骂不成器」的古老信条
一个初中男生在一次月考中数学只考了五十八分——这是他整个学期的最低点。母亲在餐桌上沉默了一整顿晚饭,最后放下筷子说了一句:「从今天起,手机没收两个月。」男孩没有顶嘴。他把自己关在房间里做了一个月的题——不是自己想做的,是怕下一次如果再考砸,不但是手机,连周末出门的权利都会一起消失。一个月后的月考,他考了七十一分。母亲在微信群里发了一条消息:「我跟你说,这孩子就是欠管——骂一顿,成绩就上去了。」她没有想过另一种可能:五十八分本来就是他成绩波动曲线上的一个偶然谷底,什么都不做,下一次也会回升到七十分附近。而如果更诚实地看这两次考试——五十八分的那张卷子后面有两道超纲题,七十一分的那张卷子题型恰好是他暑假补过的内容——分数的起伏和她的管教之间,可能连一条虚线都画不出来。但她不需要这些信息。她手里已经握着一个更坚硬的结论:骂是有用的。
「这孩子就是欠骂——你看,上次我发完火,这次就涨了十几分。」那个「果然有效」的民间偏方
一个长期受腰痛困扰的中年人,在某个周六早上醒来时发现疼得特别厉害——翻身都要咬着牙。他在网上搜到一个偏方:艾草煮水热敷,每天两次,连敷七天。他当天下午就去药铺买了艾草,从那天晚上开始敷。第三天早上醒来,腰好像没那么疼了。第七天,他已经可以弯腰系鞋带了。他把剩下的艾草分给了一个同样腰疼的邻居:「相信我,敷上就好。」他没有想过——腰痛本来就有好日子和坏日子,坏日子的时候什么都想试,而不管试什么,接下去的几天都有不小的概率会自然好转——因为在某个极端糟糕的疼痛日之后,身体自身的修复机制和疼痛的随机波动都倾向于把状态往回拉。他在最疼的那天开始敷草药,然后疼痛减轻了——这两件事在时间上相连,但在因果上可能毫无关系。艾草也许真的有一点温热舒缓的作用,但「敷七天痊愈」这个结论,需要的证据远比一次从波谷往平均值回归的个人经历要多得多。
「我腰疼这么多年,就这个方子真的有用——敷了三天就不疼了,自己能翻身。」那个「抄底就涨」的自我叙事
一个个人投资者盯着某只股票看了两个月。它从十二块跌到六块五——几乎腰斩。她在六块五的时候买了进去,理由是「已经跌太多了——不可能再往下走」。第二天,股票涨到七块。第三天,七块三。她在心里给自己发了一枚勋章:「我看对了——底部就是六块五,买在最低点。」第八天,股票跌到了五块八。她的解释是:「这是主力在洗盘——把不坚定的筹码洗出去之后就会拉起来了。信我,我上次六块五抄进去第二天就涨了。」她没有想过:六块五到七块的那次「反弹」,可能只是这只股票日均波动的一部分——它本来就在每天上下几个百分点地晃,她恰好在某一次下晃的末端买了,然后在某一次上晃的末端兑现了信心。这次「成功」不是她判断力的验证,而是回归谬误给她编排的一出微型话剧——而她既是编剧,也是唯一的观众。
「上次跌到六块五我一买就涨——这次跌到五块八,我再补一仓。错不了。」正误对照
一对夫妇在客厅看儿子的成绩单。期中考试数学四十三分,是孩子入学以来的历史最低。妈妈急得当天晚上就找了家教。一个半月后的单元测验,数学考了六十四分。妈妈把卷子放在餐桌上,等丈夫下班。
运作机制
归因本能
人类大脑是一台因果引擎。在自然环境中,一个事物从极端状态回到普通状态——河水从暴涨退到正常水位、猎物从突然消失到重新出现——几乎总是有原因的,而这个原因几乎总是值得找出来的。我们的大脑进化出了一套默认设置:当观察到一个显著的变化,自动启动因果搜索,直到找到一个看起来合理的原因。问题在于,均值回归不需要任何原因——它是任何一个包含随机波动的系统中都会自然出现的数学现象,就像抛硬币不会只出现正面。但大脑不接受这个解释——「自然回落」不是一个事件,它没有主语,没有意图,没有任何东西「做了」任何事。它无法被编成一个故事。因此大脑会从它视野所及的任何事件中——批评、表扬、药物、祈祷、政策、发火——挑出一个和变化在时间上接近的,把它任命为原因。这个任命是自动的,不是故意的——你不会觉得自己在编故事,你会真诚地觉得「我发现了规律」。
选择记忆
回归谬误一旦在一个人的认知中建立了因果信念,接下来发生的事不是这个信念被数据修正,而是它被社会传播加固。当一个老师相信「批评之后表现必然提升」,她会在办公室里向同事分享那些「骂完就考好了」的例子——每一次分享都会收到同事的点头、附和、以及「我班上也有一个这样的」回馈。而「骂完下次考得更差」的例子不会进入这些对话——不是故意隐瞒,而是这些例子不符合叙事模式,被大脑在记忆检索阶段自动过滤掉了。社会心理学家将这种现象称为「共享现实的共建」:当一个信念在一个群体中被反复讲述,它的每一个传播者都变相地替它删除了反例——不是由某一个人来删,而是叙事结构自己就把不符合故事框架的数据甩出了谈话流。
行为自证
回归谬误最隐蔽的后果是:它不仅仅是一个认知错误——它还会改变行为,使行为创造出支持谬误的证据。当一个管理者相信「业绩最差时严厉批评最有效」,他会选择在员工表现最糟糕的时候施加最大力度的批评。而均值回归决定了:在表现最差之后,下一次表现大概率会好一些。管理者看到批评之后的改善,愈发相信批评的效力,下一次批评来得更早、更重。员工呢?在被反复批评之后,表现的真实平均值可能在下滑——但因为管理者每次都在谷底介入,而每次介入之后的下一次都因回归而显得有所回升,管理者的因果叙事从不会断裂。他甚至会得出一个更极端的结论:「我一放松他们就下滑,我一严厉他们就上升。」他看不到的是:他的严厉正在伤害真实的表现水平,只是回归谬误替他把每一次伤害包装成了拯救。
信号识别
见效冲动
你在施加了一个干预之后——批评、奖励、换药、买入——观察到结果朝你期望的方向发生了变化。你嘴里涌上来的第一个感觉是「果然有效」。注意这个「果然」——它不是一个推理结论,而是一个情感结算。它在替你把两件时间上相邻的事焊在一起,而你还没来得及问一句「如果不这么做呢」。
典型话语:「你看,我上周跟他说完——这不就好了?」
偏向记录
回想你最近的决策记录——有没有任何一次,你在表现最差时出手,之后表现了更差?大概率有,但你记不太清了。因为大脑把「干预有效」的案例存放在一个特别加固的记忆区,而把「干预无效」的案例随手扔在短期记忆的某个角落,几周后就找不到检索路径了。这种选择性留存的证据格局,就是回归谬误最忠实的共谋。
典型感受:你说得出每一次「骂完之后就变好」的例子,但让你说出一次「骂完之后更差」的例子——你要想很久。
极端特化
在复盘的对话中,你发现自己(或别人)对某个「历史最低」或「历史最高」的数据点格外在意——不是把它当成波动中的一个正常采样,而是把它当成需要被一整个因果故事填满的「关键事件」。四十三分不是「一次低分」,而是「那次他发烧了」「那次他没复习」「那次之后我做了某个决定」。每一个极端值都被赋予了叙事权重——但真正的随机波动,从来不会因为你在上面写了一篇小作文就变成因果信号。
典型话语:「那次肯定是触底了——我就是从那次之后开始盯他做作业的,你看到没有,后面就一直往上走。」
信心不配
一个强烈的回归谬误信号是:你的信心增长曲线和证据的积累曲线是反向的。当只有一次「干预→改善」的案例时,你的信心可能并不强;但到了第三次「干预→改善」的案例出现时,你的信心已经坚如磐石——可这三个案例加在一起的证据力,和三枚正面朝上的硬币说不了同一件事。真正的因果证据需要对照、需要重复、需要排除其他解释——而回归谬误建立的信心只需要时间。
典型感受:你用三次「果然」就把一件事从一个猜想变成了一个铁律——而三次加在一起的统计说服力,和一个中学生抛十次硬币得出的结论差不多。
应对策略
反事实问
每次你因为一个干预后的改善而产生「果然有效」的快感时,停一秒,做一个小型的反事实推演:如果在我施加干预的那一刻,我什么都没做——什么话都没说、什么药都没用、什么操作都没执行——它下一次会怎么样?如果它在统计上有不小的概率也会朝平均值方向移动(而它几乎总是有这个概率),那么「干预→改善」这个因果链条就还没有被建立——它只是没有被挑战。不是因为干预有效,而是因为你没有给「无效」一个被观察到的机会。
自问:「如果上星期那次我没管,它会自己变好——还是会更差?」
对照记录
行为层最有效的干预,是给回归谬误制造一个它最怕的东西——对照记录。在你的日常决策中,为任何一种你定期施加的干预(批评、奖励、调仓、换药)建立一份双列记录:左列写「干预之后发生了什么」,右列写「没有干预的时候发生了什么」。右列的数据不会自己来找你——你需要主动去记、去看、去想那些「什么都没做」的时期。如果你发现没有干预的时期,表现同样在上下波动——而且波动的幅度和频率与有干预的时期没有本质区别——你的干预可能没有你认为的那样有效。
自问:「在我的记录本上,『什么都没做』那个时期的结果——和『做了一件事』之后的相比,差别在哪儿?」
延迟判定
系统层的防护不需要复杂——它需要的是一段缓冲期。任何在极端事件之后立刻实施的干预,其效果必须至少等到第三次测量之后才能做初步判断。第一次是极端点(触发干预),第二次是回归后的点(可能是回归,也可能是效果),第三次才是真正有区分力的数据点。如果你在第二次之后就下了结论,你只是在追着均值回归的影子跑。这条规则的底层逻辑非常朴素:一次数据点不够区分「波动」和「趋势」——而极端点之后的那一次,是区分力最弱的一次。让子弹飞一轮再判断。
自问:「我现在觉得『有效』——如果再等一次结果,我的这个感觉还会这么强烈吗?」
什么都不做,它也会变好;骂了一顿,它果然变好了。这二者之间,隔着的不是因果关系,而是一个我们不愿意认领的解释:巧合穿着因果关系的外套,走了很久,我们也没认出来。
—— —思辨录 · 回归谬误