三个朋友都说好用,你就把它当成公认的好东西了?


小数定律

我们常误以为极小的样本也能可靠地代表整体分布,从而在极少数几次结果里就急于总结出普遍规律。小数定律让我们在面对随机波动时得出错误的因果论断。

#三个朋友说好就是好#小样本就敢下结论#撞上几次就当规律
01

寓言故事

阿远从祖母手里接过那片茶园的时候,祖母只交代了一句话:「山上的事,山说了算。人的话,听一半就好。」 茶园不大,七分地,斜挂在半山腰上。茶树是祖母年轻时一棵一棵栽下去的,三十多年了,根扎得比阿远的年纪都深。每年春分过后,阿远蹲在垄上采茶,采到晌午,雾还没散尽。那种雾气是山里才有的——凉丝丝的,带着青苔和湿土的气味,从领口钻进去,贴着脊背往下走。

阿远所在的村子有个规矩:每年春天的头一茬新茶,要等三位过路的旅人来尝。第一位尝的定了香,第二位尝的定了味,第三位尝的定了价——三张口的结论,就是这一年全村茶叶的身价。

阿远第一年送茶的时候,祖母还在。那年的三位旅人——一个行脚僧、一个收山货的贩子、一个走亲戚的老太太——都说好。阿远的茶卖了好价钱,祖母笑着往他碗里多夹了一块肉。

第二年春,祖母不在了。阿远一个人炒了茶,一个人捧着茶盘站在村口,等来了三位旅人。

第一位是个走镖的,从岭南来,嘴唇干裂,一身的汗。他接过茶碗灌了一大口,皱了皱眉,说:「苦。」

阿远心里一沉。

第二位是个卖布的,从江南来,说话慢条斯理。他端起碗闻了闻,抿了一小口,放下碗,说:「涩。你们这边的水是不是偏硬?」

阿远握着茶盘的手紧了紧。

第三位是个赶考的秀才。他喝得很慢,闭了一会儿眼,像在品味。阿远盯着他的嘴唇等了很久。秀才睁开眼,说:「还行吧——不算好。」

三个旅人,没有一个说好。

那天傍晚,阿远把炒好的新茶从竹篓里倒出来,摊在院子里,对着最后的天光看了很久。茶叶蜷缩着,墨绿色,细看能看见叶背上细细的白毫——和祖母在的时候一模一样。他闻了闻,还是那个气味:炒豆子的焦香混着兰花的清甜。他看不出哪里苦,哪里涩。但那三个人都说不好。

他重新把茶叶收进篓子里,盖上一块粗布。进屋的时候,妻子正在灶前添柴,抬头看了他一眼,说:「今年的茶,我喝着跟去年没差。」

阿远没接话。一个人的舌头和三个人的舌头,他觉得不一样。

消息传开了。邻村的茶贩子来了,翻了翻阿远的茶叶,说:「听说今年你们村的茶不太好?那价钱得降一降——至少降三成。」

阿远说:「你先尝尝。」

茶贩子摆摆手:「三个人都说不好,我还尝什么。」

阿远看着茶贩子的背影消失在村口的竹林后面。他低下头,发现自己的手指把茶篓的篾条抠出了一个小洞。

秋天的时候,一个远方的茶商路过村子。他不认识阿远,没听说过那三位旅人的话。他坐在阿远家的院子里,阿远给他泡了一壶。茶商喝了一口,没说话。又喝了一口。第三口的时候,他放下杯子,问:「你这茶,还剩下多少?我全要了——按去年的价。」

阿远愣住了。他张了张嘴,想告诉他那三个人说过的话。但他没说出口。

那天夜里,阿远坐在院子里,月光把茶树照得发白。他想起祖母的话——「人的话,听一半就好。」但他已经听了三个人的话,听了整整半年。那半年的每一个早晨,他走进茶园的时候都觉得自己的茶不够好。他甚至想过,等春天再来,就把老茶树砍了,换一批新苗。

他没砍。

来年开春,茶芽照常冒了出来。阿远站在茶园里,看着雾从山坳里升起来——和去年一模一样,露水挂在叶尖上,亮晶晶的,像祖母眼睛里那一点光。

几只手拣出来的石子,不能替代整条河床的颜色。

02

核心定义

小数定律是指我们在面对少量数据时,系统性地高估了小样本对整体(即「总体」)的代表能力——我们会从寥寥几个例子中自信地推出「这就是规律」,而忽略了样本量越小、抽样误差越大的基本统计事实。它的核心机制是:大脑把「局部看起来像什么」当成了「整体就是什么」,而完全不问一句「这个局部够大吗」。

这一概念由心理学家阿莫斯·特沃斯基(Amos Tversky)与丹尼尔·卡尼曼(Daniel Kahneman)于 1971 年在《心理学公报》上以一篇仅六页的论文首次提出——标题就叫《对小数字法则的信念》。他们在这篇影响了整个行为科学走向的短文中指出了一个令人惊讶的事实:即使是受过良好统计训练的研究者,也会在日常生活中——甚至在研究设计中——对小样本的稳定性抱有不切实际的期望。我们默认小样本应该「像」大样本那样表现出总体的特征:分布均匀、均值居中、没有极端值。但真实的统计规律恰恰相反:样本越小,波动越大,越容易出现看似「有意味」的偏态。人们不是不会算——是在算之前就相信了小数字不会骗人。

小数定律之所以危险,不是因为人们不懂大数定律(即在足够大的样本下,结果会稳定趋近真实概率),而是因为它在日常直觉里伪装成了大数定律的样子。大数定律说的是「数据多了就能接近真相」,小数定律却悄悄替换成「数据少也能代表真相」。我们不是在怀疑中作判断——我们在自信中犯错误。

来源

「小数定律」这个名称本身就是一个精妙的讽刺:它是对统计学中「大数定律」(Law of Large Numbers)的戏仿。大数定律告诉我们,当样本量趋于无穷时,样本均值会收敛到总体的真实均值——这是一条数学定理。而「小数定律」不是定理,是一种认知幻觉:我们错误地认为小数也可以依赖。特沃斯基与卡尼曼在论文中以一句著名的话作为开篇:「人们对于随机抽样的直觉,似乎满足一条法则——小数字法则。这条法则断言:大数定律同样适用于小数。」

常见表现形式

过早推广

对某件事观察了两三次——三个产品评价、两个面试者、一个地区的几家餐厅——就形成了一条「规律」,并据此做出影响较大的决策。

统计显著性迷信

看到一项研究「统计显著」就全盘接受结论,却不过问样本量是多少、效应量有多大——忘记了在小样本中,一次偶然的波动也可能产生「显著」的结果。

教练谬误

在体育或管理中,因为一位球员连续几场表现出色(或低迷),就断定他的「状态」已经发生了根本变化——而这几场的样本量,远不足以区分真正的能力变化和正常的随机波动。

教师错觉

老师教了两三个班之后,就形成对「这一届学生」的定论,并据此调整教学策略——而三个班四个月的样本,远不足以概括一届学生的全貌。

03

真实案例

消费

那个被三条差评判了死刑的耳机

你在网上看中一副降噪耳机,好评率百分之九十二,近三千条评价。但你不看总评分——你点开了「最新评价」,前三页恰好是三条清一色的差评:「左耳三天就坏了」「戴着不舒服」「降噪是假的」。你往下翻了两页,心里已经有了结论:这副耳机不行。你划走了。但你不知道的是:差评只占总量的百分之八,而剩下百分之九十二的满意用户,大多数根本没有回来写评价。你用三只手拣出来的石子,判断了整个河床的颜色。

「连续三条都说不好,还能有假?」

社会认知

那个被你定型的「南方人」

你换了一份工作,新团队里有三个同事恰好都来自同一个南方省份。两三个月下来,你发现这三个人做事都不太着急——提交方案总是踩点、回复消息总是过很久。你在心里默默贴了一张标签:「这个省的人,节奏偏慢。」后来公司又招进来两个同省的同事,做事利落得让你吃惊。但你的第一印象已经种下去了——你觉得这两个人是「例外」。你没想过的是:三个人的行为模式,连五百万人口的万分之一都不到。

「我见过的几个,都这样。」

职场

那所被一票否决的大学

你是招聘主管,去年你们部门招了三位来自同一所学校的应届生。前三到六个月的试用期里,这三个人的表现都不太理想——主动性不够、交付质量平平。今年校招季,简历池里又出现了那所学校的学生。你扫了一眼,把整沓简历抽出来,放到了「备选」那一摞。你对自己说「这所学校的质量不行」。但你从未问过自己:三位毕业生能代表这所学校每年两千名毕业生的水准吗?那三个人刚好是那一届的底部——这件事的概率有多大?

「连踩了三次坑,还不够说明问题?」
04

正误对照

场景

你刚搬到一个新城市,和同事聊起找餐厅的事。同事问你觉得这边吃的怎么样,你说不怎么样——来了一周,试了四家,三家踩雷。同事说他在这住了五年,好吃的多得很。你坚持你的判断。

小数定律主导
同事你才来一周,就试了四家,这结论下得也太快了吧?
四家还少?三家都不好吃,比例都百分之七十五了。这一片就是不行。我上次去的那个商圈也是,吃了两次全踩雷。这个城市的餐饮水平就这德性。
你把四家餐厅的表现当成了整个城市餐饮的「抽样调查」——但四这个样本量,折算下来连千分之一的覆盖面都不到。更关键的是,你的「百分之七十五」在只有四个样本的情况下完全可能是随机波动:再随机抽四家,可能四家都好吃,也可能继续踩雷——样本量越小,比例的稳定性越差。你用了一个没有统计意义的「小数字」,推出了一条斩钉截铁的「大结论」。
理性回应
同事你才来一周,就试了四家,这结论下得也太快了吧?
你说得对,四家确实不能说明什么。不过目前踩雷比例确实有点高——可能是我挑店的口味还没对上。你有什么推荐的?我先多试几家再说。
你没有否认自己的体验(三家不好吃是事实),但你没有把四家店的体验升格为对整个城市餐饮水平的判断。你保留了自己的感受,同时承认了样本的局限性——「再多试几家再说」意味着你在主动扩大样本量,而不是在四家的基础上原地推导。
05

运作机制

01

进化根源

在人类长达数百万年的演化史中,我们的祖先生活在小规模群体里——一个狩猎采集部落通常只有几十人。在那个世界里,你不需要「大数据」:你见过三只老虎,它们都吃人,那么「老虎吃人」就是一条高可信度的知识。你尝过两种红色的野果,都让你拉肚子,那么「红果子不能吃」就是一条救命法则。在祖先的环境中,样本量小不是一个缺陷——因为环境本身的同质性高、变数少,小样本确实能较好地代表整体。大脑演化出了一套默认设定:看到的几个例子 = 真实的总体特征。这套设定在更新世大草原上管用了三百万年。但在今天的世界——城市、市场、网络——同一条默认设定,让我们把三个差评当作了整个产品的质量报告。


02

认知惯性

小数定律还有一个自我锁定的特点:它不只是让你在小样本上做出判断,它还让你不再去寻找更大的样本。当你已经根据三个例子形成了「这城市餐饮不行」的结论,你就不再主动去试第五家、第十家——因为你「已经知道了」。更糟的是,如果你偶然碰到了一家好的,你会把它归类为「例外」而非「反例」,从而保护最初的结论不被修正。认知心理学中有一个经典范式:人们在收到第一波有限信息之后,即使后来获得了更大的样本数据,对最初判断的调整幅度也远远不够——因为大脑已经在有限的「地基」上盖好了一座完整的信念大厦,拆掉它比盖它的时候费力得多。


03

直觉替代

特沃斯基与卡尼曼最深刻的洞察之一是:大脑判断「规律存不存在」时,依靠的是一个完全错误的标准——不是「数据够不够多」,而是「数据看起来像不像规律」。如果三组数据排列出了一种清晰的模式——比如三个同事都反应慢、三条评价都说耳机坏了、三个面试者都表现不佳——这个模式的「清晰度」就被大脑当作了「可信度」的替代品。模式越清晰,我们越觉得它「肯定是真的」,而完全不会去想:在一个足够小的样本里,任何清晰的模式都可能只是偶然。大脑没有内置的样本量警报器——它不会在你说出「这个城市餐饮不行」的时候,自动弹出一条提醒:「警告:当前判断基于四个数据点。」

06

信号识别

01

连次抽象

当你或他人在用「最近几次」「连续几回」「我碰到的几个都」这类短语来支撑一个判断时,问一个简单的问题:到底是几次?是三,还是三十?如果答案小于十,这个判断的统计底座就是一盘散沙。

典型话语:「最近试了好几家,都不太行。」——「好几家」到底是几家?

02

过度确信

你发现一个人(或者你自己)对某个事物——一个品牌、一群人、一座城市、一门学科——的判断非常斩钉截铁,但追问之下,支撑这个判断的「实际接触」只有寥寥几次。判断的语义强度是「九成确定」,但接触次数只有三五次——这个落差本身就是小数定律的签名。

典型感受:我很确定这东西不好。但要我说出具体用过几次——好像也就两三次。

03

抗拒扩样

当有人提醒「你这个结论样本太小了」时,你的第一反应不是好奇「那更大的样本是什么样的」,而是防御:「够了够了」「这几下还不够说明问题吗」「再来一次也一样」。这种对样本扩充的本能抵触,说明你的判断已经从小样本的「临时结论」升级成了「需要被保护的身份标签」。

典型话语:「试了三次还不行?那就不用再试了。」

04

情感替代

某个判断之所以让你觉得不可动摇,不是因为数据多,而是因为那几个数据的情感冲击力大——比如差评写得特别愤怒、踩雷的那顿饭让你胃疼了一晚上、那个同事的慢让你当众出了丑。情感强度在记忆中被自动翻译成了「证据强度」——大脑觉得「我记得特别清楚」,所以「这件事一定正确」。

典型感受:虽然只有两三次,但那几次给我留下的印象太深了——不会错的。

07

应对策略

01

数量透明

小数定律最常用的花招,是让我们用模糊的数量词——「好几个」「一些」「不少」——来掩盖样本的真实大小。下次当你准备根据个人经验下一个判断时,先在脑中(或纸上)把那个模糊的数量词换成具体的数字:不是「试了好几家」,而是「试了四家」。然后问自己:四个,够吗?这个动作本身就能把判断的「温度」降下来——数字是冷的,而小数定律需要热乎乎的感觉才能运作。

自问:「支撑我现在这个判断的,到底有几个例子?我把数字说出来——说完之后,我还那么确定吗?」

02

人为扩样

小数定律之所以能悄悄锁死判断,是因为我们在「觉得够了」的那一刻就停止了收集信息。给自己设一条规则:在任何基于个人经验的重要判断成型之后,强制额外收集一个数据点——不多,就一个。不是四个变成四十个,而是四个变成五个。这一个额外数据点的力量不在于它本身,而在于它打断了「到此为止」的惯性——它让你在已经关上的门上重新推开了一条缝。

自问:「在我已经认定结论之后,再多试一次,会不会不一样?」

03

设定门槛

最有效的防御发生在偏见还没来得及动手脚的时候。在一项决策开始——比如你决定搬到新城市、换行业、做投资、选学校——时,就先给自己定一个「样本最小门槛」:在对这件事下结论之前,我至少要试多少次?不是泛泛的「多试几次」,而是一个具体的数字:十家餐厅之后再说这个城市好不好吃、见过十个同事之后再判断团队文化、观察三个月之后再评估一个新人的能力。这个数字本身不需要科学精确——它只需要存在。它的存在,意味着你给大脑的「自动完成」按钮装了一把锁。

自问:「当初我给自己定的那个最小样本量,到了吗?还要再攒几个才能下结论?」

我们最自信的判断,往往建立在不足以承载它们的证据之上——不是因为我们太傲慢,而是因为我们忘了问:手里这几片叶子,真的能代表整座山吗。

—— —思辨录 · 小数定律

09

参考文献