思维模型格栅

数学与统计 · 6/12

大数定律与小样本Law of Large Numbers

独立、同分布的样本越多,比例越稳定;小样本更容易出现极端比例。

一枚接近公平的硬币,也能在短短几次投掷里显得很偏。1940 年,德国占领丹麦期间,南非数学家约翰·克里奇在丹麦开始投硬币,逐次记录结果。前十次里,正面出现了四次,比例只有四成。他没有停下来宣布硬币偏向反面,而是继续投。累计到一万次,正面共出现五千零六十七次,占 50.67%。同一枚硬币,少量记录能画出鲜明的偏向,大量记录却让比例贴近了一半。

为什么成立

每次结果在小样本里占的分量更大

投十次硬币,多一个正面就改变十个百分点;投一万次,多一个正面只改变 0.01 个百分点。小样本里的少数意外,足以把比例推得很远。对公平硬币,十次全是正面的概率是 ;一百次全是正面的概率则是 。

独立重复会压低比例的波动

设每次出现正面的概率固定为 ,各次投掷相互独立。投掷 次后,正面比例记为 ,它的标准差是:

白话说,样本量扩大四倍,比例的典型波动才缩小一半。公平硬币投一百次,比例的标准差是五个百分点;投一万次,降到半个百分点。正面次数本身仍会波动,但总次数增长得更快,偏差占整体的份额就缩小了。

大样本压低偏离的概率

大数定律说:对任何事先选定的误差范围,样本越多,比例落在范围之外的概率越趋近于零。因此,增加样本能让估计更可靠,却不保证每增加一次,结果就离真实比例更近。

**小样本更容易同时占据最好和最坏的位置。**若一批门店的真实成交率相同,接待人数最少的门店,更容易报出接近零或接近百分之百的成交率。只看排行榜两端,会把样本量造成的波动读成门店之间的差距。

出处

它来自概率论。雅各布·伯努利在 1713 年出版的《猜度术》中,证明了独立重复试验的成功比例会趋近固定概率;泊松在 1837 年使用“大数定律”这一名称。克里奇的一万次投币记录是经典演示,数学证明才保证结论不限于这枚硬币。

换个领域看

商业

成交率先看人数

十名访客中的两笔订单,足以让店主看到 20% 的成交率。另一家店接待一千名访客,成交一百八十笔,比例是 18%。前一家只要少一笔订单,就会跌到 10%。店主比较经营表现时,应把成交人数和访客人数一起摆出来,并给小店积累更多同类客流的时间。

公共卫生

让偶然病例变轻

1954 年,美国索尔克脊髓灰质炎疫苗试验用大量儿童的记录评估保护效果。随机安慰剂对照部分约有四十万名儿童参加。疾病并非人人都会得:若每组只有几十人,多一个病例就足以大幅改变患病率。大批记录让少数偶然病例在各组比例中占的分量更小。

个人生活

五星先数评价

只有三条评价的五星餐馆,评分很容易被下一位顾客改写。三位顾客都给五星,平均就是五分;第四位给一星,平均立刻降到四分。一家有三百条评价的餐馆,新增一条一星评价对平均分的影响小得多。挑餐馆时,把评价数量和评分一起看,才知道这个分数有多容易晃动。

遇事时问自己

  1. 这个亮眼或糟糕的比例,背后到底有多少次观察?
  2. 这些记录来自多少个独立的人或事件,有没有把重复记录当成新样本?
  3. 样本覆盖了我要判断的人群吗,还是只覆盖了最容易收集的一群人?
  4. 收集记录期间,规则、对象或成功概率有没有改变?
  5. 多一个成功或失败就会怎样改变比例,我能接受这么大的波动吗?

边界与误用

数量只有在样本能代表目标、各次观察足够独立、生成规律稳定时,才有助于逼近目标比例。同一人的一千次点击,不能当成一千名独立顾客;改版前后的成交记录混在一起,会估出两个时期的混合比例。抽样偏差也不会被数量洗掉:1936 年美国《文学摘要》收到约二百四十万份回信,仍错判总统选举,抽样名单和回信者都偏离了选民整体。最常见的误用是等着下一次结果补偿前面的偏差:公平硬币连出十次正面,下次正面的概率仍是二分之一。

练一练

支付系统的测试工程师用随机生成的独立请求测试接口。接口版本和请求生成规则保持不变。过去每轮测试100次,现在改为每轮400次,再比较各轮的失败比例。

关于各轮失败比例的波动,哪种判断最站得住?

基金经理向投资委员会展示了一套策略的600笔交易,盈利比例为72%。这些交易集中在六次央行议息公布后,每次同时买入约100只股票。同一次公布后的股票大多同涨同跌。基金经理据此把72%写成了策略未来的预期胜率。

这一步判断的主要问题在哪里?

家庭聚会玩抽奖游戏。袋里有五枚大小相同的筹码,其中一枚标着奖品。你每次充分混匀后抽一枚,记录结果,再把筹码放回。连续十次没抽中奖品后,你准备再抽一次。

对下一次抽中奖品的机会,哪种判断最站得住?