数学与统计 · 6/12
大数定律与小样本Law of Large Numbers
独立、同分布的样本越多,比例越稳定;小样本更容易出现极端比例。
一枚接近公平的硬币,也能在短短几次投掷里显得很偏。1940 年,德国占领丹麦期间,南非数学家约翰·克里奇在丹麦开始投硬币,逐次记录结果。前十次里,正面出现了四次,比例只有四成。他没有停下来宣布硬币偏向反面,而是继续投。累计到一万次,正面共出现五千零六十七次,占 50.67%。同一枚硬币,少量记录能画出鲜明的偏向,大量记录却让比例贴近了一半。
为什么成立
每次结果在小样本里占的分量更大
投十次硬币,多一个正面就改变十个百分点;投一万次,多一个正面只改变 0.01 个百分点。小样本里的少数意外,足以把比例推得很远。对公平硬币,十次全是正面的概率是 ;一百次全是正面的概率则是 。
独立重复会压低比例的波动
设每次出现正面的概率固定为 ,各次投掷相互独立。投掷 次后,正面比例记为 ,它的标准差是:
白话说,样本量扩大四倍,比例的典型波动才缩小一半。公平硬币投一百次,比例的标准差是五个百分点;投一万次,降到半个百分点。正面次数本身仍会波动,但总次数增长得更快,偏差占整体的份额就缩小了。
大样本压低偏离的概率
大数定律说:对任何事先选定的误差范围,样本越多,比例落在范围之外的概率越趋近于零。因此,增加样本能让估计更可靠,却不保证每增加一次,结果就离真实比例更近。
小样本更容易同时占据最好和最坏的位置。若一批门店的真实成交率相同,接待人数最少的门店,更容易报出接近零或接近百分之百的成交率。只看排行榜两端,会把样本量造成的波动读成门店之间的差距。
出处
它来自概率论。雅各布·伯努利在 1713 年出版的《猜度术》中,证明了独立重复试验的成功比例会趋近固定概率;泊松在 1837 年使用“大数定律”这一名称。克里奇的一万次投币记录是经典演示,数学证明才保证结论不限于这枚硬币。
换个领域看
商业
成交率先看人数
十名访客中的两笔订单,足以让店主看到 20% 的成交率。另一家店接待一千名访客,成交一百八十笔,比例是 18%。前一家只要少一笔订单,就会跌到 10%。店主比较经营表现时,应把成交人数和访客人数一起摆出来,并给小店积累更多同类客流的时间。
公共卫生
让偶然病例变轻
1954 年,美国索尔克脊髓灰质炎疫苗试验用大量儿童的记录评估保护效果。随机安慰剂对照部分约有四十万名儿童参加。疾病并非人人都会得:若每组只有几十人,多一个病例就足以大幅改变患病率。大批记录让少数偶然病例在各组比例中占的分量更小。
个人生活
五星先数评价
只有三条评价的五星餐馆,评分很容易被下一位顾客改写。三位顾客都给五星,平均就是五分;第四位给一星,平均立刻降到四分。一家有三百条评价的餐馆,新增一条一星评价对平均分的影响小得多。挑餐馆时,把评价数量和评分一起看,才知道这个分数有多容易晃动。
遇事时问自己
- 这个亮眼或糟糕的比例,背后到底有多少次观察?
- 这些记录来自多少个独立的人或事件,有没有把重复记录当成新样本?
- 样本覆盖了我要判断的人群吗,还是只覆盖了最容易收集的一群人?
- 收集记录期间,规则、对象或成功概率有没有改变?
- 多一个成功或失败就会怎样改变比例,我能接受这么大的波动吗?
边界与误用
数量只有在样本能代表目标、各次观察足够独立、生成规律稳定时,才有助于逼近目标比例。同一人的一千次点击,不能当成一千名独立顾客;改版前后的成交记录混在一起,会估出两个时期的混合比例。抽样偏差也不会被数量洗掉:1936 年美国《文学摘要》收到约二百四十万份回信,仍错判总统选举,抽样名单和回信者都偏离了选民整体。最常见的误用是等着下一次结果补偿前面的偏差:公平硬币连出十次正面,下次正面的概率仍是二分之一。
练一练
支付系统的测试工程师用随机生成的独立请求测试接口。接口版本和请求生成规则保持不变。过去每轮测试100次,现在改为每轮400次,再比较各轮的失败比例。
关于各轮失败比例的波动,哪种判断最站得住?
每次请求的失败概率不变,听起来像是波动也不变。但这里比较的是整轮的失败比例,更多独立请求会让这个比例更稳定。
单次失败在总数中的分量确实变小了。但更多请求仍可能碰巧出现偏多或偏少的失败,不能保证每轮都更准确。
请求数增加四倍,容易让人以为波动也按四倍缩小。但比例的典型波动随样本量的平方根下降,这里约缩小到一半。
独立请求增加四倍,失败比例的标准差约减半。这降低了明显偏离真实失败率的概率,但不保证每一轮都更接近它。
接口和请求规则稳定,各次请求又独立,增加测试次数就能压低失败比例的随机波动。样本量扩大四倍,典型波动约减半;这是概率上的改善,不是每轮结果的保证。
基金经理向投资委员会展示了一套策略的600笔交易,盈利比例为72%。这些交易集中在六次央行议息公布后,每次同时买入约100只股票。同一次公布后的股票大多同涨同跌。基金经理据此把72%写成了策略未来的预期胜率。
这一步判断的主要问题在哪里?
增加交易笔数看起来能减少偶然波动。但同一次消息驱动的股票高度相关,增加股票数未必增加多少独立信息。
累计收益确实能补充盈亏幅度的信息。但换一个指标没有解决记录高度相关的问题,盈利比例本身也并非不能使用。
交易笔数多,不等于独立观察多。判断策略能否重复奏效,需要更多不同议息事件的记录,并检查市场环境是否发生变化。
分散到不同股票常能降低个别公司的影响。但这些股票受共同消息驱动,已经表现出同涨同跌,不能假定影响会抵消。
这些交易共享少数几个消息冲击,600笔记录不能直接按600次独立试验来理解。在同一事件里继续增加股票,无法同等增加证据;判断未来胜率,还要检查不同事件之间的市场条件是否稳定。
家庭聚会玩抽奖游戏。袋里有五枚大小相同的筹码,其中一枚标着奖品。你每次充分混匀后抽一枚,记录结果,再把筹码放回。连续十次没抽中奖品后,你准备再抽一次。
对下一次抽中奖品的机会,哪种判断最站得住?
长期比例会趋于稳定,容易让人以为后面必须补回欠下的中奖。但比例变稳不需要下一次中奖概率提高。
连续出现同一种结果,容易让人觉得趋势还会延续。但筹码每次放回并混匀,前面的结果没有改变下一次的条件。
少量记录确实不足以精确估计未知概率。但这里抽取规则和筹码组成已知,不必积累大量记录才判断下一次的机会。
每次都恢复为同样的五枚筹码,下一次中奖概率仍是五分之一。前面的落空不会给下一次增加补偿。
连续十次没有中奖,可以与每次20%的中奖概率同时成立。随着抽取次数增加,累计中奖比例趋于稳定,是因为旧偏差在总数中的分量变小,不是因为下一次负责补偿。