数学与统计 · 3/12
贝叶斯更新Bayesian Updating
新证据让旧判断的赔率乘以似然比,改变相信它的程度。
日食照片中星光偏转的幅度,让爱因斯坦的理论更值得相信。1919年5月29日,英国天文学家爱丁顿在非洲西岸的普林西比岛观测日全食。月亮挡住太阳后,他能拍到太阳附近的恒星,比较它们的位置是否偏移。关键在于偏移多少:广义相对论预测的幅度,是当时按牛顿理论计算结果的两倍。爱丁顿团队与巴西另一支观测队最终采纳的数据支持了前者。同样一张照片,两种理论对它的预料不同,它才有力量改变人们的判断。
为什么成立
同一条证据,在不同解释下分量不同
路由器亮红灯,该让你多相信它坏了?假设维修记录显示,断网时有20%的机会是路由器故障。路由器故障时,80%会亮红灯;其他原因导致断网时,20%也会亮红灯。
把这些比例放进100次断网,变化就看得见。20次路由器故障中,16次亮红灯。80次其他故障中,也有16次亮红灯。看到红灯后,路由器故障的概率便从20%升到50%:红灯案例中,两种原因各占一半。
更新幅度由两种解释的预测之比决定
贝叶斯更新把旧判断与证据的区分力合在一起。用表示路由器故障,表示亮红灯,表示其他原因:
白话说,看到证据后的支持与反对之比,等于原来的比值乘以似然比。这里原来是1比4,红灯在故障时出现的机会是其他原因的4倍,更新后就成了1比1。似然比等于1,证据不改变判断;大于1支持它,小于1削弱它。
下一条证据只按新增的信息计分
连续更新时,上一次的结果就是下一次的起点。若又收到故障短信,要比较已经看到红灯后,两种解释各有多大机会产生这条短信。短信若只是转发同一报警,就不能再按一份独立证据乘一次。
出处
贝叶斯更新来自概率论与统计学。1763年,理查德·普赖斯整理发表托马斯·贝叶斯的遗稿,讨论怎样从观察结果推断未知概率。拉普拉斯随后独立发展并推广了这套方法。它由条件概率关系推导而来;1919年的日食观测,是比较不同理论对同一证据预测的著名案例。
换个领域看
技术
词语改变邮件判断
邮件里的词,只有在垃圾邮件和正常邮件中出现频率差得够大,才值得重视。2002年,程序员保罗·格雷厄姆在《A Plan for Spam》中介绍了贝叶斯垃圾邮件过滤。他用两类邮件中的词频估计证据权重:人人都写的词帮助很小,明显偏向某一类邮件的词才推动分类判断。
投资
续购比赞美有分量
客户是否原价续购,比发布会上是否夸产品更能检验需求。一位投资者考察消费品牌,听见首批买家赞不绝口:产品受欢迎与折扣诱人,都能解释这件事。折扣结束后,同一批客户继续原价购买,才更支持持续需求。更新判断时,他盯住两种解释会给出不同预测的行为。
个人生活
没找到也会更新
认真找过却没有发现,也能改变判断。准备出门的人记得自己把钥匙放进了外套口袋,便先找外套。他掏空所有衣袋,仍没找到:钥匙若在里面,这样搜很难漏掉;钥匙若掉在沙发缝里,搜衣袋当然找不到。他因此降低对口袋的怀疑,转去检查昨晚坐过的沙发。
遇事时问自己
- 看到这条消息前,我有多相信这个判断,依据是什么?
- 如果判断成立,这条证据有多容易出现;如果不成立,又有多容易出现?
- 哪些其他解释也能产生这条证据?
- 这条消息带来了新增信息,还是在重复我已经知道的事?
- 我接下来能找什么证据,让相互竞争的解释给出明显不同的预测?
边界与误用
解释漏掉了关键选项,更新就会把信心推向错误的方向。例如只比较路由器故障和线路故障,却遗漏欠费停网。经营环境改变后,旧记录也会错估证据出现的机会。缺少可靠数据时,先比较证据更支持哪种解释,别把随手猜的数字写成精确概率。最常见的误用,是只问判断成立时能否出现这条证据,忘了其他解释也能产生它。把初始概率设成零,还会让任何有限似然比都无法改变判断。更新回答的是相信多少;采取什么行动,还要看行动的收益和代价。
练一练
公司用检测器筛查代码提交。历史上,10%的提交有安全漏洞。有漏洞时,检测器有80%的机会报警;没有漏洞时,也有20%的机会报警。今天一份提交触发了报警,检测器和提交来源都没有变化。
这份提交有安全漏洞的概率,哪种判断最站得住?
历史比例提供了稳定的判断起点。但有漏洞时更容易报警,这次报警提高了这份提交有漏洞的可能性。
两种情况都可能,容易让人觉得各占一半。但两类提交的数量和报警机会不同,报警后的占比也不同。
按100份提交算,有漏洞的提交贡献8次报警,没有漏洞的提交贡献18次报警。26次报警中,8次来自漏洞,约占31%。
80%很像报警的可信度。但它说的是有漏洞时多容易报警,题目问的是报警后多可能有漏洞。
报警在有漏洞时出现的机会,是没有漏洞时的4倍。原先有无漏洞的赔率为1比9,看到报警后变成4比9,对应约31%的概率。怀疑程度上升了,仍然是没有漏洞更可能。
你持有一家制造企业的股票,正在判断它能否按时交付一笔大订单。公司公告称生产线已完成调试,你据此提高了信心。随后三家财经媒体都报道了“调试完成”,你查到它们只是自动转载这份公告,没有采访客户或核查现场。
看到这三篇报道后,哪种判断最站得住?
报道增多容易让进展显得更可信。但自动转载增加的是读者数量,没有增加关于交付进度的信息。
三家媒体说法一致,很像多方验证。但它们都在转述同一份公告,把转载当验证会重复计算这条证据。
你已经读过公告,三次自动转载没有带来新的交付信息。读完公告后的判断仍是当前起点。
发现报道没有核查,容易连带怀疑原公告。但转载来源的发现没有推翻调试完成这件事,撤回原先的调整也算错了证据。
连续调整判断时,下一条消息的分量取决于它新增了什么。这里的三篇报道都重复已知公告,交付信心因此保持不变。客户验收记录或实际产出,才可能进一步区分按时交付与延期。
天气预报给出今晚30%的降雨概率,你接受这个估计。你正决定去露天音乐会还是待在家里,又想起自己刚感冒好,淋雨的代价比平时高。此时没有新的天气信息。
下面哪一步用错了卡片里的推理方法?
担心淋雨后继续查天气,容易被看成只找支持担忧的材料。但雷达带来新证据,结果可以支持上调,也可以支持下调。
刚康复让淋雨更难承受,却没有让雨更容易下。这里把后果的严重程度,当成了天气的新证据。
雨棚与是否下雨无关,容易被当成无效信息。但它改变淋雨的后果,正好帮助判断去音乐会是否合适。
没有新天气信息却改变选择,看起来像随意调整判断。但这里改变的是行动选择,降雨估计仍然保持30%。
这套方法回答事情有多可能发生,行动选择还要考虑收益和代价。这里的30%可以保持不变,而刚康复的人更倾向于留在家里。代价变化足以改变选择,无须改写天气判断。