数学与统计 · 9/12
相关不等于因果Correlation vs Causation
两件事一起变化,不代表改变其中一件就能让另一件跟着变。
同一条街上的居民,喝哪家的水,比住在哪里更能解释谁染上霍乱。1854 年,伦敦苏豪区暴发霍乱,医生约翰·斯诺依据死亡地址和饮水查访,锁定了宽街水泵。当时流行的解释是污浊空气致病。附近啤酒厂的工人不饮用宽街水泵水,病例很少;一位住在远处、仍让人送来宽街井水的妇女却染病去世。9 月 7 日,斯诺向地方当局陈述调查结果,次日水泵把手被拆除,但疫情此前已开始回落。真正有说服力的,是那些把喝水与居住地点拆开看的对照。
为什么成立
看见两件事相伴,距离找到原因还差一步
吃冰淇淋的人多时,溺水的人也多。相关描述的是两个量一起变化;因果问的是,主动改变一个量,会不会改变另一个。若减少冰淇淋销售,游泳者并不会因此远离水边。
第三个因素能让两件事一起变化
炎热天气既让人买冰淇淋,也让人下水游泳。天气就是混杂变量:它同时影响我们观察的两件事,使它们看起来彼此推动。只比较冰淇淋销量和溺水人数,就把共同原因漏掉了。
箭头倒过来,也能产生同样的相关
加班最多的团队,项目延期也最多。加班能拖慢工作,项目快延期也能逼人加班。两条路径都能留下相似的数据;知道谁先发生、谁因什么采取行动,才有助于判断箭头朝哪边。
毫无联系的曲线,也会偶然同涨同跌
把许多互不相干的指标两两比较,总能找到几条走势很像的曲线。如果先找到相似走势,再编故事解释,就把偶然配对当成了因果证据。
随机分组让比较更接近“只改变一件事”
测试新药时,用随机方式分配新药和安慰剂,再比较疗效。随机分配让分组不受病情、收入或医生偏好支配,已知和未知的混杂因素因此在平均意义上得到平衡。两组接受相同照护,才能把疗效差异归于分配的治疗。单次实验仍会偶然分得不均,所以结果还要报告不确定程度。
出处
这一模型来自统计学与因果推断,并无单一提出者。皮尔逊在十九世纪末推动了现代相关分析;费舍尔在二十世纪二三十年代系统发展随机化实验设计。1948 年英国医学研究委员会发表的链霉素治疗肺结核试验,是现代随机对照试验的经典里程碑。
换个领域看
医学
把饮食拆开比较
把不同治疗放在相近条件下比较,能更直接地检验疗效。据林德 1753 年的记述,他于 1747 年在“索尔兹伯里号”上把十二名坏血病水手分成六对,给予不同食物或药物,柑橘组恢复最快。同期船上记录未能独立印证,试验真实性存在争议。他描述的比较没有现代随机分组,却展示了如何在共同生活条件下检验不同治疗。
工作
救火的人更忙
故障多的项目获得更多支援,会让支援人数与故障次数一起上升。技术主管看到这组数据,若削减支援,就把项目出问题后的应对当成了问题的起因。沿时间线查看:故障先出现,主管随后调人。要检验支援有没有帮助,可以在条件相近的项目中随机安排额外支援,再比较后续故障。
投资
漂亮曲线会骗人
从大量指标里挑出的同步走势,足以让毫无联系的事看起来像交易信号。投资者翻找天气、比赛结果和商品销量,发现一条与股指同涨同跌的曲线,便据此买卖。更有力的检验,是先固定指标、时间窗口和交易规则,再观察后续数据;若它只能解释挑选它的那段历史,就没有证据支持这套交易依据。
遇事时问自己
- 我想做的具体改变是什么,现有证据测到的是这个改变的效果,还是两件事相伴发生?
- 有什么第三个因素,能同时推动我观察到的两件事?
- 有没有可能是结果先出现,才促使人们采取了我以为的原因?
- 这条关系是事先提出的,还是比较许多指标后挑出来的?
- 我能否随机安排谁接受改变,让两组获得相同照护,并事先确定要比较的结果?
边界与误用
只需预测时,稳定的相关也有价值:乌云能帮助判断是否带伞;想改变结果时,才必须追问因果。随机试验也有边界:不能为了研究吸烟而要求人吸烟,参与者之间相互影响、退出或不按分组执行,也会妨碍比较。此时可用自然实验、时间顺序和不同来源的证据共同判断。随机试验得出的效果只覆盖所研究的人群、做法和观察期限。最常见的误用,是用“相关不等于因果”一口否定证据;它要求查清原因,而非停止判断。
练一练
电商平台的售后主管把客服随机分成两组,一组获得投诉沟通课名额,另一组照常工作。三个月后,课程组有三成人中途退课。主管只比较结课者和另一组全体客服,发现结课者的客户评分更高,准备扩大培训。
哪一步最能帮助主管判断,提供课程名额是否有效?
增加人数能减少偶然波动。但结课者可能本来就更积极,扩大样本不能消除这种人员差异。
出勤稳定看起来能让比较更公平。但按分组后的表现筛人,可能让两组留下不同类型的客服,破坏原来的可比性。
这保留了随机分组带来的可比性,检验的是提供课程名额的效果。中途退课也是实际推行培训时会发生的事。
前后比较能看见个人变化。但投诉难度、工作经验和促销活动也会变化,评分提高未必来自课程。
随机分组后只留下结课者,就重新引入了人员差异。按最初分组比较,才能保留随机分配的优势,判断提供课程名额是否改善客户评分;这与完成课程本身的效果是两个问题。
一名基金经理注意到,一家冷链设备上市公司的董事长连续增持股票,两个季度后公司利润明显增长。他认为增持推动了经营改善。查阅公告后,他发现新增利润主要来自一批港口冷库订单,而订单签订和扩产都发生在增持之前。
哪种判断最站得住?
排除增持记录看起来能避免误判。但增持仍可能反映管理层对未来利润的预期,作用未明不等于信息无用。
先增持、后公布利润,容易让人联想到激励带来的改善。但订单和扩产更早已落实,公布顺序不能代表原因发生的顺序。
已落实的订单可能既带来利润增长,也促使董事长增持。要区分经营改善的原因与管理层对改善的反应。
同行反复出现同样的顺序,看起来能加强证据。但管理层可能都在预见利润增长后增持,重复的顺序仍不能确定作用方向。
利润公布较晚,不代表经营改善较晚才开始。已经签订的订单可能先形成利润预期,再促使董事长增持;增持可以提供信息,却未必推动了经营改善。
一名每天乘公交去医院上早班的护士发现,从窗户看到小区门口撑伞的人多时,公交往往晚点。她先固定观察时段、人数门槛和判断规则,再用随后三个月的通勤记录验证,发现这条规则比只看公交时刻表预测得更准。她准备据此决定何时提前出门。
哪种做法最合理?
查清机制有助于判断规则能维持多久。但安排出门只需要有用的预测,已验证的信号不必等待完整的因果解释。
排除降雨看起来能让关系更可靠。但预测可以利用共同原因留下的信号,排除雨天可能删掉最有用的信息。
提前出门需要的是晚点信号,不要求撑伞本身造成晚点。继续观察准确率,可以发现线路或天气变化带来的失效。
随机安排撑伞有助于检验它是否影响公交。但她需要预测晚点,这个实验回答的是改变撑伞行为会有什么效果。
降雨可能同时增加撑伞人数和公交晚点,撑伞本身未必影响公交。护士只需要预测,可以使用经过后续记录验证的信号;若想靠减少撑伞来改善公交运行,就需要另外检验因果。