思维方法 · 9/12
可证伪性Falsifiability
一个判断要经得起检验,先得说清什么证据会让你承认它错了。
1919年5月29日,爱丁顿在非洲西海岸外的普林西比岛拍摄日食,要检查星光会不会按爱因斯坦的预言弯曲。太阳被月亮遮住后,附近的恒星显露出来;把照片与平时的星空照片比较,就能测出星光经过太阳附近时偏了多少。爱因斯坦的理论与按牛顿引力计算的结果给出了不同数值,照片因此有机会让理论碰壁。当年公布的观测结果支持爱因斯坦。他的理论赢得关注,关键在于它事先给出了一个能被观测判错的答案。
为什么成立
判断越明确,现实越有机会让它出错
“所有天鹅都是白的”遇到一只确认无误的黑天鹅就会失败;看到再多白天鹅,也不能保证下一只仍是白的。支持与反驳在这里不对称:有限的观察无法穷尽所有天鹅,一个反例却能推翻这个全称判断。可证伪性说的就是:一个经验判断必须排除某些可观察的结果,让现实有机会与它冲突。
能解释任何结果的话,无法接受检验
“这项策略迟早会成功”没有截止日期,失败多少次都能继续等。改成“在预算不变时,新流程会在三个月内缩短平均交付时间”,才有明确的检验对象。**先写下什么结果算失败,再看结果。**如果交付没有加快,就撤回这条承诺;每次失败后都改期限、换指标,判断便逃出了检验。
检验失败时,要查清哪一环出了错
现实中的预测由理论、前提和测量方法共同推出。照片上的星位不合预测,既能指向理论错误,也能指向仪器失准。先校准仪器、复核数据,再让不同方法重复检验。修正前提也要给出新的可检验预测,不能只为保住结论临时加理由。
通过检验,意味着暂时站得住
一个判断经历越严格的挑战,仍与观察相符,我们就越有理由继续使用它。新的场景仍能暴露它的边界。这个模型把争论从“我能举多少支持的例子”,转向“我们同意什么结果出现后,就修改判断”。
出处
可证伪性来自科学哲学。卡尔·波普尔在1934年出版的《科学发现的逻辑》中系统提出,用它划分经验科学与非科学。他强调,科学理论应提出能与观察冲突的预测。爱因斯坦关于光线偏折的预言及1919年的日食观测,是他反复讨论的典型。
换个领域看
医学
让病因接受挑战
巴里·马歇尔用亲身实验挑战了胃炎病因的旧解释。1984年,他在澳大利亚珀斯喝下含幽门螺杆菌的培养液,随后出现胃炎,检查也发现了细菌。这给细菌致病的主张增加了直接证据;后续根除细菌、观察溃疡复发的研究,又让这个主张接受了治疗结果的检验。
技术
先写失败条件
排查故障时,明确预测能让工程师放弃错误解释。一名工程师怀疑页面偶尔显示旧价格,是缓存失效出了错。他先写下:若请求完全绕过缓存,旧价格就应消失。测试确认请求直达数据库后,页面仍显示旧价,他便撤回“缓存是唯一原因”的判断,转查数据更新链路。
投资
给持有理由设限
投资理由写得具体,坏消息才有机会改变持有决定。一位投资者买入连锁零售商,理由是顾客愿意为品牌支付更高价格。他事先约定:若连续两年只能靠更深折扣维持销量,就撤回这个判断。后来折扣加深、毛利率下降,即使股价上涨,他也重估品牌溢价和持有理由。
遇事时问自己
- 我相信的具体判断是什么,它预测在什么条件下、何时出现什么结果?
- 什么可观察的结果出现后,我会撤回或修改这个判断?
- 我怎样主动寻找这个结果,而不是只收集支持自己的例子?
- 若检验失败,我能怎样复核测量和前提,让问题落到具体的一环?
- 我是否在看到坏结果后改了期限或指标,以保住原来的结论?
边界与误用
可证伪性适合检验关于事实的主张,无法直接裁定价值选择或审美偏好。“人应当诚实”表达的是规范;“诚实能提高客户续约率”才接受经验检验。最常见的误用,是把一次坏结果当成彻底推翻:概率判断允许个别失败,要事先约定样本、期限和判定标准。无法证伪也不等于毫无意义;波普尔提出的是经验科学的划界标准。遇到反常结果,先复核证据,再修改判断,避免把每次修补都当成狡辩。
练一练
客服团队试用自动答复工具。负责人事先承诺:六周后,从实际工单中随机抽取400条,答复准确率至少达到95%,否则撤回“工具已能独立处理这类工单”的判断。到期后,独立复核确认准确率为88%。团队提出,再给工具两周,改用客户满意度评估。
此时哪种处理最站得住?
客户满意度确实值得关注。但它回答的是另一个问题,不能在准确率未达标后替换原标准来保住原判断。
未达标容易让人失去信心。但这次结果只否定了约定条件下的具体承诺,不能证明这类工具以后都无法使用。
给新工具更多时间很诱人,也可能值得继续试用。但原承诺已经接受了检验,延长期限不能抹去这次失败。
样本、期限和标准已经约定,复核结果未达标。可以继续改进,但应先承认原判断失败,再提出新的检验。
负责人事先给出了能让判断失败的结果,实际检验也触及了这条界线。承认本轮失败,与继续投入改进并不冲突;看到结果后换指标,才会让原判断逃出检验。
搬家时,林悦决定保留母亲留下的手写菜谱。她说:“即使网上能找到更好的做法,我也愿意留着,因为这些字迹对我有意义。”伴侣要求她先说明,出现什么证据后,她会承认这些菜谱不值得保留。
对伴侣的要求,哪种判断最合适?
她表达的是个人珍视的东西,没有提出关于事实的预测。两人仍可讨论空间和收纳成本,但这些事实不能直接推翻她的价值选择。
比较做菜效果能检验菜谱是否实用。但林悦珍视的是母亲的字迹,烹饪效果无法直接判定这份意义。
要求明确理由能让讨论更清楚。但个人珍视什么属于价值选择,不必像事实预测那样设置反驳条件。
翻阅次数容易记录,看起来能让争论落地。但纪念物的意义不等于使用频率,这个指标替换了她表达的价值。
“这些字迹对我有意义”表达的是价值选择,不能靠一个观测结果直接判错。若她说“保留菜谱会让我每周多做两次饭”,才有可检验的事实主张。
一座小城的调查组判断,河水中的某种污染物主要来自上游工厂。他们提前预测:工厂停产七天后,在水流条件不变时,下游浓度应降至规定范围。停产后读数仍高,但调查组发现,采样站恰好在当天换了传感器,新设备尚未与标准方法比对。
调查组接下来哪一步最合理?
河床残留可能是合理的新解释。但若只用它保住原结论,却不给出新的检验办法,就无法区分解释与临时补救。
预测与读数发生了冲突,但测量环节存在具体疑点。先复核这一环,才能判断原解释是否真的受到了反驳。
过去的记录确实支持原判断。但支持证据不能让新的冲突自动失效,这次异常仍需要查清。
按事先预测接受坏结果是必要的。但尚未核实的新传感器可能影响读数,不能直接把测量疑点算成原解释失败。
这次预测依赖污染来源、水流条件和测量方法共同成立,异常读数未必只指向来源判断错误。复核传感器是在排查具体疑点;若测量可靠、条件也成立,就应修改原判断。