博弈论 · 12/14
逆向归纳Backward Induction
从最后一步的最优选择往回推,用后续各方的反应决定现在怎么走。
最后一步若已被锁定,眼前的牺牲就能成为胜招。1858 年,巴黎的一间歌剧院包厢里,保罗·墨菲与布伦瑞克公爵、伊苏阿尔伯爵对弈。接近终局时,墨菲把白后送到 b8,将军,也让黑马能够吃掉它。黑方若要解除将军,只能用马吃后;随后白车进到 d8,将死黑王。白后虽然价值很高,舍掉它却能换来胜利。这步棋可以从终点看清:白车能完成将死,所以前一步值得弃后;对手被迫吃后,又让这条路线走得通。
为什么成立
最后一步的选择,会改变前一步的价值
设想桌上有四枚硬币,两人轮流拿,每次拿一枚或两枚,拿到最后一枚的人获胜。你先拿,怎样保证赢?先看只剩一枚或两枚时:轮到谁,谁就能一次拿完。剩三枚时,轮到的人无论拿多少,都会把胜利交给对手。于是,面对四枚,你应拿一枚,把三枚留给对手。
每往回一步,都要换到当事人的位置
逆向归纳就是先解出最后决策者会怎么选,再把这个结果带回前一个决策点。前面的人比较的,是每条路经过后续选择后,最终给自己留下什么。拿硬币时,你不能替对手挑一个对你有利的动作;你必须假定他也会争取获胜。
每个节点都按轮到的人的利益求解,才能算清当前动作的后果。 从终点向前,一层层把已经解出的分支收起来,直到回到起点。即使某条分支最终没有走到,也要先算清,否则你无法比较起点的其他选择。
逐层倒推成立,是因为后面的局面已经解出
在有限步的完美信息博弈中,行动者知道此前的全部行动。若规则、各方收益与理性都是共同知识,就能从最后一层逐步求解。共同知识指每个人都知道这些,也知道别人知道,并如此逐层延伸。最后一层解出后,上一层就成为后果已知的选择题,再上一层也一样。局部选择不断向前传递,形成从现在到终局的完整策略。
出处
逆向归纳来自博弈论,也与数学中的递归求解相通。策梅洛在 1913 年研究国际象棋时,给出了相关的早期数学论证;冯·诺依曼与摩根斯特恩在 1944 年的《博弈论与经济行为》中系统讨论了这一方法。后来,蜈蚣博弈实验成为检验人是否真的逐步倒推的经典研究。
换个领域看
商业
先算竞争者反应
进入新市场前,先算老对手迎战后能赚多少。假设你开一家面包店:老店降价迎战只能赚一万元,维持价格能赚三万元,它便会选后者。你据此估算自己开店的收益,再决定是否进入。分析顺序与行动顺序相反:先算老店开店后的选择,再算你今天的选择。
个人生活
分蛋糕看后手
分蛋糕时,知道对方会先挑,就会改变你怎么切。设想你和朋友分一块口味均匀的蛋糕,规则是你切两份、朋友先选。朋友会拿较大的一份,你只能拿剩下的。倒推回来,你想让自己拿得最多,就该尽量切成两等份;切得偏,吃亏的是自己。
实验经济学
实验中的继续
真实的人未必沿着倒推路线行动。麦凯尔维与帕尔弗里在 1992 年发表蜈蚣博弈实验:两人轮流选择收钱结束,或继续让钱池增长。若人人只求自己的钱最多,且规则、收益与理性都是共同知识,倒推会得到第一步就结束。但参与者经常继续,这组假设未能准确预测实验行为。
遇事时问自己
- 这件事在哪里结束,最后一个有选择权的人是谁?
- 到了最后一步,他看到什么,选哪个动作对自己最有利?
- 把他的选择带回前一步,轮到的那个人会怎样选?
- 我是否把希望对方采取的动作,当成了他真正愿意采取的动作?
- 对方的收益、信息或终点改变后,哪一步会最先改变选择?
边界与误用
逆向归纳最适合终点明确、行动可观察、各方偏好已知的有限博弈。终点无限延伸时,找不到最后一步;有人掌握秘密信息时,同一局面会因信念不同而导向不同选择。收益相同的动作也会留下多条路线。最常见的误用,是把从目标倒排日程当成逆向归纳,或只把钱算进对方的收益。人也在意公平、报复和关系;把这些漏掉,倒推得再严密,也是在解另一场博弈。
练一练
连锁药店的数据负责人要给会员记录去重。交给内部团队做,药店净赚3万元;外包要预付4万元,按约完成后净赚8万元,已扣除预付款。外包商完成去重要花3万元,不做则没有成本。药店能发现违约,但只能通过诉讼追回6万元,诉讼费为7万元;放弃诉讼就损失预付款。双方都清楚这些条件,只计本单的金钱收益,没有后续合作。
付款前,数据负责人怎样选择最有根据?
已经付出去的钱容易让人想追到底。但届时仍要比较起诉带来的新增收入和费用,预付款不会让这笔亏损变得划算。
赔偿额高于履约成本,看起来足以约束外包商。但药店届时起诉会多亏1万元,外包商能预见这笔赔偿不会被追讨。
把可能发生的费用算进去,看起来比较谨慎。但按约完成时不会发生诉讼,不能把违约分支的费用扣到履约分支。
最后起诉要花7万元追回6万元,药店会放弃。外包商预见这一点,就会省下3万元成本,药店因此应选择内部团队。
先算药店发现违约后是否起诉,再算外包商收款后是否履约,最后比较现在的两种方案。逆向归纳要求站到每个决策者的位置上求解;合同写了赔偿,还要看追讨时是否值得行动。
一家宠物诊所的投资人,可以现在以58万元转让全部持股,也可以保留股权,参加下周的整店收购。收购款共100万元,需要投资人和创办诊所的兽医都签字。兽医只能提出给投资人50万元或65万元,自己拿剩余款项。投资人随后接受或拒绝,不能还价。拒绝就立即清算,投资人拿60万元,兽医拿20万元。双方清楚全部规则,只追求本次所得最多。
投资人现在怎样选择最有根据?
拒绝50万元后拿60万元,这一步算得对。但兽医也能预见拒绝,会改提65万元,让自己从20万元增加到35万元。
兽医确实想少分出去一些钱。但投资人可以拒绝50万元,转而拿到清算的60万元,并非只能接受。
投资人会拒绝50万元、接受65万元。兽医因此比较的是清算所得20万元和成交所得35万元,会提出65万元。
清算能拿到60万元,确实给了投资人拒绝报价的底气。但65万元已经高于清算所得,按题中的偏好,他会接受。
逆向归纳先确定投资人面对每个报价的选择,再确定兽医会提出哪个报价,最后回到今天是否转让。即使50万元的报价不会出现,也要先算清它会被拒绝,才能解释兽医为何选择65万元。
一名轮班工作的急诊护士,报名了10月的首场半程马拉松。她从比赛日往前排:赛前两周减量,9月完成长距离训练,8月增加里程,7月恢复基础。她认为,既然已经从终点推回今天,这就是当前最优的训练方案。她没有比较其他安排,也没有分析夜班后的疲劳会怎样影响后续训练。
她的判断在哪一步出了问题?
自己控制训练,确实减少了协调难度。但执行一份计划与求出最优方案是两件事,每个阶段仍要比较可选安排。
固定日期确实方便往前安排训练。但它只确定期限,没有确定各阶段选择的后果,更没有证明哪种安排最优。
目标成绩能帮助明确训练方向。但同一个目标可以对应多种安排,还要比较训练效果和疲劳如何影响后续选择。
她列出了训练阶段,却没有求出后续状态下怎样选择最好。倒排日程可以帮助准备比赛,本身不能证明这份方案最优。
逆向归纳要先求出后续决策点的最优选择,再把结果带回前一步。护士只是从截止日倒排任务;若要逐层求解,还需比较不同训练量如何改变疲劳状态,以及这些状态下后续怎样训练最好。