思维模型格栅

博弈论 · 3/7

重复博弈与以牙还牙Repeated Games and Tit for Tat

当双方在意未来往来,今天占便宜就会变贵,合作也就有了支撑。

能拿最高总分的程序,未必最会占对手便宜。1980年,美国密歇根大学的罗伯特·阿克塞尔罗德公布了一场计算机策略比赛的结果。14个参赛程序反复两两交手,每轮都选择合作或背叛。加拿大多伦多大学的阿纳托尔·拉波波特提交了一条极短的规则:第一轮合作,以后照着对手上一轮的选择行动。它拿到了最高平均得分。同年的第二次比赛有62个参赛程序,这条规则再次夺冠。它没有靠压倒对手获胜,而是让愿意合作的对手一起持续得分。

为什么成立

未来的损失能压过眼前的便宜

供应商偷工减料能多赚200元,但买家发现后会停止续约,让它损失后续1000元利润。若这笔损失确定发生,守约更划算;若供应商认定买家马上就走,后续订单便约束不了它。重复博弈把今天的选择与明天的待遇连在一起,这就是“未来的影子”。

再见面的机会和对未来的重视共同支撑合作

把眼前背叛多赚的钱记作 ,把从下一轮起因对方回应而损失的收益记作 。用 表示未来收益折算到今天的权重,账可以写成:

白话说,未来损失折到今天,至少要抵得过眼前赚头。继续往来的机会越高、双方越重视未来, 越大。对方能发现背叛并作出回应, 才有分量;光是见面次数多,撑不起合作。

以牙还牙让回应清楚,也让合作能够恢复

以牙还牙先合作,此后复制对手上一轮的行动。对手背叛,下一轮便受惩罚;对手恢复合作,再下一轮便得到合作回应。它把善意、反击和宽恕写进同一条简单规则。上面的账比较合作与背叛的收益;这条规则下损失多少,要看双方随后怎样行动。

比赛奖励的是长期得分

阿克塞尔罗德的比赛把程序与各个对手交手的得分汇总。以牙还牙靠维持双方合作积累高分,无须在每场交手中胜过对方。它的成绩说明:对手愿意回应合作时,帮助对方持续得分,也能提高自己的总收益。

出处

重复博弈来自博弈论,20世纪中叶已有系统研究;阿克塞尔罗德并非它的创始人。他组织的两轮计算机比赛于1980年发表结果,拉波波特提交的以牙还牙均获第一。阿克塞尔罗德在1984年的《合作的进化》中解释了这些结果,并讨论合作如何在持续交往中形成。

换个领域看

商业

账户留下历史

eBay把买家的交易评价留在卖家账户上,让下一位买家也能看到。卖家这次隐瞒商品缺陷,即使买家不再回来,差评仍会影响后续生意。这里延续往来的载体是账户:新买家能读取过去的记录,把一次交易中的行为带进下一次交易的选择。

个人生活

室友轮流打扫

两位室友约定每周轮流打扫厨房,一人连续跳过自己的轮次,另一人便暂停替他收拾留下的锅碗。等对方补做并恢复轮值,双方也恢复互相搭手。回应只针对打扫这件事,且留着恢复合作的入口,才会把偷懒的代价与今后的便利连起来。

生物学

蝙蝠分享食物

威尔金森1984年发表的吸血蝙蝠研究记录了食物分享:吃饱的蝙蝠会回吐血液,喂给没找到食物的同伴。亲缘关系和长期同住都影响分享。今晚帮助一个熟悉的同伴,能给自己日后挨饿时留下求助对象;持续相处让帮助有了回报的机会。

遇事时问自己

  1. 这次占便宜会让我失去哪几笔后续收入、合作机会或日常帮助?
  2. 双方还会继续往来多久,对方能否看见并记住我的行为?
  3. 对方背叛后,我能采取什么确实会让他付出代价的回应?
  4. 怎样让对方清楚知道,恢复合作就能结束惩罚?
  5. 我准备长期投资的企业,其客户和合作伙伴是否有理由继续信任它?

边界与误用

未来往来短、身份随时能换、背叛难被发现时,合作失去这份支撑。若终点公开,且每轮背叛都是占优选择,在完全理性的标准设定中,合作会从最后一轮向前瓦解。机械复制对方行为也会放大误会:一次误操作便能让双方轮流报复,先核实、允许纠错才能打断循环。以牙还牙最常被误用成无休止记仇;它的宽恕恰在于对方合作后自己也恢复合作。阿克塞尔罗德的冠军依赖参赛策略和计分规则,换一批对手或加入噪声,胜者会改变。遇到暴力、欺诈或损失无法承受的关系,应退出并求助。

练一练

产品组和数据组每周互相提供上线材料。数据组这周漏发了一份报表,产品组准备下周也扣住需求清单。此前双方一直按时交付,这次系统恰好发生过发送故障,报表也可能已经发出。

产品组接下来哪一步最合适?

你研究一家连接品牌商与广告代理商的平台。代理商虚报投放效果被发现后,账户会被封禁,但换一个营业执照就能重新入驻,成本很低,旧记录也不会关联。平台不设保证金。管理层认为,代理商还想长期接单,自然会诚实报数。

对管理层这项判断,哪种评价最站得住?

你和朋友每月拼车去徒步,轮流开车。朋友上次为了省事,临时推掉了自己的轮次,你随后暂停替他开车。他承认不妥,并在这次按约完成了驾驶,也明确愿意继续轮换。下次轮到你。

要让这套轮换安排继续有效,下次怎样做最合适?