计算机与信息 · 2/7
最优停止Optimal Stopping
最优停止是在继续寻找的收益与等待的代价之间,选定出手的时机。
继续寻找更平坦的落点,会消耗登月舱留给着陆的燃料。1969 年 7 月 20 日,月球静海上空,阿波罗 11 号的尼尔·阿姆斯特朗发现,自动导航正把登月舱带向布满巨石的区域。他接手操纵,飞过障碍,寻找能落脚的地方。休斯敦传来剩余燃料的倒计时,地面却没有一块标着“最佳落点”的空地。阿姆斯特朗选中一处平坦区域,让登月舱落下:多找一会儿能改善位置,也会压缩安全着陆的余地。
为什么成立
先看一批,再选第一个刷新纪录的
从依次出现的 100 人中选出最强者,经典秘书问题给出的策略是:放过前 37 人,记住其中最强的;随后选第一个超过此前所有人的。若始终没有人刷新纪录,就选最后一人。前一批帮你建立标准,后面的人提供出手机会。
这道题把选择压缩成一个明确任务:人数已知,出场顺序随机,每次能准确判断已见者的相对排名。你必须当场接受或拒绝,拒绝后无法召回,目标是选中全场第一。它让我们单独看清:观察多久,才能最大限度地提高选中第一名的概率。
观察太少和太多都会错过第一名
观察期越长,比较标准越可靠,第一名被你直接放走的机会也越大。观察期越短,第一名越有机会留在后面,你却更容易被一个较早出现的普通纪录保持者截住。
跳过前 人后,要在第 人处选中第一名,他得恰好在这里出现,概率为 。此前最强者还得落在观察期内,概率为 ,这样你才没有提前出手。把这些位置的成功概率相加:
这个式子算的是:第一名出现在观察期之后,而且你一直等到了他,两件事同时发生的概率。
人数很大时,令 ,成功率近似为 。它在 时最大,成功率也趋近 36.8%。最优的意思是成功概率最高,仍有六成多的机会错过第一名。
出处
最优停止来自概率论与决策理论,后来进入运筹学和计算机算法。秘书问题在 1960 年经马丁·加德纳的《科学美国人》专栏广为传播;丹尼斯·林德利于 1961 年发表数学分析。37% 规则的依据是对随机排列的数学证明:计算每个观察长度的成功概率,再找出最大值。
换个领域看
商业
招聘先定出手点
候选人随机依次面试、必须当场答复时,招聘负责人可以先用一批人建立比较标准。若有 20 人,目标是选中最强者,就先放过 7 人,再录用首位超过此前所有人的候选人;始终无人超过,就选最后一人。出手条件提前写好,“再看看”便有了终点。
个人生活
租房设接受门槛
搬家期限逼近时,租客可以用月租、通勤和夜间噪声写下接受门槛。前几次看房帮助他摸清预算能买到什么,随后遇到达标且能签约的房子就停。若继续找意味着每天支付临时住宿费,省下的月租就得足以抵过这笔等待开销。
航天工程
结束恢复尝试
寻找恢复联系的办法,也有停止的一刻。2018 年火星尘暴后,NASA 的机遇号失联。团队发送了一千多次恢复指令,仍未收到回应;2019 年 2 月,NASA 宣布任务结束。可尝试的办法逐步耗尽,团队最终结束了寻找,将资源留给后续任务。
遇事时问自己
- 我追求的是选中全场最好,还是找到一个足够好、收益合算的选项?
- 还会出现多少选项,顺序由谁决定,拒绝后能否回头?
- 我能可靠地比较优劣吗,还是只被眼前最显眼的特点吸引?
- 再找一次预计能改善多少结果,又会增加多少费用和错失风险?
- 我能否现在写下观察期限、接受标准和最后的保底方案?
边界与误用
把恋爱人数、看房次数或投资期限机械切成 37%,会把秘书问题的答案用到另一道题上。选项总数未知、出场顺序受人操纵,或排名难以判断时,37% 的推导条件便已改变。能回头选,就保留候选名单,比较多看一次的收益与费用;只求达标,就设接受门槛;寻找要付钱,就在预期改善不足以覆盖费用时停止。投资还要比较价格与价值:一段时间内表现最好的资产,照样会贵得不值得买。
练一练
一家游戏工作室要为新作购买一段配乐。音乐节安排了 50 首未公开作品,播放顺序随机。每首播完后,工作室必须立即决定是否买下独家使用权;放过后,作者就会转卖。团队能可靠地比较已听作品,预算只够买一首,目标是买到全场最好的一首。
哪种购买策略最站得住?
设门槛能避免犹豫,适合寻找足够好的作品。但这里追求全场第一,达标作品可能提前截住团队,让后面的第一名失去机会。
先看一半很直观,也能建立更充分的比较标准。但观察期越长,把全场最好直接放走的概率也越高,一半并不是这里最有利的比例。
这里人数已知、顺序随机、拒绝后不能回头,目标也是选中全场第一。先建立比较标准,再等新的纪录保持者,符合这些条件。
平均水平容易计算,也像是一个合理基准。但超过平均水平远不等于刷新纪录,这个标准容易让团队过早买下普通作品。
这个处境满足卡片中经典选择问题的关键条件,可以用前约 37% 的作品建立标准。后面要等的是超过此前所有作品的新纪录,而不是超过平均水平。策略提高的是选中第一名的概率,并不保证买到第一名。
一家平台按基金公司支付的推广费,依次向林女士展示 100 只基金。所有基金的资料随时可以回看,她也能分批买入、以后调整持仓。她打算跳过前 37 只,再买第一只历史收益超过此前所有基金的产品。
对这个计划,哪种判断最站得住?
多看一些似乎能减轻广告排序的影响。但延长观察期不能把受操纵的顺序变成随机顺序,也不能让历史收益直接代表投资价值。
这里既没有随机顺序,也没有拒绝后失去机会的约束。投资还要看风险与费用,不能把历史收益的新纪录当成买入信号。
已知总数确实是一个重要条件,筛费率也有帮助。但展示顺序受推广费影响,而且可以回头选,仅有总数不能支撑这个比例。
分批买入和后续调整确实能控制部分风险。但它们没有补上首次买入的依据,也不能证明收益纪录保持者适合进入她的组合。
这个计划借用了卡片里的观察比例,却改变了推导所需的条件。既然资料可以回看,就可以保留候选并比较;既然目标是投资收益,就还要判断风险、费用和持仓适配。
周末出游前,陈先生已花三个小时查找优惠,现在能立即订到总价 900 元的合适车票。还有一个渠道可查,查完需要半小时;有 20% 的概率找到同条件的 800 元车票,否则仍买 900 元的票。现有票价会保留,查找没有其他费用,他愿意按每小时 80 元计算这半小时的时间成本。
只按这些信息,下一步怎么做最合理?
继续查平均能省 20 元,却要付出价值 40 元的时间。按他给定的时间价值,现在订票的预期净结果更好。
已经投入很多时间,容易让人想再努力一下。但过去三小时无法收回,下一步是否值得,要看新增收益能否覆盖新增成本。
100 元的潜在优惠很显眼,也确实超过时间成本。但它只有 20% 的概率出现,不能把最好结果当成确定收益。
能保留现有票价,确实消除了错失这张票的风险。但获取信息仍要花时间,信息带来的预期改善不足以抵过这笔成本。
这里可以回头买现有车票,关键是再查一次能带来多少净改善。预期节省为 20 元,新增时间成本为 40 元,所以应结束寻找。已经花掉的三小时不改变这个比较。