计算机与信息 · 1/7
探索与利用Explore vs Exploit
在反复选择中,用一部分眼前收益换取信息,再把机会投向已知更好的选择。
还有许多次生意可做时,试一条新路能改变未来的收入。2007年,在美国加州洛斯盖托斯,里德·哈斯廷斯领导的Netflix推出在线播放服务。当时,公司的成熟业务是把DVD邮寄给订户;新服务的片库有限,用户还得在电脑上观看。Netflix继续经营DVD租赁,同时向订户开放在线播放,观察他们是否愿意使用。每多投入一点在线播放,就少了一点可用于成熟业务的资源,却也多知道一点观众的偏好。后来,在线播放成为Netflix的核心业务。
为什么成立
眼前领先的选项未必真的最好
一封促销邮件发给100人,带来20笔订单;另一封只发给5人,没有订单。只追着眼前成绩走,就会一直发送第一封,第二封也就一直没有翻身的机会。选择决定你能看到什么,看到的结果又决定下一次选择。
一次选择既能挣钱,也能买到信息
多臂老虎机把这个困境压缩成几台机器:每次只能拉一根拉杆,各台机器的平均回报未知,你只看到所选机器的结果。利用,是选当前估计回报最高的;探索,是试其他选项,改善判断。目标是让整个选择期间的累计回报更高。
信息越能反复使用,越值得花钱获取
假设一次试验花10元,能查明新流程是否更省钱。你估计有20%的机会找到每次节省1元的改进,之后还要执行100次。试验的预期净收益是:
白话说,改进若成立,未来共省100元;按成功机会折算,值20元,扣掉试验费还剩10元。若只剩10次执行机会,同样的试验就不划算。
探索应当追着有价值的未知走
有效的策略会同时看估计收益和不确定程度:优先试那些了解较少、又有望超过当前最佳的选项。证据积累后,把更多机会交给胜者。在回报稳定、选择反复发生时,探索占比可以逐步下降;环境改变或新选项出现时,再增加探索。
出处
这个模型来自统计决策,后来成为计算机机器学习的重要基础。1933年,威廉·汤普森研究如何在临床试验中分配两种治疗;1952年,赫伯特·罗宾斯系统研究多臂老虎机问题。2010年,李力鸿等人在雅虎新闻推荐研究中,用真实点击数据检验了结合用户特征的老虎机算法。
换个领域看
技术
给陌生新闻机会
推荐系统若只展示已经热门的新闻,就难以发现其他新闻的吸引力。2010年,雅虎研究团队用LinUCB算法选择首页新闻:既看用户特征和已有点击,也给尚未充分尝试的选项加上探索奖励。在随机展示收集的数据上,这套方法提高了点击表现。展示位置同时承担了服务用户和获取信息两项任务。
个人生活
把午饭试出答案
长期在同一片办公区吃午饭,花几顿饭试新店能改善往后的选择。一位职员每周拿一天尝试步行十分钟内的新店,记录价格、等餐时间和吃完的感受,其余四天去已经满意的店。找到更好的店后,就把它加入常去名单。若下周就搬走,试遍附近餐馆带来的收益便小得多。
投资
给研究留个席位
投资者可以把探索放在研究时间里,让已有判断继续指导资金。一位长期研究银行股的投资者,每月留出两晚阅读其他行业的年报,比较现金流、竞争和估值。发现值得深挖的企业后,再投入更多研究时间。这两晚牺牲了熟悉行业的研究进度,却能检验自己是否一直忽略更好的机会。
遇事时问自己
- 我认定这个选择最好,是因为比较充分,还是因为一直只选它?
- 这次尝试能回答哪个问题,答案会怎样改变下一次选择?
- 我还会遇到多少次类似选择,学到的信息能用多久?
- 试错会花多少钱、时间和机会,我能把试验缩小到什么程度?
- 什么结果会让我增加投入、放弃选项,或重新探索?
边界与误用
探索值得投入的前提,是反馈能改善以后仍有机会做出的选择。只有一次机会、结果多年后才出现,或每次尝试都改变了任务本身时,标准多臂老虎机的假设就不贴合。若失败会造成破产或不可逆伤害,先排除这类选项,再谈探索。最常见的误用,是把固定拿出10%资源尝新当成通用答案,或反复尝新却不记录结果。探索比例应随剩余机会、试错成本和环境变化调整;始终没有改变后续选择的尝试,买不到有用的信息。
练一练
一家饼干厂每天包装数千袋同款饼干。封口机的甲设置用了半年,漏封率约为2%;乙设置只试过50袋,出现2袋漏封。材料和设备近期都很稳定,未来还要生产一年。生产主管准备停用乙设置,把所有订单交给甲。
哪种判断最站得住?
样本一样多看起来便于公平比较。但获取信息不必以样本相等为目标,分配还要考虑漏封成本和已有证据。
甲维持当前表现,小批试产补充乙的证据。未来还有大量生产机会,查清乙是否更好可能带来持续收益。
固定比例容易执行,也能避免乙一直没有数据。但比例应随证据调整,已经证实较差的设置不必永久获得试产机会。
集中到甲能减少眼前损失,乙的当前成绩也确实较差。但50袋的结果波动很大,还不足以判断乙长期表现更差。
选择哪种设置,也决定工厂能积累哪种设置的数据。乙的样本少,而未来生产次数多,小批试产可能改善后续分配。证据充分后,应把更多产量交给表现更好的设置。
一位图书馆管理员每天骑车上班。她过去试过三条路线,最后一直走最快的河边路。最近河边路开始施工,预计持续半年,通勤时间明显增加。另两条路半年没走过,其中一条刚开通了自行车专用道。她可以提前出门,给试走留出时间。
她下一步怎么做最合理?
施工和新车道改变了原来的比较基础。用几次可承受的尝试更新判断,得到的信息还能用于未来半年的通勤。
专用道确实可能提高速度,值得优先试走。但总耗时还受绕路、路口和拥堵影响,新设施本身不能证明整条路线最快。
轮换能持续获得数据,也能发现变化。但比较清楚后仍平均轮换,会反复付出绕路成本,未必能得到足以补偿这些成本的新信息。
长期记录通常比几次体验可靠。但持续施工已经改变了道路条件,旧记录不能直接代表当前表现。
过去的最佳选择依赖当时的道路条件,环境变化会让旧判断失效。重新试走可以改善未来选择;找到稳定的更快路线后,就应减少尝试,把多数通勤交给它。
一位退休教师准备把一笔养老资金换成终身年金。两款产品都必须在本周签约,签约后不能撤回或换款;它们的主要差别是未来二十年的购买力保障,首月领取金额几乎相同。她打算先拿一小笔购买乙款,观察下个月到账,再决定剩余资金选哪款。
对这个提议,哪种判断最站得住?
有用的信息必须及时回答关键问题。购买后的反馈来不及改变本次选择,应先从条款和已有证据判断长期保障。
先小后大能降低单次投入,看起来很稳妥。但首月到账赶不上签约期限,也不能回答长期购买力保障的问题。
首月金额直观、容易核实。但两款的关键差别在长期购买力,眼前到账不能替代对这一差别的判断。
分开购买可能有分散风险的作用。但这笔资金签约后不能调整,长期比较结果无法支持所说的后续增配。
小额尝试只有在反馈能改善后续选择时,才有相应的信息价值。这里签约不可撤回,关键结果又要多年才能看到,反复试选的办法不适用。应把精力放在签约前获取能回答长期保障问题的证据上。