思维模型格栅

数学与统计 · 8/12

幂律与长尾Power Laws

幂律描述固定的缩放关系,集中程度取决于指数,二八只是一个特例。

一笔大赢家,能决定一家风投机构多年的成绩。2014 年 2 月,Facebook 在加州门洛帕克宣布收购 WhatsApp。现金与股票合计价值 160 亿美元,另给员工价值 30 亿美元的限制性股票。红杉资本的吉姆·戈茨从 2011 年起投资这家公司,累计投入约 6000 万美元。收购公布时,红杉的持股估值约为 30 亿美元,达到投入的约 50 倍。这样的赢家足以抵消许多项目的亏损。只数投中了几家、投错了几家,看不出谁真正撑起了回报。

为什么成立

门槛翻倍,数量按固定比例下降

若一千座城镇超过一万人口,五百座超过两万,二百五十座超过四万,门槛翻倍,数量就减半。这种比例若在一段规模范围内保持,就呈现幂律关系。若幂律只在尾部的一段范围内近似成立,可写成:

是规模, 与 限定适用范围。白话说,只看达到起点的那些项,门槛乘以 ,超过门槛的比例就约乘以 。上例中,。指数越小,数量下降越慢;少数大项占总量多少,也随指数改变。

按已有规模分配机会,能把差距越拉越大

持续加入新节点的网络,可以通过“优先连接”形成幂律。若新连接选择某节点的概率,正比于它已有的连接数,热门节点就会得到更多连接。老节点不断积累,新节点不断进入,最后形成少数大节点与众多小节点。不同领域还存在其他生成路径,观察到幂律不等于找到成因。

长尾能否撑起生意,要看众多小项加起来有多大

按销量排名,畅销书站在头部,众多冷门书排成长尾。统计学的尾部指罕见的大销量,商业长尾指排名末端的小销量。两者看的方向不同。二八只描述一种集中比例,幂律没有规定头部必须占八成。冷门项再多,也要把销量加起来、扣掉服务成本,才知道值不值得经营。

出处

幂律的经典证据来自收入统计。帕累托在 1896 年发表的研究中指出,收入门槛越高,超过门槛的人数按幂次下降。齐普夫在 1949 年系统讨论词频与城市规模的排名规律。2004 年,克里斯·安德森用“长尾”描述众多冷门商品聚合起来的商业价值。

换个领域看

城市规划

大城承接大需求

部分城市体系接近齐普夫规律:第二大城市人口约为第一大的一半,第十大约为十分之一。少数大城市因此承接大量居民。规划者先按统一口径统计人口,再看人口流入,把交通和医院配到需求集中的地方。每城平均分预算,会让大城市的服务跟不上居民。

图书商业

旧书找到新读者

推荐系统能把冷门书送到愿意购买的人面前。安德森在 2004 年报道,亚马逊向《Into Thin Air》的读者推荐《Touching the Void》。后者是乔·辛普森较早出版的登山回忆录,这次推荐带动它重新热卖。书店由此多了一条经营路径:用较低的匹配成本,把分散的阅读兴趣汇成销量。

技术运营

热门页面先缓存

请求集中在少数页面时,先处理热门页能放大优化收益。一位资料网站工程师查看一周日志,发现一百个页面中,十个接住八成请求。他先缓存这十页,就减少了大量重复计算。每周重新查看排名,还能让缓存跟着需求移动。这组数据足以指导优化,检验幂律则要看多个规模门槛。

遇事时问自己

  1. 把项目按贡献排序,前几个占了总量多少,拿掉它们后还剩多少?
  2. 把规模门槛连续翻倍,超过门槛的数量是否按近似固定比例下降?
  3. 单项结果能拉开几十倍差距,还是很快就会碰到容量上限?
  4. 我能扩大已知头部的贡献,还是要通过多次尝试寻找新的头部?
  5. 把冷门项的收入加起来,能否覆盖展示、匹配、库存和交付成本?

边界与误用

少数占大头,不等于数据服从幂律。对数正态分布也能产生高度集中的结果。判断幂律,要估计起点与指数,再比较其他分布的拟合。身高围绕典型值波动,不宜套用这种推演。有硬上限的规模,也只能在有限范围内近似幂律。城市数据要统一行政区或都市圈口径。最常见的误用,是把二八当成固定配额,把今天的头部当成明天的赢家。幂律描述大小如何分布,不能替你指出下一家成功的企业。

练一练

一家软件公司统计客户存储量。至少用到10 GB的有3200家,至少20 GB的有800家,至少40 GB的有200家,至少80 GB的有50家。产品经理准备调整套餐。

哪种判断最站得住?

一家配餐店准备增加150种冷门菜。预计每种每月卖4份,每份扣除食材和制作成本后剩12元。每种菜每月还需40元维护菜单和备料,新增订单另需每月1800元配送费。

按这份估算,哪种经营判断最站得住?

一所大学规定,将八成奖学金发给成绩最高的一成学生。考试满分100分,多数学生得分在75至90分之间。校报据此称,少数学生集中了八成学习能力,今后分数还会成倍领先。

这项推断最直接的问题是什么?