数学与统计 · 8/12
幂律与长尾Power Laws
幂律描述固定的缩放关系,集中程度取决于指数,二八只是一个特例。
一笔大赢家,能决定一家风投机构多年的成绩。2014 年 2 月,Facebook 在加州门洛帕克宣布收购 WhatsApp。现金与股票合计价值 160 亿美元,另给员工价值 30 亿美元的限制性股票。红杉资本的吉姆·戈茨从 2011 年起投资这家公司,累计投入约 6000 万美元。收购公布时,红杉的持股估值约为 30 亿美元,达到投入的约 50 倍。这样的赢家足以抵消许多项目的亏损。只数投中了几家、投错了几家,看不出谁真正撑起了回报。
为什么成立
门槛翻倍,数量按固定比例下降
若一千座城镇超过一万人口,五百座超过两万,二百五十座超过四万,门槛翻倍,数量就减半。这种比例若在一段规模范围内保持,就呈现幂律关系。若幂律只在尾部的一段范围内近似成立,可写成:
是规模, 与 限定适用范围。白话说,只看达到起点的那些项,门槛乘以 ,超过门槛的比例就约乘以 。上例中,。指数越小,数量下降越慢;少数大项占总量多少,也随指数改变。
按已有规模分配机会,能把差距越拉越大
持续加入新节点的网络,可以通过“优先连接”形成幂律。若新连接选择某节点的概率,正比于它已有的连接数,热门节点就会得到更多连接。老节点不断积累,新节点不断进入,最后形成少数大节点与众多小节点。不同领域还存在其他生成路径,观察到幂律不等于找到成因。
长尾能否撑起生意,要看众多小项加起来有多大
按销量排名,畅销书站在头部,众多冷门书排成长尾。统计学的尾部指罕见的大销量,商业长尾指排名末端的小销量。两者看的方向不同。二八只描述一种集中比例,幂律没有规定头部必须占八成。冷门项再多,也要把销量加起来、扣掉服务成本,才知道值不值得经营。
出处
幂律的经典证据来自收入统计。帕累托在 1896 年发表的研究中指出,收入门槛越高,超过门槛的人数按幂次下降。齐普夫在 1949 年系统讨论词频与城市规模的排名规律。2004 年,克里斯·安德森用“长尾”描述众多冷门商品聚合起来的商业价值。
换个领域看
城市规划
大城承接大需求
部分城市体系接近齐普夫规律:第二大城市人口约为第一大的一半,第十大约为十分之一。少数大城市因此承接大量居民。规划者先按统一口径统计人口,再看人口流入,把交通和医院配到需求集中的地方。每城平均分预算,会让大城市的服务跟不上居民。
图书商业
旧书找到新读者
推荐系统能把冷门书送到愿意购买的人面前。安德森在 2004 年报道,亚马逊向《Into Thin Air》的读者推荐《Touching the Void》。后者是乔·辛普森较早出版的登山回忆录,这次推荐带动它重新热卖。书店由此多了一条经营路径:用较低的匹配成本,把分散的阅读兴趣汇成销量。
技术运营
热门页面先缓存
请求集中在少数页面时,先处理热门页能放大优化收益。一位资料网站工程师查看一周日志,发现一百个页面中,十个接住八成请求。他先缓存这十页,就减少了大量重复计算。每周重新查看排名,还能让缓存跟着需求移动。这组数据足以指导优化,检验幂律则要看多个规模门槛。
遇事时问自己
- 把项目按贡献排序,前几个占了总量多少,拿掉它们后还剩多少?
- 把规模门槛连续翻倍,超过门槛的数量是否按近似固定比例下降?
- 单项结果能拉开几十倍差距,还是很快就会碰到容量上限?
- 我能扩大已知头部的贡献,还是要通过多次尝试寻找新的头部?
- 把冷门项的收入加起来,能否覆盖展示、匹配、库存和交付成本?
边界与误用
少数占大头,不等于数据服从幂律。对数正态分布也能产生高度集中的结果。判断幂律,要估计起点与指数,再比较其他分布的拟合。身高围绕典型值波动,不宜套用这种推演。有硬上限的规模,也只能在有限范围内近似幂律。城市数据要统一行政区或都市圈口径。最常见的误用,是把二八当成固定配额,把今天的头部当成明天的赢家。幂律描述大小如何分布,不能替你指出下一家成功的企业。
练一练
一家软件公司统计客户存储量。至少用到10 GB的有3200家,至少20 GB的有800家,至少40 GB的有200家,至少80 GB的有50家。产品经理准备调整套餐。
哪种判断最站得住?
四个门槛对应的人数都按相同比例下降。这段用量范围呈现稳定的缩放关系。
按现有用量分配,看起来有数据支撑。但扩容要满足新增需求,大户的现有用量与未来增量是两回事。
整齐的比例容易让人想到稳定的升级速度。但这里比较的是同一时点的不同客户,升级速度要看客户随时间的变化。
大客户容易让人联想到二八比例。但这里给的是超过门槛的人数,存储占比要用实际用量求和。
这里呈现幂律的缩放特征:门槛翻倍,人数降至四分之一,对应指数为2。经理可以据此理解各档客户的规模;制定套餐时,还要结合实际用量、增长和成本。
一家配餐店准备增加150种冷门菜。预计每种每月卖4份,每份扣除食材和制作成本后剩12元。每种菜每月还需40元维护菜单和备料,新增订单另需每月1800元配送费。
按这份估算,哪种经营判断最站得住?
每份都有正毛利,让扩充菜单显得划算。但维护菜单、备料和配送还要花钱,这些费用会吃掉毛利。
600份订单看起来已形成规模。但它们留下7200元,维护和配送共需7800元,仍有600元缺口。
缩减品种能降低维护成本,二八比例也很容易成为筛选依据。但估算中各菜销量相同,三十种只占总收入的两成。
150种菜每月合计贡献7200元,新增成本为7800元。降低备料、菜单维护或配送成本,才有机会把这批需求做成利润。
商业长尾的价值来自众多小需求的合计贡献。这里冷门菜合起来有销量,服务成本却更高。经营判断要算总账,品种数量和单份毛利只是其中两项。
一所大学规定,将八成奖学金发给成绩最高的一成学生。考试满分100分,多数学生得分在75至90分之间。校报据此称,少数学生集中了八成学习能力,今后分数还会成倍领先。
这项推断最直接的问题是什么?
扩大样本通常能提高判断的可靠性。但沿用同一分配规则,只会在更多学校重复相同的资金集中现象。
总额能说明资助力度,看起来是缺失的重要数据。但总额改变的是每人拿到多少钱,资金集中仍由规则决定。
八成资金流向一成学生,是学校事先规定的。实际成绩集中在75至90分,校报的判断应从这些成绩出发。
多年记录有助于观察学生成长。但只追踪奖学金占比,记录下来的仍是学校如何分钱。
少数人拿到大部分资金,表面上像幂律所描述的集中现象,实际却是人为规定的分配比例。它不能证明能力也按同样比例集中;考试还有100分的硬上限,把差距成倍扩大的推演套在这里,用错了边界。