2026年10月09日 星期五
本福特定律:我知道数字为何偏爱“1”
□ 匡婉妍

    统计任意千条以上短视频的点赞量数据,把每一组数值的第一个非零数字单独拎出来计数,你会发现一个反直觉的数学现象:以数字“1”开头的数值,出现概率远远高于其他数字。大约30%的数据首位数字是1,而以9开头的数值占比仅有4.6%左右。

    这条看似充满巧合的规律,是被写进数理统计教材的经典法则——本福特定律,也被称作首位数定律。在十进制体系下,首位数字d(d=1,2,…,9)出现的概率满足公式P(d)=log10(1+1/d)。

    本福特定律的发现始于微小细节。1881年,加拿大天文学家西蒙·纽康观察到对数表以1开头的页码磨损更严重,推测以1开头的数值使用更频繁。1938年,美国工程师、物理学家弗兰克·本福特实证了这一猜想,才使这一定律广为人知,并最终以他的名字命名。

    大多数据遵循指数增长模式,而非匀速线性增长

    我们可以把数字看作一把刻度尺:从1增长到2,需要提升100%;从2增长到3,增幅降至50%;从8增长到9,仅需增长约12.5%。越大的首位数字,继续向上增长所需要的相对幅度越小。现实世界绝大多数自然与社会数据,基本遵循指数增长模式,而非匀速线性增长。

    同时,本福特定律具备“尺度不变性”——任意更换计量单位,公里换成英里、千克换算磅,规律始终稳定成立。

    当然,这条定律拥有清晰的适用边界。数据必须横跨至少两个数量级,且不能受到严苛的人为规则限制。普通人身高、班级学生体重这类数值区间狭窄的数据,就无法贴合该规律;而河流长度、城市人口、短视频流量、商品价格这类跨度极大的数据集,大多高度契合。

    从学术诚信到公共选举监督,应用场景十分广泛

    除了大众熟知的财经审计场景,本福特定律在科研、公共等领域有着十分广泛的实用价值。

    在学术诚信核查领域,越来越多的科研团队借助它检验实验原始数据。人为编造的数值,人们会下意识均衡分配首位数字,和自然生成的数据分布特征存在明显差异,这条规律就可以辅助识别刻意篡改的实验结果。

    在公共选举监督工作中,统计学家长期利用本福特定律分析各地投票数据——一旦部分地区数据分布出现显著偏离,就能快速锁定异常区域。

    此外,在体育赛事数据分析、生态环境监测、气象数据统计领域,本福特定律同样发挥作用。气象学家统计历年降雨量、气温数据,生态学者记录动植物种群数量,都可以依靠该定律快速判断数据是否存在异常录入、人为修改等问题。

    本福特定律不是判定真伪的“万能标尺”,如果样本数量过少、数值区间受限,就会造成分布偏差。即便数据小幅偏离定律,也不能直接判定数据造假;反之,完全符合定律,也无法百分百证明数据真实。它更像是一把高效的“筛查工具”,能够快速定位异常样本,但无法单独作为定论依据。

    (作者系华中农业大学沈婧芳教学名师工作室骨干成员)

京ICP备06005116号