为什么这么多东西都服从正态分布?从历史、数学、物理到哲学的一次完整拆解

为什么这么多东西都服从正态分布?

人的身高、同一种螺栓的直径、反复测量同一个量的误差、一次大考的成绩……很多你随手一测的东西,画成直方图,都是中间高、两边低、左右对称的一个钟形。这个形状我们叫正态分布,也叫高斯分布。

但问题是:凭什么?凭什么这么多互不相干的现象,最后都收敛到同一个形状?这是巧合,还是背后有某种必然?

这篇文章我想把这件事从根上拆一遍:它最早是怎么被人发现的,数学上到底哪一步把它逼成了钟形,物理里它对应着什么样的机制,以及哲学上它到底意味着什么、又不意味着什么。

从赌场里长出来的钟形曲线

故事要从赌博说起。

17 到 18 世纪,概率论基本是被赌徒和数学家一起拉扯出来的。帕斯卡、费马给"公平的赌注该怎么分"定了规则,然后有一批人开始研究一个很具体的问题:扔硬币,扔很多次,正面朝上的次数会怎么分布?

这个问题等价于二项式展开 \((a+b)^n\) 的系数,也就是二项分布。\(n\) 很大的时候,这些系数中间巨大、两边迅速衰减,形状正是那个钟形。但直接算 \(n!\) 特别费劲,于是人们想要一个近似的公式。

1733 年,法国的棣莫弗(Abraham de Moivre)干了一件了不起的事:他找到了二项式系数的近似,发现它逼近一条钟形曲线。为了得到这个近似,他还顺带把 \(n!\) 的近似给搞了出来——这就是后来所谓的斯特林公式。有意思的是,公式里那个常数 \(\sqrt{2\pi}\) 其实是棣莫弗先摸到的,斯特林只是把常数补完整了。所以严格讲,正态分布第一次露脸,是在算赌钱的概率里,而不是在什么高深的科学里。

高斯:测量误差逼出来的分布

真正让钟形曲线"封神"的,是天文学。

1801 年,意大利天文学家皮亚齐发现了谷神星,但只观测了四十来天就找不着了,全欧洲都在猜它跑哪儿去了。24 岁的高斯(Carl Friedrich Gauss)用自己的一套办法,从这些带误差的观测数据里算出了一个轨道,结果别人照着他算的位置,真的又找回了谷神星。高斯一战成名。

他用的办法,就是最小二乘法:找一条轨道,让所有观测误差的平方和最小。但这里有个隐藏的坑——为什么是"平方"?为什么不是绝对值,不是四次方?高斯必须给个理由。

1809 年,高斯在《天体运动理论》里给出了理由。他的论证大致是:假设误差是由大量微小扰动叠加而成的,那么误差应该服从一个特定的分布;而这个分布,恰好让"平方和最小"等价于"最有可能"。这个分布就是

\[f(x)=\frac{1}{\sigma\sqrt{2\pi}}\,e^{-\frac{(x-\mu)^2}{2\sigma^2}}\]

顺便说一句,最小二乘法的"优先权"一直有争议:勒让德在 1805 年就先发表了它。高斯倒挺大度,说自己 1795 年就开始用了。这场公案到现在也没个干净的了断,但没关系,重要的是这条曲线从此有了科学地位。

所以高斯分布的"高斯"两个字,来自测量误差、来自天文学,而不是来自什么抽象数学。人们先是在现实里反复撞见它,然后才去问"为什么"。

拉普拉斯:把"为什么"证了出来

真正回答"为什么"的,是拉普拉斯(Pierre-Simon Laplace)。

他做的事情,可以概括成一句话:不管单个因素是什么分布,只要数量足够多、彼此足够独立、单个因素又都别太离谱,那么它们的总和就必然逼近正态分布。 这就是中心极限定理(CLT)的核心。

这句话的分量极重。它等于说:正态分布不是某个特定现象的特殊性质,而是"大量微小独立因素的叠加"这个操作本身的性质。谁在叠加,谁就趋向钟形,几乎不管你原来的因素长什么样。

拉普拉斯在 1810 年前后证明了这件事的一个版本,后来切比雪夫、马尔可夫、李雅普诺夫(1901)、林德伯格(1922)等人又把它推广、收紧,把条件弄得越来越精确。今天我们说的中心极限定理有很多版本,但灵魂都是拉普拉斯那句话。

"正态"这名字,其实是后起的

有个细节值得说:高斯和拉普拉斯那会儿,没人管它叫"正态分布",大家叫它"误差律"(law of error)、"误差频率律"。

到了 19 世纪,比利时人凯特勒(Adolphe Quetelet)做了一件很有争议的事:他把这个本来用于测量误差的曲线,拿去套社会数据。他统计了上千名苏格兰士兵的胸围,发现居然也服从这个钟形曲线。于是他提出了"平均人"(l'homme moyen)的概念,认为社会现象背后也有和天体一样的规律。这个举动影响巨大,但也埋下了后面哲学上的争论。

高尔顿(Francis Galton)后来研究遗传、研究身高,发现身高也服从这个分布,还提出了"向均值回归"(regression to the mean)——这成了现代统计里"回归"这个词的源头。高尔顿把这条曲线叫"误差频率律",还称它是"至高无上的法则"。

"正态"(normal)这个词,是 19 世纪下半叶才慢慢流行起来的,皮尔逊、高尔顿、莱克西斯这些人都用过。皮尔逊晚年还承认过,这名字挺糟糕,容易让人以为其他分布都"不正常"。这个命名上的包袱,正好引出我们后面哲学部分要讲的东西。

数学:正态分布是怎么被"逼"出来的

上面是历史,现在把数学上的道理拆开看。主要有五层。

第一层:可加性——为什么总和趋向正态

中心极限定理用式子说就是:如果 \(X_1, X_2, \dots, X_n\) 独立同分布,均值 \(\mu\)、方差 \(\sigma^2\),那么它们的平均值标准化之后

\[\frac{\bar X - \mu}{\sigma/\sqrt{n}}\ \xrightarrow{d}\ N(0,1)\]

也就是说,随着 \(n\) 增大,无论 \(X_i\) 原来是什么分布(均匀、指数、抛硬币……),它们的平均值都收敛到标准正态。

这件事之所以成立,背后是"特征函数"在起作用。特征函数是概率分布的傅里叶变换,独立变量求和,特征函数就相乘。把乘积展开、只保留前几项,最后一定冒出 \(e^{-t^2/2}\) 这个因子——而 \(e^{-t^2/2}\) 正是正态分布的特征函数。所以"求和→正态"不是巧合,是傅里叶变换和泰勒展开联手逼出来的。

第二层:公式里为什么有 \(e\)\(\pi\)

那个公式里有两个数学世界的"大明星":\(e\)\(\pi\)。它们是怎么钻进来的?

\(e\) 来自"极限":概率论里凡是涉及大量独立事件累积的地方,几乎必然出现 \((1+\frac{x}{n})^n \to e^x\)。正态分布的指数形式,本质就是这种极限的产物。

\(\pi\) 来自"对称性"和归一化。要让整条曲线下的面积等于 1,就得算高斯积分

\[\int_{-\infty}^{\infty} e^{-x^2}\,dx = \sqrt{\pi}\]

这个积分为什么带 \(\pi\)?因为它是圆的面积在作怪:把积分平方,转成极坐标,\(x^2+y^2=r^2\) 里那个圆就露出来了。所以 \(\pi\) 出现在正态分布里,是因为这个分布和一个"圆"有隐秘的联系。

第三层:稳定性——正态加正态还是正态

正态分布有一个别的分布几乎都没有的性质:两个独立正态变量之和,还是正态分布,只是均值和方差各自相加。这叫"稳定性"。

在"大量独立微小因素叠加"这个场景里,稳定性极其关键:如果每一步叠加都保持形状不变、只是变宽,那么经过无穷多步之后,你自然还待在"正态"这个家族里。换句话说,正态分布是"求和"这个操作下的一个不动点、一个吸引子。别的分布跌进来,走着走着就都变成了它。

第四层:最大熵——一个信息论的视角

还有一个更现代的视角,来自 E.T. Jaynes 的"最大熵原理"(1957)。问题反过来问:如果我只知道一个分布的均值 \(\mu\) 和方差 \(\sigma^2\),别的什么都不知道,那我应该选哪个分布才最"诚实"、最不引入偏见?

答案是正态分布。在所有均值和方差固定的分布里,正态分布的熵最大——它是在"只知道前两阶矩"这个约束下,最无偏见、最"含混"的选择。

这个视角很有意思:它不把正态分布看成"自然的铁律",而看成"信息不足时的默认选项"。我们后面讲哲学,还会回到这一点。

第五层:它是扩散方程的解

把概率分布看成"一团会扩散的东西",正态分布就有一个非常物理的身份:它是扩散方程(热传导方程)的基本解。

\[\frac{\partial u}{\partial t} = D\frac{\partial^2 u}{\partial x^2}\]

这个方程从一个点出发,解随时间演化,就是一个越变越宽的高斯函数

\[u(x,t)=\frac{1}{\sqrt{4\pi Dt}}e^{-\frac{x^2}{4Dt}}\]

这个身份很重要,因为它把数学和物理直接接上了。下一节讲物理,就从这里讲起。

物理:随机游走、热和量子谐振子

随机游走与布朗运动

设想一个花粉颗粒悬浮在水里,被无数水分子东撞一下、西撞一下。每一撞都是随机的、独立的、微小的。花粉颗粒经过一段时间后的位移,就是这成千上万次微小碰撞的总和。

根据中心极限定理,这个位移应当服从正态分布。1905 年,爱因斯坦正是从"随机游走"的模型出发,推导出布朗运动,并写下扩散方程——位移的分布就是一个高斯分布,方差随时间线性增长。后来佩兰的实验验证了爱因斯坦的预言,顺带敲定了原子的存在。

所以物理里最直观的"正态分布无处不在"的原因就是:当一个量是大量独立随机微扰的累积时,它就逃不出钟形曲线。

麦克斯韦速度分布

气体里每个分子的速度分量,为什么也服从正态分布?

因为分子的速度是无数次碰撞累积的结果,而且碰撞是随机的、独立的。于是每个速度分量(比如 \(v_x\) 方向)服从均值 0、方差 \(kT/m\) 的正态分布;三个分量独立,合起来就是麦克斯韦分布。注意一个细节:分子的"速率" \(v=\sqrt{v_x^2+v_y^2+v_z^2}\) 服从的不是正态,而是麦克斯韦速率分布——因为速率是三个高斯分量的"长度",不再是简单求和了。这个区分很重要,它说明正态分布只对"求和量"天然成立。

统计力学:平衡态附近的涨落是高斯

更一般地说,统计力学里,一个系统在平衡态附近的涨落,几乎总是高斯的。原因是:把熵 \(S\) 在最大值附近展开,一阶项为零,领头项是二阶项

\[S \approx S_{\max} - \frac12 \sum_i \lambda_i x_i^2\]

而概率正比于 \(e^{S/k}\),于是

\[p \propto e^{-\frac12 \sum_i \lambda_i x_i^2}\]

这就是高斯。所以"平衡态附近是高斯涨落"在物理里几乎是个普遍结论——只要你离平衡态足够近。

量子谐振子的基态

再往微观走一步:量子力学里,一维谐振子的基态波函数长这样

\[\psi_0(x) = \left(\frac{m\omega}{\pi\hbar}\right)^{1/4} e^{-\frac{m\omega x^2}{2\hbar}}\]

又是一个高斯。它和前面那些不是巧合,而是一脉相承:谐振子的势能是二次的 \(V=\frac12 m\omega^2 x^2\),基态是能量最低的态,而高斯恰恰是"在位置和动量的不确定度之间最平衡"的形状——它同时达到海森堡不确定关系的下界。

哲学:它意味着什么,又不意味着什么

从"多因之果"到数学定理

正态分布的哲学根基,古人其实早有直觉:一个结果若是许多微小原因共同造成的,这些原因的效应会大致抵消,剩下一个居中的、可预期的结果。亚里士多德、盖伦这些人都表达过类似的意思。

中心极限定理的意义,就是把这条朴素的哲学直觉,变成了一条可以被证明、可以被量化的数学定理。它告诉我们:只要"多因、独立、微小"这三个条件大致成立,结果就趋向正态。这是数学史上少数几条"从世界抽象出来、又反过来解释世界"的定理。

拉普拉斯的决定论与概率的张力

这里有个有趣的转折。拉普拉斯本人是决定论的代表人物——他写过著名的"拉普拉斯妖":如果有一个存在知道宇宙里所有粒子的位置和速度,它就能算出过去和未来的一切。

但同一个人,又发展了概率论,证明了中心极限定理。表面看矛盾,其实不矛盾:决定论说的是"底层物理定律确定",概率论说的是"我们人类信息不足,只能用概率来描述"。正态分布恰好站在这个交点上——它不是自然本身的属性,而是"我们在信息有限时,对大量复杂原因的一种最优描述"。这正好接上前面最大熵原理给出的结论。

"平均人"的教训:从理想化到误用

凯特勒的"平均人"引发了一个持久的哲学问题:正态分布描述的是"真实的规律",还是仅仅"我们的理想化"?

凯特勒把它当成社会规律的证据,仿佛社会也服从天体的法则。但高尔顿后来指出,凯特勒的"平均人"其实并不存在——没有哪个人真的长着"平均身高、平均体重、平均胸围"。均值是一种抽象,不是实在。

这个争论一路延续到今天。它的教训是:正态分布是一个极其有用的模型,但它是模型,不是现实本身。把模型当现实,是历史上很多统计误用的根源。

不是所有东西都正态:幂律与胖尾

最后必须泼一盆冷水。正态分布虽然无处不在,但它绝不是万能的。它的成立依赖"独立 + 微小 + 求和"这几个条件,而现实里大量东西并不满足:

如果因素是相乘的而不是相加的,结果趋向的是对数正态,不是正态——这个我们下一节结合具体例子讲。如果因素之间有强烈关联、有正反馈、有"赢家通吃",结果可能是幂律分布,尾巴又长又肥:城市人口、财富、地震能量、书籍销量,很多都是这种。曼德博(Benoit Mandelbrot)研究了一辈子这件事,指出金融市场收益的"胖尾"远比正态分布预测的严重;塔勒布(Nassim Taleb)的"黑天鹅"也是在讲:正态分布会严重低估极端事件。

所以对正态分布的正确态度是:它是大量"独立、微小、可加"现象的一个极好的默认模型,但不是普适真理。知道它什么时候成立、什么时候失效,比会背它的公式重要得多。

一句话总结:加性出正态,乘性出对数正态

把整篇文章收成一个最实用的结论,就是这一句:如果一个量是许多独立微小因素的"和",它就趋向正态;如果是许多独立微小因素的"积",它就趋向对数正态——也就是取对数之后才正态。

拿我们做地球化学的人来说,这个区分天天在用。岩石、土壤、水里的微量元素含量,比如稀土、痕量金属,绝大多数服从的是对数正态分布,而不是正态分布。原因就是:元素的富集、分配很多是乘性的过程——分离结晶里的分配系数、稀释、富集,一步乘一步,累积起来就成了乘积。所以原始浓度画出来是右偏的,取了对数之后才变成漂亮的钟形。阿伦斯(L. H. Ahrens)1954 年那篇经典的《元素的 lognormal 分布》,讲的就是这件事。

反过来,像测量误差、身高、零件尺寸这些,本质是"加"出来的,就老老实实服从正态。

所以下次你拿到一批数据,先别急着套正态分布,先问一句:这个东西是怎么"长"出来的?是加出来的,还是乘出来的?这一个问题,往往比任何统计检验都更能告诉你该用什么模型。

收尾

从棣莫弗算赌注,到高斯测星星,到拉普拉斯的定理,再到爱因斯坦的花粉、麦克斯韦的气体、量子力学的谐振子,最后到凯特勒的"平均人"和曼德博的胖尾——正态分布这一路,串起了概率论、统计、物理、化学、社会学和哲学。

它之所以无处不在,不是因为它有多神秘,而是因为"大量独立微小因素的叠加"这件事在世界上太普遍了,而数学又恰好证明了:只要你在做这件事,结果就必然是钟形。

它是一条从混乱里长出来的秩序。但请记得,它不是唯一的秩序,也不是万能的秩序。理解它成立的条件,比膜拜它的形状,更有价值。