大数学家高斯一生有无数的数学发现,但是被人称为其一生最大的发现则是高斯分布。高斯分布(也称为正态分布)是概率论和统计学中最重要的分布之一。它的公式看起来很复杂,这个公式到底是怎么来的呢? \[ f(x) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}} \]
其中,\(\mu\) 是均值,\(\sigma\) 是标准差。
实际上,正态分布的最早发现者是棣莫弗。棣莫弗是法国数学家,尽管他在学术研究方面颇有成就,但却贫困潦倒,终生未婚。每次想起棣莫弗的人生经历,我总是嘘唏不已。为了生活,棣莫弗一直做数学方面的家庭教师。另外,他不时撰写文章,还参与研究确定保险年金的实际问题,但获得的收入却极其微薄,只能勉强糊口。他经常抱怨说,周而复始从一家到另一家给孩子们讲课,单调乏味地奔波于雇主之间,纯粹是浪费时间。为此,他曾做了许多努力,试图改变自己的处境,但无济于事。
棣莫弗对概率方面的问题十分感兴趣,很早就发现了正态分布的公式,牛顿对棣莫弗十分欣赏。据说,后来遇到学生向牛顿请教概率方面的问题时,他就说:“这样的问题应该去找棣莫弗,他对这些问题的研究比我深入得多”。
下面我从棣莫弗的发现给大家说一下正态分布的发现过程。棣莫弗发现正态分布雏形的过程,是数学史上一次智慧的飞跃,但他当时并没有完全认识到这个发现的全部意义。他的工作是在解决一个非常实际的问题中产生的。
8世纪初,赌博游戏中的概率问题推动了许多数学发展。棣莫弗研究的是一个经典的二项分布问题:抛一枚公平的硬币 n 次,恰好出现 k 次正面的概率是多少?
棣莫弗首先成功地推导出了当 $p = \frac {1} {2}$ 时,二项概率的一个精确(但依然复杂)的表达式:
$$P(X=k) = \binom{n}{k} \left(\frac {1} {2} \right)^2 $$
但是当 n 非常大时,计算二项系数 $\binom{n}{k}$(即组合数)是极其繁琐的,在没有计算机的时代,这简直是一场噩梦。棣莫弗迫切需要一个大数 n 情况下的近似公式。棣莫弗首先推导出了阶乘 n! 的一个近似公式,这后来被他的朋友詹姆斯·斯特林完善为著名的斯特林公式:
$$n! = \sqrt{2πn} \binom{n}{k} \left(\frac {n} {e} \right)^n $$ 这是整个推导过程中最关键的一步,因为它把难以处理的阶乘转化成了指数和根式的形式。利用这个阶乘近似,他代入二项概率公式,并进行了一系列非常复杂的代数运算和化简。经过艰难的推导,大约在1733年,棣莫弗得到了一个惊人的结果:当 n 很大时,二项分布的概率分布可以近似地用以下函数描述:
\[ \frac{1}{\sqrt{2\pi n/4}} e^{-\frac{2}{n}(k-n/2)^2} \]
如果我们用现代符号解读:
令 $x = k$
令 $\sigma = \sqrt{n}/2$ 为标准差
令 $\mu = n/2$ 为均值
那么,棣莫弗的公式本质上是:这正是均值为 $n/2$,方差为 $n/4$ 的正态分布概率密度函数!
尽管棣莫弗首次推导出了正态分布的数学形式,但他的发现存在几个历史局限性:
仅限于 $p = 1/2$: 他只研究了公平硬币(概率为$1/2$)的情况,没有推广到任意概率$p$。
视为近似工具,而非独立分布: 棣莫弗只是把这个公式当作一个计算二项分布的近似工具。他并没有把它视为一个独立的、具有普遍意义的概率分布。
未认识其普适性: 他没有意识到这个分布本身在误差分析、自然现象等领域拥有广泛的应用前景。他解决的是一个具体的数学问题,而非在探索一个普适定律。
几十年后,皮埃尔-西蒙·拉普拉斯读到了棣莫弗的工作,并将其推广到了 任意概率 $p$ 的情况,这就是著名的棣莫弗-拉普拉斯中心极限定理,它正式揭示了二项分布与正态分布之间的深刻联系。后来,高斯在研究误差理论时,独立地再次发现了这个分布,并系统地阐述了它的性质,使其广为人知,故而得名“高斯分布”。
天文学和大地测量学中,对同一个量(比如行星的位置、一座山的高度)进行多次测量,得到的结果总会略有差异。这些差异就是“误差”。如何从这些充满误差的测量值中,找出最可信的“真值”?高斯提出了几个合理的假设:
误差是随机的,小误差比大误差更可能出现。
测量值围绕真值对称分布。
真值应该是让所有观测值出现的概率最大的那个值。
基于这些假设,高斯进行数学推导,发现误差的概率分布函数必须符合我们上面看到的那个公式。他成功地将问题“反解”了——不是先有分布再找真值,而是基于“最可信真值”的原则,反推出了误差必须遵循的分布形式。因此,这个分布也常被称为高斯分布。
高斯分布的推导基于以下几个假设:
分布是对称的,且峰值在均值 \(\mu\) 处。
数据点离均值越远,出现的概率越小。
分布的形状由均值和标准差决定。
我们希望找到一个函数 \(f(x)\),使得:
\(f(x)\) 在 \(x = \mu\) 处取得最大值。
\(f(x)\) 随着 \(|x - \mu|\) 的增大而减小。
整个函数在实数轴上的积分为1(即总概率为1)。
为了满足上述条件,我们可以考虑使用指数函数。假设 \(f(x)\) 的形式为:
\[ f(x) = A e^{-k(x-\mu)^2} \]
其中,\(A\) 和 \(k\) 是待定常数。指数函数 \(e^{-k(x-\mu)^2}\) 在 \(x = \mu\) 处取得最大值1,并且随着 \(|x - \mu|\) 的增大而减小。
为了确定 \(k\),我们需要考虑方差 \(\sigma^2\)。方差是数据点与均值之间距离的平方的期望值。通过计算,我们可以得到:
\[ k = \frac{1}{2\sigma^2} \]
为了使 \(f(x)\) 在整个实数轴上的积分为1,我们需要对 \(f(x)\) 进行归一化。通过积分计算,可以得到:
\[ A = \frac{1}{\sqrt{2\pi}\sigma} \]
将 \(A\) 和 \(k\) 代入 \(f(x)\) 的表达式,我们得到高斯分布的概率密度函数:
\[ f(x) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}} \]
高斯分布的推导基于对称性、峰值在均值处、以及随着距离均值的增大而减小的概率密度。通过引入指数函数并确定常数 \(A\) 和 \(k\),我们得到了高斯分布的数学公式。这个公式在统计学和概率论中有着广泛的应用。