
我们生活在一个充满未知的世界里。明天会下雨吗?这支股票会涨吗?这张 X 光片上的阴影是肿瘤吗?面对这些问题,我们很少能给出斩钉截铁的“是”或“否”,更多时候,我们只能给出一个充满弹性的回答:有多大可能。
这种“有多大可能”,就是概率。概率不是某种神秘的物理量,它是一套严谨的语言,专门用来表达和处理不确定性。而围绕这门语言,有两种深刻影响现代科学和人工智能的思维方式:频率派与贝叶斯派。
想象一个场景:你的朋友掏出一枚硬币,随手一抛——正面。再抛,还是正面。连抛 10 次,结果令人瞠目:连续 10 次正面。
你盯着这枚硬币,心里犯起嘀咕:这硬币是不是不均匀?
这时,你大脑里其实有两股声音在较量,它们恰好对应着两种解读概率的哲学流派。
频率派(Frequentist)的思考方式很“法官”:在确凿证据出现之前,假定硬币是公平的。
它的逻辑:如果硬币真的公平(正面概率 $p = 0.5$),那么连续扔出 10 次正面的概率是多少? $$P(\text{10次正面} \mid p=0.5) = 0.5^{10} = \frac{1}{1024} \approx 0.00098$$ 这个值不到千分之一,实在太小了。
它的结论:这件事“太巧了”,巧到让我们很难继续相信“硬币是公平的”这个前提。在统计学上,这叫做“小概率事件原理”——如果一次试验中居然发生了小概率事件,我们就有理由拒绝原假设。于是,频率派法官敲下法槌:硬币不公平。
在频率派眼中,概率就是大量重复试验下,某个事件发生的相对频率。想要知道一枚硬币正面的概率?唯一的办法就是不停地扔它,扔上成千上万次,然后看正面的比例。这是一个客观的、属于这个物理硬币本身的属性。
这种思维干净利落,但它有个问题:它拒绝在看清数据之前,对“这枚硬币可能不公平”这件事赋予任何数值化的信念。可是,你真的在扔硬币之前对此毫无感觉吗?一个街边魔术师递给你的硬币,和一个收银员找零给你的硬币,你事先对“它可能有问题”的警觉程度,显然截然不同。
贝叶斯派(Bayesian)则大方得多。它认为,概率就是对某件事的相信程度,而且这种相信程度可以随着新证据的到来而不断修正。
它用一个简洁优美的公式来工作——贝叶斯定理:
$$P(H \mid E) = \frac{P(E \mid H) \cdot P(H)}{P(E)}$$
让我们用母语把它翻译一遍:
$$\text{后验概率} = \frac{\text{似然度} \times \text{先验概率}}{\text{边缘似然度}}$$
回到硬币的例子。在扔硬币之前,你对“硬币不公平”已经有一个直觉性的猜测,这就是先验概率 $P(H)$。如果硬币来自普通抽屉,这个值可能很小,比如 $0.01$;如果来自魔术师之手,这个值可能很高,比如 $0.5$。
然后,你看到了证据 $E$:“连续 10 次正面”。计算开始:
贝叶斯公式会将你的先验信念和数据证据揉合在一起,计算出一个全新的、吸收了数据之后你对硬币公平性的判断——后验概率 $P(H \mid E)$。
哪怕你的先验概率只有 $0.01$,在连续目睹 10 次正面后,后验概率也会飙升。贝叶斯思维从不宣称“绝对如此”,它只是平静地说:“鉴于我目前看到的,我现在对此的相信程度是 78%。” 如果接下来又丢了 10 次正面?这个数字会继续逼近 100%。这是一个持续学习、持续更新的过程。
这个“从信念到证据再到更新信念”的过程,听起来是不是有点耳熟?没错,它恰是当代人工智能,尤其是分类模型的核心工作方式。当你把一张图片塞给一个图像识别模型,它最后吐出来的,不是一个冷冰冰的“猫”,而是一个概率:“这张图有 90% 的概率是猫”。
让我们拆解这 90% 是如何诞生的。一个深度神经网络内部,是一层又一层的数学变换。原始图片被转化成像素值,经过成千上万个参数构成的复杂函数,最终涌向最后一层。这一层通常会接一个叫做 Softmax 的函数,它的唯一使命,就是把网络输出的那一串任意实数,强行转化为一组“看起来像概率”的数:
于是,模型给出 $[0.90, 0.07, 0.03]$——90% 猫,7% 狗,3% 兔子。
这 90% 在说什么?从频率派的角度,你可以近似地理解它为:在模型“经历”过的那千百万张训练图片里,与这张图特征极为相似的那些样本中,有 90% 是猫。但从贝叶斯的视角看,这要深刻得多:模型先有一个初始状态(随机参数),然后通过海量标注好的数据(证据),一遍遍地用类似贝叶斯更新的方法(梯度下降)去修正它内部的参数,最终形成了它对世界的一种结构化的“信念”。当新图片到来时,这个“90%”就是模型融汇了自己所有“经验”之后,对这个特定图片归属猫类的置信度。
这揭示了现代 AI 的一个关键特征:它是统计性的,而不是逻辑性的。它不进行符号推理,不会像传统程序那样用“如果-那么”规则去判定尖耳朵、胡须和毛色。它只是“感觉”到这张图像在超高维空间里的落点,与记忆中“猫”的概率分布高度重叠,然后诚实地说:“我很确定,但不是百分之百确定。”
那 10% 的不确定性,并非模型谦虚的装饰品,而是它运作方式的本质。在自动驾驶中,一个行人检测模型输出“99.99% 概率是行人”与“70% 概率是行人”,会指向完全不同的决策逻辑。在医疗影像里,一张 CT 片被标注为“92% 概率是恶性”,会直接引导医生选择更审慎的后续检查方案。
从抛硬币的思维实验,到 AI 识图的猫狗概率,我们能看到一条清晰的线索:概率是现代理性的一块重要基石。
频率派让我们保持严谨,用大量数据去逼近客观世界的真相;贝叶斯派则赋予我们灵活,让我们能坦然拥抱先验知识,并用新证据不断刷新对世界的认知。而正是后者这种“观点随事实而变”的框架,在深层逻辑上驱动了今天大部分的机器学习系统。
下一次当你看到天气预报说“明日降水概率 70%”,或者医疗报告上写着“阳性预测值为 85%”时,也许你可以更清晰地意识到,你正在阅读的,是一门描述不确定性的语言。它不保证结果,却将不确定性压缩在可衡量的数字里,这本身就代表了我们在这个随机世界里,所能达到的一种最诚实的认知状态。
评论专区
评论加载中...登录后即可发表评论