机器学习数学 · 13
0% READ
课程首页
JUNIOR ML MATH / BAYES

贝叶斯用新证据更新原来的判断

我们通常先对原因有一个初步判断,再看到数据。贝叶斯定理把“原因怎样产生结果”翻转成“看到结果后,原因有多可能”,并让每次新证据继续修正判断。

先验似然后验连续更新
LEARNING ROUTE① 先有初步判断② 检查证据匹配度③ 在全部证据中归一化④ 后验变成新先验
00 / WHY BAYES

传感器报警了,设备真的故障了吗?

“故障时容易报警”和“报警时很可能故障”听起来相近,其实分母不同。若故障本来极少,即使传感器很灵敏,大量正常设备中的少量误报也可能占据报警的大部分。

97%

故障时报警

这是 P(报警|故障),描述结果怎样由原因产生。

16.3%

报警时故障

在原文数据中,这是 P(故障|报警),是反向问题。

贝叶斯解决的四个问题

翻转条件从结果反推可能原因
考虑基础比例罕见原因不能被忽略
比较多种解释让原因公平竞争
连续学习新证据到来就更新判断
  • 能从条件概率乘积公式推出贝叶斯公式
  • 能区分先验、似然、证据和后验
  • 能用具体人数检查计算结果
  • 能用后验作为下一轮先验继续更新
01 / REVERSE THE QUESTION

同一句话交换条件与目标,问题就完全不同

假设 H设备是否故障
数据 D传感器是否报警
反向判断报警后更相信哪个原因
P(D|H)故障时报警

把“已知故障设备”作为范围。

P(H|D)报警时故障

把“所有报警设备”作为范围。

通常不相等

两个问题的分母不同。

先别背公式:如果问“报警的设备里有多少真的故障”,就应该先圈出全部报警设备,再看其中故障设备所占比例。
02 / DERIVATION

贝叶斯定理不是魔法,只是把同一个交集写两遍

事件 H 与 D 同时发生的概率,可以先从 H 出发,也可以先从 D 出发。两条路线到达的是同一个交集。

1
P(H∩D)=P(H)P(D|H):先进入 H,再在 H 中遇到 D。
2
P(H∩D)=P(D)P(H|D):先进入 D,再在 D 中遇到 H。
3
两个右边都等于同一个 P(H∩D),所以令它们相等。
4
两边除以 P(D),得到要找的 P(H|D)
P(H|D)=P(D|H)P(H)P(D) (P(D)≠0)
竖线两侧不要偷偷交换:公式的工作正是用已知的 P(D|H) 算出反向的 P(H|D)。若把两者当成同一个数,就失去了贝叶斯定理的意义。
03 / FOUR PARTS

四个零件都在回答不同问题

P(H) · 先验看数据之前

原本认为假设 H 有多可能。

P(D|H) · 似然假如 H 为真

现在这份数据 D 有多容易出现。

P(D) · 证据不管原因是谁

所有可能原因产生 D 的总概率,用来归一化。

P(H|D) · 后验看完数据之后

结合新证据后,对 H 的更新判断。

后验 ∝ 似然 × 先验

符号 读作“正比于”。它提醒我们:先用“似然 × 先验”给各个原因打未归一化分数,再除以所有原因分数之和,使后验概率总和回到 1。

04 / BAYES CALCULATOR

调节三个概率,看谁真正推动后验

沿用 1000 个设备的简化例子。原文初始值:故障率 0.2%、故障检出率 97%、正常设备误报率 1%。

P(H|D)
BAYES REVERSER / 贝叶斯反推器
所有结果同时用概率和“每 1000 个数量”显示
先验 P(H)0.2%
似然 P(D|H)97%
证据 P(D)1.192%
后验 P(H|D)16.3%
报警设备中约 16.3% 故障
真报警:1.94 个 = 1000×先验×检出率
误报警:9.98 个 = 1000×(1−先验)×误报率
后验:1.94÷11.92=16.3%
分子0.194%
分母1.192%
检出率很高,但故障先验很低;正常设备数量巨大,少量误报也会累积。
05 / MANY HYPOTHESES

不止两个原因时,让所有候选一起进入分母

若结果 D 可能由 H₁,H₂,…,Hₙ 这些互斥且完整的原因产生,就把所有“似然 × 先验”相加,得到证据概率。

P(D)=ΣⱼP(D|Hⱼ)P(Hⱼ)
P(Hᵢ|D)=P(D|Hᵢ)P(Hᵢ)Σⱼ P(D|Hⱼ)P(Hⱼ)
候选 H₁默读单词
计算“通过可能性 × 原本选择比例”
候选 H₂朗读单词
计算同样的未归一化分数
候选 H₃边写边记
三个分数相加成为分母
分母的任务:它不是神秘常数,而是让所有后验概率相加恰好等于 1,形成一份公平的候选原因排名。
06 / BAYESIAN UPDATE

后验不是终点,它会成为下一轮的先验

旧先验还没看新证据
+
新证据计算各假设似然
新后验下一轮继续使用

原文例子比较两种来源:A 预科学校学生通过率 80%,其他学生通过率 60%。最初不知道来源,所以暂时把两种先验都设为 50%。这只是“没有更多信息时的中性起点”,不是已经查明的事实。观察“通过、通过、未通过”后,对 A 来源的判断会依次变为约 57.1%、64.0%、47.1%。

这个连续更新还有一个模型假设:在已经知道来源的条件下,我们暂时把不同学生的通过结果看作互相独立,并假设通过率保持 80% 或 60%。如果同学之间会互相影响,或每年通过率变化,就要修改模型。
更新不是“看到一次就确定”:一条证据只按它的区分能力调整概率。若两个假设下这条证据都很常见,更新幅度就不会很大。
07 / UPDATE LAB

连续点击证据,观察判断怎样一步步移动

假设 Hₐ=“这组学生来自 A 预科学校”,Hᵦ=“来自其他学校”。两边通过率分别为 80% 与 60%。

→→
EVIDENCE CONVEYOR / 证据传送带
每次更新后,后验自动成为下一次先验
当前相信 Hₐ50.0%A 校通过率 80%
当前相信 Hᵦ50.0%其他学校通过率 60%
A
B
0尚未观察证据先验 50.0%
若观察“通过”似然 80% vs 60%
若观察“未通过”似然 20% vs 40%
点击一条证据。能区分两种假设的证据会推动概率移动。
08 / MACHINE LEARNING

贝叶斯思想怎样进入机器学习?

朴素贝叶斯分类

用各类别先验和特征似然计算后验,常用于文本、邮件等快速分类。“朴素”来自条件独立假设。

融合新数据

机器人根据新传感器读数不断更新位置或状态判断,而不是每次从零开始。

表达模型不确定

贝叶斯方法不只给一个参数答案,还关心各种参数可能性的分布,为风险判断保留不确定性。

先验不是随便编造就结束:先验应来自历史数据、领域知识或清楚说明的中性假设;还应检查换一个合理先验后结论是否稳定。
09 / RECAP

把贝叶斯学习浓缩成四张卡片

先验看见当前数据前的判断
P(H)
似然H 为真时数据有多合理
P(D|H)
后验结合数据后的新判断
P(H|D)
更新后验变成下一轮先验
prior → posterior
10 / CHECK

知识检测:选择后立即诊断

题目同时检查术语、公式、人数直觉和连续更新,避免只会背公式。

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 贝叶斯定理最核心地帮助我们做什么?
2. 贝叶斯公式 P(H|D) 等于?
3. P(H) 为什么叫先验概率?
4. 似然 P(D|H) 问的是什么?
5. 公式分母 P(D) 的主要作用是什么?
6. 为什么检出率 97% 时,报警后故障概率仍可能不高?
7. 有 2 个真报警、8 个误报警,报警后为真的概率是多少?
8. 有三个互斥原因 H₁、H₂、H₃ 时,分母应包含什么?
9. 一轮贝叶斯更新结束后,后验通常怎样继续使用?
10. A 假设下“通过”概率 80%,B 假设下为 60%。观察到通过后,A 的概率通常怎样?
11. 连续两次“通过”后又观察到“未通过”,为什么 A 的后验可能下降?
12. 下列哪项最符合贝叶斯机器学习思想?
0

VISUAL FIRST · 一图读懂

贝叶斯更新就是让证据连续改变相信程度

每张证据卡都会推动天平;更新后的天平状态又成为下一张证据到来前的新起点。

三张图标证据卡依次经过扫描器并让信念天平逐步倾斜的无文字插图
HOW TO READ
读图顺序
先有一个起点

没有看到新证据前的相信程度,就是本轮先验。

证据推动天平

越符合某种解释的证据,就越会把判断推向那一侧。

结果接着更新

本轮后验会成为下一轮先验,因此知识可以连续积累。