机器学习数学 · 15
0% READ
课程首页
JUNIOR ML MATH / UNCERTAINTY

正态 × Beta不只猜一个数,还要说“我有多确定”

纸飞机每次飞行距离不完全相同;硬币正面概率也不是一眼就知道。分布把“可能在哪儿”和“我们有多确定”画成一座山。

正态分布概率密度Beta 更新不确定性
LEARNING ROUTE① 分清离散与连续② 用 μ、σ 读钟形山③ 用面积读概率④ 用证据更新相信程度
00 / WHY DISTRIBUTIONS

机器学习不能只报答案,还要知道答案会不会摇摆

同一架纸飞机飞 20 次,距离会受风、出手角度和测量误差影响。若模型只说“能飞 6 米”,我们不知道它是稳定在 6 米附近,还是从 2 米到 10 米都可能。分布把这种不确定性保留下来。

6 m

只有一个平均值

告诉你中心,却没有告诉你数据散得多开。它像只在地图上放一个图钉。

6 ± ?

再给一座分布山

山峰表示常见位置,山有多宽表示波动大小;面积还能回答“落在某个区间的概率”。

它在机器学习里解决什么?

看噪声测量不是每次都一样
算风险预测落进危险区有多可能
表达信心样本太少时别装作确定
继续更新新证据来了就调整判断
01 / DISCRETE OR CONTINUOUS

先问:答案是一个个数出来,还是在数轴上连续滑动?

离散:可以一个个数

0123

例如 3 次投篮命中几次。第 14 章的二项分布就在处理这种数据。

连续:中间还能无限细分

例如身高、温度、纸飞机距离。5.8 米与 5.9 米之间,还有 5.81、5.811……

为什么这一步重要? 离散数据把每个值的概率列出来;连续数据有无限多个取值,必须改用“曲线下的一段面积”表示区间概率。
02 / NORMAL DISTRIBUTION

正态分布:很多小影响叠在一起,常会形成中间高、两边低的钟形山

纸飞机距离同时受许多微小因素影响:风向一点、力度一点、角度一点。它们有的把结果推高,有的把结果拉低。大量重复后,数据常在中间聚集,越远离中间越少见。

f(x) = 1/(√(2π)σ) · exp(−(x−μ)²/(2σ²))
μ均值 / 中心

决定山峰站在哪里。μ 增大,整座山向右移动。

σ标准差 / 宽度

决定数据散得多开。σ 小更集中,σ 大更分散。

x正在观察的值

用 z=(x−μ)/σ 可以看它离中心有几个标准差。

σ 和 σ² 不一样:σ 是标准差,与 x 使用相同单位;σ² 是方差,单位会平方。公式分母出现 σ²,但调节“山宽”时常说 σ。
03 / BELL-CURVE LAB

拖动 μ 和 σ,亲眼看中心与宽度各管什么

μσ
纸飞机飞行距离模型
横轴可想成距离;蓝色带是 μ±σ,正态分布约 68% 的结果落在这里。
标准分数 z1
该处密度 f(x)0.242
μ±σ 区间[−1, 1]
区间内面积约 68%
04 / HEIGHT IS NOT PROBABILITY

曲线的高度像“拥挤程度”,真正的概率要看一段面积

假设飞行距离服从 μ=6、σ=1 的正态分布。曲线在 x=6 的位置最高,意思是 6 米附近最密集;它并不表示“恰好等于 6.000…米”的概率最大。

只指一个精确点

点没有宽度,所以面积为 0。理想连续模型里 P(X=6)=0;这不是说 6 米附近不会出现。

问一个有宽度的区间

例如 P(5.5≤X≤6.5),就是曲线在 5.5 到 6.5 之间盖住的面积。

现实测量为什么仍会看到“6.0 米”?尺子会四舍五入。“6.0 米”其实代表一个小区间,例如 5.95 到 6.05 米,而不是无限精确的一个点。
05 / BETA DISTRIBUTION

硬币正面概率 p 也是未知数:Beta 把“可能的 p”画成一座山

普通分布的横轴可以是身高或距离;Beta 分布的横轴很特别,是一个从 0 到 1 的概率 p。山峰附近表示“哪些概率值更可信”,山的宽窄表示我们有多不确定。

Beta(p; α,β) ∝ pα−1(1−p)β−1  0≤p≤1

α:偏向成功的证据

看到一次成功,α 加 1。α 越相对大,山通常越往 1 的方向移动。

β:偏向失败的证据

看到一次失败,β 加 1。β 越相对大,山通常越往 0 的方向移动。

α+β:证据强度

比例相同但总数更大时,分布更窄,表示对 p 的估计更稳定。

别把 α、β 永远当成原始次数。它们是形状参数,也可理解为“已有证据 + 新证据”。本章从均匀先验 Beta(1,1) 出发:看到 6 次成功、4 次失败后,会得到 Beta(7,5)。若一本书直接画 Beta(6,4),它是在直接指定形状参数,记数约定不同。
06 / UPDATE LAB

按下“成功”或“失败”,看新证据怎样改变模型的相信程度

β
未知硬币的概率侦探
起点 Beta(1,1) 是一条平线:0 到 1 没有哪个 p 特别占优势。
00.51
α1
β1
平均估计 α/(α+β)0.50
不确定性(标准差)0.289
07 / POINT OR RANGE

“最佳猜测是 60%”不等于“真实概率一定是 60%”

点估计只给一个代表值;分布和可信区间告诉我们哪些邻近值也说得通。样本少时区间宽,模型应该谨慎;样本多且结果稳定时区间变窄。

同样是 60%,信心可以不同

3 成功 / 5 次与 300 成功 / 500 次的比例都是 60%,但后者提供了更多证据,Beta 分布会更窄。

一个实用决定

若模型预测机器故障概率约 60%,但区间非常宽,就应继续收集传感器数据,而不是立刻做昂贵决定。

正态分布也不是万能模板:概率必须在 0 到 1 之间,普通正态曲线却延伸到整个数轴。因此估计概率 p 时,Beta 往往比直接套正态更自然。
08 / MACHINE LEARNING

机器学习用分布管理噪声、参数和风险

回归预测

模型预测送达时间的中心值,并用正态分布描述上下波动;这样可回答“30 分钟内送到的概率”。

点击率与成功率

新按钮只有几次点击记录。Beta 分布让系统把旧经验和新数据合并,避免小样本造成过度自信。

主动学习与安全

模型优先把“不确定性高”的样本交给人检查;在医疗或设备预警中,知道不确定往往和答案本身一样重要。

数据 → 似然(新证据) × 先验(原有认识) → 后验(更新后的分布)
09 / RECAP

把本章浓缩成四张卡片

μ 管中心移动 μ,整座正态山左右移动。
σ 管宽度σ 大更分散,σ 小更集中。
概率看面积密度是高度;区间下的面积才是概率。
Beta 管未知 p新成功加 α,新失败加 β;证据多通常更窄。
10 / CHECK

选择后立即出答案,并指出没有掌握的知识点

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 哪个量更适合看成连续变量?
2. 保持 σ 不变而增大 μ,正态曲线会怎样?
3. 两组数据均值相同,哪组对应更大的 σ?
4. 正态曲线在 x=6 处很高,最准确的解释是?
5. P(5≤X≤7) 在密度图上对应什么?
6. Beta 分布的横轴 p 通常表示什么?
7. 从 Beta(1,1) 开始,观察到一次成功后得到?
8. 均匀先验 Beta(1,1) 加上 6 成功、4 失败后是?
9. 3/5 与 300/500 都是 60%,哪一个估计通常更稳定?
10. 模型估计点击率为 0.6,正确理解是?
11. 为什么 Beta 常比普通正态更适合描述概率 p?
12. 模型在哪种情况下最应该主动请求更多数据或人工检查?
0

VISUAL FIRST · 一图读懂

钟形山的位置和宽度分别由什么决定?

一个控制器负责左右移动中心,另一个负责收紧或放宽曲线;两件事不能混为一谈。

孩子用两个控制器移动和拉宽钟形曲线以匹配目标曲线的无文字插图
HOW TO READ
读图顺序
中心决定位置

平均值改变时,整座钟形山向左或向右移动。

标准差决定宽窄

数据越分散,山越宽越矮;越集中,山越窄越高。

用面积表达概率

连续分布关注某个区间下方的面积,而不是单点高度。