机器学习不能只报答案,还要知道答案会不会摇摆
同一架纸飞机飞 20 次,距离会受风、出手角度和测量误差影响。若模型只说“能飞 6 米”,我们不知道它是稳定在 6 米附近,还是从 2 米到 10 米都可能。分布把这种不确定性保留下来。
只有一个平均值
告诉你中心,却没有告诉你数据散得多开。它像只在地图上放一个图钉。
再给一座分布山
山峰表示常见位置,山有多宽表示波动大小;面积还能回答“落在某个区间的概率”。
它在机器学习里解决什么?
先问:答案是一个个数出来,还是在数轴上连续滑动?
离散:可以一个个数
例如 3 次投篮命中几次。第 14 章的二项分布就在处理这种数据。
连续:中间还能无限细分
例如身高、温度、纸飞机距离。5.8 米与 5.9 米之间,还有 5.81、5.811……
正态分布:很多小影响叠在一起,常会形成中间高、两边低的钟形山
纸飞机距离同时受许多微小因素影响:风向一点、力度一点、角度一点。它们有的把结果推高,有的把结果拉低。大量重复后,数据常在中间聚集,越远离中间越少见。
决定山峰站在哪里。μ 增大,整座山向右移动。
决定数据散得多开。σ 小更集中,σ 大更分散。
用 z=(x−μ)/σ 可以看它离中心有几个标准差。
拖动 μ 和 σ,亲眼看中心与宽度各管什么
曲线的高度像“拥挤程度”,真正的概率要看一段面积
假设飞行距离服从 μ=6、σ=1 的正态分布。曲线在 x=6 的位置最高,意思是 6 米附近最密集;它并不表示“恰好等于 6.000…米”的概率最大。
只指一个精确点
点没有宽度,所以面积为 0。理想连续模型里 P(X=6)=0;这不是说 6 米附近不会出现。
问一个有宽度的区间
例如 P(5.5≤X≤6.5),就是曲线在 5.5 到 6.5 之间盖住的面积。
硬币正面概率 p 也是未知数:Beta 把“可能的 p”画成一座山
普通分布的横轴可以是身高或距离;Beta 分布的横轴很特别,是一个从 0 到 1 的概率 p。山峰附近表示“哪些概率值更可信”,山的宽窄表示我们有多不确定。
α:偏向成功的证据
看到一次成功,α 加 1。α 越相对大,山通常越往 1 的方向移动。
β:偏向失败的证据
看到一次失败,β 加 1。β 越相对大,山通常越往 0 的方向移动。
α+β:证据强度
比例相同但总数更大时,分布更窄,表示对 p 的估计更稳定。
按下“成功”或“失败”,看新证据怎样改变模型的相信程度
“最佳猜测是 60%”不等于“真实概率一定是 60%”
点估计只给一个代表值;分布和可信区间告诉我们哪些邻近值也说得通。样本少时区间宽,模型应该谨慎;样本多且结果稳定时区间变窄。
同样是 60%,信心可以不同
3 成功 / 5 次与 300 成功 / 500 次的比例都是 60%,但后者提供了更多证据,Beta 分布会更窄。
一个实用决定
若模型预测机器故障概率约 60%,但区间非常宽,就应继续收集传感器数据,而不是立刻做昂贵决定。
机器学习用分布管理噪声、参数和风险
回归预测
模型预测送达时间的中心值,并用正态分布描述上下波动;这样可回答“30 分钟内送到的概率”。
点击率与成功率
新按钮只有几次点击记录。Beta 分布让系统把旧经验和新数据合并,避免小样本造成过度自信。
主动学习与安全
模型优先把“不确定性高”的样本交给人检查;在医疗或设备预警中,知道不确定往往和答案本身一样重要。
把本章浓缩成四张卡片
选择后立即出答案,并指出没有掌握的知识点
钟形山的位置和宽度分别由什么决定?
一个控制器负责左右移动中心,另一个负责收紧或放宽曲线;两件事不能混为一谈。
读图顺序
平均值改变时,整座钟形山向左或向右移动。
数据越分散,山越宽越矮;越集中,山越窄越高。
连续分布关注某个区间下方的面积,而不是单点高度。