模型说“这封邮件 80% 像垃圾邮件”,究竟是什么意思?
机器学习面对的资料常有噪声,不能永远给出百分之百确定的答案。概率把不确定性变成 0 到 1 的数,帮助模型比较风险、排序候选和表达信心。
不可能发生
普通六面骰不可能掷出 7。
一定会发生
普通六面骰一定掷出 1 到 6 中的一个。
概率解决的四个问题
- 能用目标情况数除以全部情况数
- 能区分并集、交集与补事件
- 能判断试验是独立还是从属
- 能解释条件概率为什么改变分母
先分清三个角色:做一次、得到什么、关心什么
例如掷一次六面骰。
例如掷出了 4。
例如“掷出偶数”={2,4,6}。
普通骰子每一面等可能。设 A=“掷出偶数”,目标结果有 3 个,全部结果有 6 个,所以 P(A)=3/6=1/2。
补事件:A 没有发生的所有情况
如果 A 是“邮件被判为垃圾邮件”,那么 Ā(读作 A 的补事件)就是“邮件没有被判为垃圾邮件”。两者把全部可能刚好分完。
“或”画并集,“且”画交集;重叠部分不能数两遍
为什么要减一次交集?直接把 P(A) 与 P(B) 相加时,重叠部分被算了两次。减掉一次后,每个结果刚好只算一次。
第一次的结果,会不会改变第二次的机会?
独立:放回后再抽
抽到一张后把它放回并重新混合,第二次的奖票比例不变。
从属:不放回继续抽
第一张被拿走后,总数和中奖数都可能改变;第二次概率依赖第一次结果。
无放回抽奖:第一张中奖后,第二张的分母和分子都变了
箱中固定有 100 张票。拖动中奖票数量,观察“连续两张都中奖”的两步概率。
竖线不是除号:P(B|A) 表示“已知 A 时,B 的概率”
中文通常先说条件“已知 A”,公式却把要问的 B 写在左边。可以按顺序读成:“B,给定 A”。
- 先锁定条件 A。把不属于 A 的情况全部移出观察范围。
- 新的全部范围是 A。因此分母变成 P(A),不是原来的 1。
- 在 A 中寻找 B。同时满足 A 和 B 的部分是交集 A∩B。
P(A∩B)=P(A)P(B|A)=0.002×0.97=0.00194
翻译成人数:每 1000 个设备约有 2 个故障,其中约 97% 会报警,所以约有 1.94 个“既故障又报警”。先用人数读懂,再回到符号。
条件范围实验:同一张表,可以提出两个完全不同的问题
想象 1000 个设备,少数设备有故障。传感器会报警,但也可能误报。本例只用于学习概率,不代表任何真实设备性能。
已知故障:范围只有 2 个
其中报警约 1.94 个。
已知未故障:范围有 998 个
其中误报约 9.98 个。
| 每 1000 个 | 报警 | 不报警 | 合计 |
|---|---|---|---|
| 故障 A | 1.94 | 0.06 | 2 |
| 未故障 Ā | 9.98 | 988.02 | 998 |
| 合计 | 11.92 | 988.08 | 1000 |
机器学习为什么需要概率和条件概率?
分类器真正回答的常是条件问题:已知图片像素、邮件词语或学生练习记录时,它属于某个类别的概率是多少?竖线右侧就是模型已经看到的线索。
概率分类
模型不仅说“是猫”,还可以输出 0.82,表示在当前模型和数据下对猫类别的信心。
利用已有信息
看到词语“免费领取”后,一封邮件是垃圾邮件的条件概率可能改变;条件就是模型已经观察到的特征。
评估误报漏报
混淆矩阵中的准确率、召回率等指标,本质上都在不同条件范围里计数。
把概率语言浓缩成四张卡片
知识检测:选择后立即诊断
错题会指出具体知识缺口并提供回看位置;改对后仍记录首次暴露的薄弱点。
加上条件,真正改变的是比较范围
左边从全部人中统计;右边先用蓝色围栏限定人群,再只在围栏内部重新数橙色背包。
读图顺序
没有条件时,分母是场地里的所有人。
已知条件会先缩小允许参与比较的总体。
分子也必须在新范围中统计,不能沿用围栏外的人。