机器学习数学 · 12
0% READ
课程首页
JUNIOR ML MATH / PROBABILITY

概率先看清“分母里的世界”

概率不是模糊的“也许”。它先规定所有可能,再数目标事件占多少。条件概率则把观察范围缩小:已知一条信息后,我们只在符合条件的世界里重新计算。

试验与事件或与且独立与从属条件概率
LEARNING ROUTE① 数清所有可能② 圈出事件关系③ 判断是否互相影响④ 改变条件后的分母
00 / WHY PROBABILITY

模型说“这封邮件 80% 像垃圾邮件”,究竟是什么意思?

机器学习面对的资料常有噪声,不能永远给出百分之百确定的答案。概率把不确定性变成 0 到 1 的数,帮助模型比较风险、排序候选和表达信心。

0

不可能发生

普通六面骰不可能掷出 7。

1

一定会发生

普通六面骰一定掷出 1 到 6 中的一个。

概率解决的四个问题

表达不确定把“可能”变成可比较的数
组合事件计算“或”“且”“没有”
加入条件得到新信息后缩小观察范围
支持决策让分类器按概率排序与设阈值
  • 能用目标情况数除以全部情况数
  • 能区分并集、交集与补事件
  • 能判断试验是独立还是从属
  • 能解释条件概率为什么改变分母
01 / TRIAL, OUTCOME, EVENT

先分清三个角色:做一次、得到什么、关心什么

试验做一件结果未定的事

例如掷一次六面骰。

结果这一次实际发生什么

例如掷出了 4。

事件我们关心的一组结果

例如“掷出偶数”={2,4,6}。

P(A) = 事件 A 包含的等可能结果数全部等可能结果数

普通骰子每一面等可能。设 A=“掷出偶数”,目标结果有 3 个,全部结果有 6 个,所以 P(A)=3/6=1/2

2、4、6:目标 3 个1、3、5:其他 3 个
这个公式有条件:各个基本结果必须等可能。若骰子被做过手脚,不能只数面数,而要使用每一面的真实概率。
02 / COMPLEMENT

补事件:A 没有发生的所有情况

如果 A 是“邮件被判为垃圾邮件”,那么 Ā(读作 A 的补事件)就是“邮件没有被判为垃圾邮件”。两者把全部可能刚好分完。

P(Ā) = 1 − P(A)  并且  P(A)+P(Ā)=1
160 封邮件中有 10 封垃圾邮件。P(A)=10/160=0.0625,所以 P(Ā)=1−0.0625=0.9375
机器学习连接:二分类模型常输出“属于正类”的概率 p,那么“属于负类”的概率就是 1−p。但只有两个互补类别时才能这样直接算。
03 / OR, AND, MUTUALLY EXCLUSIVE

“或”画并集,“且”画交集;重叠部分不能数两遍

A:2 的倍数B:3 的倍数2,4631,5
交集只有 {6}。并集为 {2,3,4,6}。
A∪B至少满足一个,读作 A 并 B;日常语言常说“或”。
A∩B同时满足两个,读作 A 交 B;日常语言常说“且”。
互斥两个事件不能同时发生,所以 P(A∩B)=0
P(A∪B)=P(A)+P(B)−P(A∩B)

为什么要减一次交集?直接把 P(A) 与 P(B) 相加时,重叠部分被算了两次。减掉一次后,每个结果刚好只算一次。

04 / INDEPENDENT OR DEPENDENT

第一次的结果,会不会改变第二次的机会?

独立:放回后再抽

抽到一张后把它放回并重新混合,第二次的奖票比例不变。

P(A∩B)=P(A)P(B)

从属:不放回继续抽

第一张被拿走后,总数和中奖数都可能改变;第二次概率依赖第一次结果。

P(A∩B)=P(A)P(B|A)
独立不等于互斥:互斥表示不能同时发生;独立表示一个是否发生不改变另一个概率。若两个概率都不为 0,互斥事件反而通常不是独立的。
05 / DRAW LAB

无放回抽奖:第一张中奖后,第二张的分母和分子都变了

箱中固定有 100 张票。拖动中奖票数量,观察“连续两张都中奖”的两步概率。

NO-REPLACEMENT DRAW / 不放回抽奖
橙色代表中奖票;图中只显示 100 张
第一张中奖4/100
已知第一张中奖,第二张再中3/99
P(A)4.00%
P(B|A)3.03%
P(A∩B)0.121%
第二次范围99 张
第一张拿走一张中奖票,所以剩下 99 张,其中 3 张中奖。
06 / CONDITIONAL PROBABILITY

竖线不是除号:P(B|A) 表示“已知 A 时,B 的概率”

中文通常先说条件“已知 A”,公式却把要问的 B 写在左边。可以按顺序读成:“B,给定 A”。

P(B|A)=P(A∩B)P(A) (P(A)≠0)
  1. 先锁定条件 A。把不属于 A 的情况全部移出观察范围。
  2. 新的全部范围是 A。因此分母变成 P(A),不是原来的 1。
  3. 在 A 中寻找 B。同时满足 A 和 B 的部分是交集 A∩B。
设备例:P(A)=2/1000,P(B|A)=0.97
P(A∩B)=P(A)P(B|A)=0.002×0.97=0.00194

翻译成人数:每 1000 个设备约有 2 个故障,其中约 97% 会报警,所以约有 1.94 个“既故障又报警”。先用人数读懂,再回到符号。

最关键区别:P(B|A)P(B) 通常不同;P(B|A)P(A|B) 也通常不同。交换竖线两边,问题就变了。
07 / CONDITION SCOPE

条件范围实验:同一张表,可以提出两个完全不同的问题

想象 1000 个设备,少数设备有故障。传感器会报警,但也可能误报。本例只用于学习概率,不代表任何真实设备性能。

| A
CONDITION TABLE / 条件范围表
调节基础故障数、检出率和误报率

已知故障:范围只有 2

其中报警约 1.94 个。

已知未故障:范围有 998

其中误报约 9.98 个。

每 1000 个报警不报警合计
故障 A1.940.062
未故障 Ā9.98988.02998
合计11.92988.081000
P(B|A)97.0%
P(A∩B)0.194%
全部报警数11.92
P(A|B) 预告16.3%
97% 的范围只是 2 个故障设备,不是全部 1000 个;反向提问要改用“所有报警设备”作分母。
08 / MACHINE LEARNING

机器学习为什么需要概率和条件概率?

P(类别 | 已观察到的特征)

分类器真正回答的常是条件问题:已知图片像素、邮件词语或学生练习记录时,它属于某个类别的概率是多少?竖线右侧就是模型已经看到的线索。

概率分类

模型不仅说“是猫”,还可以输出 0.82,表示在当前模型和数据下对猫类别的信心。

利用已有信息

看到词语“免费领取”后,一封邮件是垃圾邮件的条件概率可能改变;条件就是模型已经观察到的特征。

评估误报漏报

混淆矩阵中的准确率、召回率等指标,本质上都在不同条件范围里计数。

概率不是保证:模型给出 80% 不代表这一次一定发生。更合理的检查是:许多被预测为 80% 的相似样本中,目标事件是否大约发生 80%。
09 / RECAP

把概率语言浓缩成四张卡片

基本概率目标结果数 ÷ 全部等可能结果数
0≤P(A)≤1
或与且并集是至少一个,交集是同时发生
∪ / ∩
独立与从属前一次是否改变后一次机会
P(A∩B)
条件概率只在条件 A 的范围内寻找 B
P(B|A)
10 / CHECK

知识检测:选择后立即诊断

错题会指出具体知识缺口并提供回看位置;改对后仍记录首次暴露的薄弱点。

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. “掷一次骰子得到偶数”中的“偶数”是?
2. 公平六面骰掷出大于 4 的概率是多少?
3. 若 P(A)=0.3,则 P(Ā) 等于?
4. A∪B 表示什么?
5. 为什么 P(A)+P(B) 后还要减 P(A∩B)?
6. 两个事件互斥意味着?
7. 连续抛两次普通硬币,第二次结果为什么与第一次独立?
8. 100 张票有 4 张中奖,第一张中奖且不放回。第二张中奖概率是?
9. P(B|A) 的正确含义是?
10. P(B|A)=P(A∩B)/P(A) 中,为什么分母是 P(A)?
11. 下列哪句话正确?
12. 分类模型输出概率的主要作用是什么?
0

VISUAL FIRST · 一图读懂

加上条件,真正改变的是比较范围

左边从全部人中统计;右边先用蓝色围栏限定人群,再只在围栏内部重新数橙色背包。

全体学生与蓝色条件围栏内学生的对照无文字插图,橙色背包代表目标事件
HOW TO READ
读图顺序
先看全部人

没有条件时,分母是场地里的所有人。

再放下围栏

已知条件会先缩小允许参与比较的总体。

围栏内重新数

分子也必须在新范围中统计,不能沿用围栏外的人。