机器学习数学 · 14
0% READ
课程首页
JUNIOR ML MATH / DISTRIBUTION

伯努利 × 二项从一次成败到整张次数地图

一次试验只有成功 1 或失败 0,是伯努利试验;把相同试验独立重复 n 次,成功次数 X 的所有可能概率排在一起,就得到二项分布。

随机变量伯努利分布组合数二项分布
LEARNING ROUTE① 把结果变成 0/1② 重复独立试验③ 数出成功排列方法④ 画出全部次数概率
00 / WHY DISTRIBUTIONS

只知道“成功率 60%”,还不知道重复十次会发生什么

模型常要回答的不只是下一次成功概率,还要回答“一批 10 次中成功几次最常见”“至少成功 8 次有多难”。概率分布把随机变量每个可能值和它的概率完整列出来。

1 次

伯努利分布

结果只能是 1 或 0,概率分别是 p 与 1−p。

n 次

二项分布

随机变量 X 记录 n 次里成功了几次,可能从 0 到 n。

概率分布解决的四个问题

看全局不是一个概率,而是所有可能值
找常见值看柱子最高处在哪里
算区间风险把多个次数概率累加
建立模型用少量参数描述随机规律
  • 能区分频数、概率和随机变量
  • 能写出伯努利分布的两个结果概率
  • 能解释二项公式中组合数的作用
  • 能调节 n、p、k 并读懂分布变化
01 / FROM FREQUENCY TO PROBABILITY

分布是一张地图:每个值出现多少,或可能性多大

原文记录 14 场比赛的总进球数:0 分出现 2 次、1 分 2 次、2 分 3 次、3 分 1 次、4 分 4 次、5 分 2 次。把频数除以 14,就得到概率分布。

总进球 X频数经验概率
022/14
122/14
233/14
311/14
444/14
522/14
20
21
32
13
44
25
X随机变量

把随机结果用数字记录,这里 X 是总进球数。

P(X=k)某个值的概率

例如 P(X=4)=4/14

Σ=1全部概率之和

所有可能值互斥且完整,总概率必须等于 1。

频数不是概率:频数 4 表示数据中出现 4 次;经验概率 4/14 表示它占全部记录的比例。样本越多,经验分布通常越稳定。
02 / BERNOULLI TRIAL

伯努利试验:只问一个“是或否”的问题

1成功

目标事件发生,概率为 p。

OR
0失败

目标事件没发生,概率为 1−p。

P(X=k)=pᵏ(1−p)¹⁻ᵏ  k∈{0,1}
k=1公式变成 p¹(1−p)⁰=p
k=0公式变成 p⁰(1−p)¹=1−p
0 次方非零数的 0 次方为 1,因此不需要的因子自动消失
两种结果只要能清楚定义目标事件,就不一定非得是硬币

例子:邮件是否为垃圾邮件、明天是否下雨、商品是否被点击、学生是否答对一道题,都可以先简化成一次伯努利试验。

03 / BERNOULLI LAB

拖动成功概率 p,两根柱子始终合计为 1

0/1
BERNOULLI BALANCE / 伯努利天平
橙色是成功 1,青色是失败 0
40%X=0 失败
60%X=1 成功
P(X=1)0.60
P(X=0)0.40
概率总和1.00
可能取值{0,1}
成功更可能,但一次试验仍然可能失败。
04 / REPEATED TRIALS

三次试验有 8 种顺序,但成功次数只有 4 种

先不使用公式,把 S 当成功、F 当失败。三次独立试验共有 2³=8 个序列。我们只关心成功次数 k,就把顺序不同但次数相同的序列分到一组。

SSSk=3
SSFk=2
SFSk=2
FSSk=2
SFFk=1
FSFk=1
FFSk=1
FFFk=0
成功 0 次₃C₀=1
成功 1 次₃C₁=3
成功 2 次₃C₂=3
成功 3 次₃C₃=1
为什么出现组合数?某一个具体顺序(例如 SSF)的概率只是 p²(1−p);但成功 2 次有 SSF、SFS、FSS 三种顺序,所以要再乘 ₃C₂=3
05 / BINOMIAL DISTRIBUTION

二项分布公式:方法数 × 每一种顺序的概率

P(X=k)=n!k!(n−k)! pᵏ(1−p)ⁿ⁻ᵏ = ₙCₖpᵏ(1−p)ⁿ⁻ᵏ
n总共进行多少次独立且同概率的试验
k目标事件成功了多少次,范围 0 到 n
ₙCₖ把 k 次成功放进 n 个位置,有多少种排法
pᵏ(1−p)ⁿ⁻ᵏ任何一个含 k 次成功的具体序列概率
n=3,p=2/3,k=2:P(X=2)=₃C₂(2/3)²(1/3)=3×4/27=4/9

边界检查:ₙC₀=ₙCₙ=1,因为“全失败”或“全成功”都只有一种顺序。组合公式里会出现 0!,第 8 章已经说明 0!=1。当 n=1 时,二项分布就退回本章前面的伯努利分布。

使用二项分布的三个条件:固定 n 次试验;每次只有成功/失败;各次独立且成功概率 p 保持相同。不放回抽小样本时 p 会变化,不能直接套二项分布。
06 / BINOMIAL LAB

调节 n、p、k,看整条分布如何移动和变形

柱子代表从成功 0 次到 n 次的全部概率。点击任意柱子也可以选择 k。

nCk
DISTRIBUTION BUILDER / 二项分布生成器
初始值使用原文例子:n=3,p=2/3,观察 k=2
组合方法数:₃C₂=3
一个具体序列:(2/3)²(1/3)¹=0.1481
成功 k 次总概率:3×0.1481=0.4444
P(X=k)0.4444
P(X≤k)0.7037
平均成功次数 np2.00
全部概率和1.0000
n=3、p≈2/3 时,成功 2 次最常见。
07 / CDF & LIKELIHOOD

同一条公式,还能回答“最多几次”和“哪个 p 更合理”

P(X=k)概率质量

只问刚好成功 k 次,读取一根柱子。

P(X≤k)累积分布

从 0 次一直加到 k 次,读取一段柱子的总和。

L(p)似然

固定已经观察到的 n、k,比较不同 p 让这份数据有多合理。

P(X≤k)=Σᵢ₌₀ᵏ P(X=i)

不要把 np 当成保证:实验器里的 np 是大量重复做“n 次试验”时的平均成功次数。一次具体实验完全可能比它多或少。

概率与似然看的方向不同:固定参数 p、让结果 k 变化时,是概率分布;固定已经看到的 k、让参数 p 变化时,同一个表达式可当作似然,用来估计最能解释数据的 p。

08 / MACHINE LEARNING

伯努利与二项分布为什么是机器学习基础?

二分类标签

猫/非猫、点击/未点击、答对/答错都能写成 1/0。模型输出 p,就是伯努利分布的参数。

批量成功次数

预测 100 次展示中会有多少次点击、20 道题大约答对几道,可以用二项分布建立基准。

学习概率参数

观察一批 0/1 数据后,模型寻找最能解释这些结果的 p;这连接似然、最大似然和后续贝叶斯更新。

模型不合适时不要硬套:若每次 p 不同、结果互相影响,或一次有三个以上类别,就需要别的分布或更复杂的模型。
09 / RECAP

把本章浓缩成四张卡片

概率分布列出随机变量全部值与概率
ΣP(X=k)=1
伯努利一次试验只有 0 或 1
P(1)=p
组合数成功 k 次有多少种顺序
ₙCₖ
二项分布n 次中成功 k 次的概率
ₙCₖpᵏ(1−p)ⁿ⁻ᵏ
10 / CHECK

知识检测:选择后立即诊断

题目覆盖分布阅读、公式条件、组合数和机器学习迁移。

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 20 次记录中某结果出现 5 次,它的经验概率是?
2. 一个完整离散概率分布的所有概率相加应为?
3. 在“10 次投篮中命中几次”里,随机变量 X 最合适表示?
4. 哪个问题最适合直接建成一次伯努利试验?
5. 伯努利试验成功概率 p=0.7,则失败概率是?
6. “投 10 次硬币,正面出现 6 次”对应的 n、k 是?
7. 三次试验中恰好成功两次,为什么要乘 ₃C₂=3?
8. n 次独立同概率试验中成功 k 次的概率是?
9. 哪种情况不适合直接使用普通二项分布?
10. P(X≤2) 表示什么?
11. 把二项公式看成 p 的似然时,通常固定什么?
12. 二分类模型输出 p=0.8,可以怎样理解?
0

VISUAL FIRST · 一图读懂

二项分布为什么会形成一排概率柱?

固定次数的成功数量只有有限几种可能。单次成功率改变时,最高的柱子会移动,但所有结果仍覆盖完整可能性。

重复二选一试验进入五个透明收集柱并形成概率高低的无文字插图
HOW TO READ
读图顺序
重复相同试验

每一次都只有成功或失败,并保持相同成功率。

按成功次数分组

做完固定次数后,只记录一共成功了多少次。

柱高就是可能性

哪种成功次数更常出现,对应的收集柱就会更高。