只知道“成功率 60%”,还不知道重复十次会发生什么
模型常要回答的不只是下一次成功概率,还要回答“一批 10 次中成功几次最常见”“至少成功 8 次有多难”。概率分布把随机变量每个可能值和它的概率完整列出来。
伯努利分布
结果只能是 1 或 0,概率分别是 p 与 1−p。
二项分布
随机变量 X 记录 n 次里成功了几次,可能从 0 到 n。
概率分布解决的四个问题
- 能区分频数、概率和随机变量
- 能写出伯努利分布的两个结果概率
- 能解释二项公式中组合数的作用
- 能调节 n、p、k 并读懂分布变化
分布是一张地图:每个值出现多少,或可能性多大
原文记录 14 场比赛的总进球数:0 分出现 2 次、1 分 2 次、2 分 3 次、3 分 1 次、4 分 4 次、5 分 2 次。把频数除以 14,就得到概率分布。
| 总进球 X | 频数 | 经验概率 |
|---|---|---|
| 0 | 2 | 2/14 |
| 1 | 2 | 2/14 |
| 2 | 3 | 3/14 |
| 3 | 1 | 1/14 |
| 4 | 4 | 4/14 |
| 5 | 2 | 2/14 |
把随机结果用数字记录,这里 X 是总进球数。
例如 P(X=4)=4/14。
所有可能值互斥且完整,总概率必须等于 1。
伯努利试验:只问一个“是或否”的问题
目标事件发生,概率为 p。
目标事件没发生,概率为 1−p。
例子:邮件是否为垃圾邮件、明天是否下雨、商品是否被点击、学生是否答对一道题,都可以先简化成一次伯努利试验。
拖动成功概率 p,两根柱子始终合计为 1
三次试验有 8 种顺序,但成功次数只有 4 种
先不使用公式,把 S 当成功、F 当失败。三次独立试验共有 2³=8 个序列。我们只关心成功次数 k,就把顺序不同但次数相同的序列分到一组。
二项分布公式:方法数 × 每一种顺序的概率
边界检查:ₙC₀=ₙCₙ=1,因为“全失败”或“全成功”都只有一种顺序。组合公式里会出现 0!,第 8 章已经说明 0!=1。当 n=1 时,二项分布就退回本章前面的伯努利分布。
调节 n、p、k,看整条分布如何移动和变形
柱子代表从成功 0 次到 n 次的全部概率。点击任意柱子也可以选择 k。
同一条公式,还能回答“最多几次”和“哪个 p 更合理”
只问刚好成功 k 次,读取一根柱子。
从 0 次一直加到 k 次,读取一段柱子的总和。
固定已经观察到的 n、k,比较不同 p 让这份数据有多合理。
不要把 np 当成保证:实验器里的 np 是大量重复做“n 次试验”时的平均成功次数。一次具体实验完全可能比它多或少。
概率与似然看的方向不同:固定参数 p、让结果 k 变化时,是概率分布;固定已经看到的 k、让参数 p 变化时,同一个表达式可当作似然,用来估计最能解释数据的 p。
伯努利与二项分布为什么是机器学习基础?
二分类标签
猫/非猫、点击/未点击、答对/答错都能写成 1/0。模型输出 p,就是伯努利分布的参数。
批量成功次数
预测 100 次展示中会有多少次点击、20 道题大约答对几道,可以用二项分布建立基准。
学习概率参数
观察一批 0/1 数据后,模型寻找最能解释这些结果的 p;这连接似然、最大似然和后续贝叶斯更新。
把本章浓缩成四张卡片
知识检测:选择后立即诊断
题目覆盖分布阅读、公式条件、组合数和机器学习迁移。
二项分布为什么会形成一排概率柱?
固定次数的成功数量只有有限几种可能。单次成功率改变时,最高的柱子会移动,但所有结果仍覆盖完整可能性。
读图顺序
每一次都只有成功或失败,并保持相同成功率。
做完固定次数后,只记录一共成功了多少次。
哪种成功次数更常出现,对应的收集柱就会更高。