“每次多 2 个”和“每次变成 2 倍”,走几步后完全不同
校园社团做传话实验:每位知道消息的同学下一轮告诉 2 位新同学。第 0 轮有 1 人,第 1 轮 2 人,第 2 轮 4 人。轮数写在右上角,正好是指数。
指数在机器学习里解决什么?
在 an 里,a 是反复相乘的数,n 是乘了几个 a
底数是 3,指数是 4
3⁴=3×3×3×3=81。指数 4 不是“再乘 4”,而是告诉我们出现 4 个底数 3。
括号会改变底数
(−2)⁴=16;但 −2⁴ 通常理解为 −(2⁴)=−16。负数做底数时要把它括起来。
指数规则来自“数一数一共有几个相同底数”
必须是相同底数相乘。2²·3² 不能合成 6⁴。
分子分母消掉 n 个相同的 a;要求 a≠0。
每组有 m 个 a,一共 n 组,所以有 mn 个 a。
让原来的规则继续成立,就自然得到零、负数和分数指数
a³/a³=a3−3=a⁰,同时一个非零数除自己等于 1,所以 a⁰=1(a≠0)。
负号不是说答案为负,而是把幂移到分母。例如 2⁻³=1/8。
因为 (a1/n)n=a,所以它表示 n 次方根。81/3=2。
当指数 x 变成可以滑动的变量,ax 就成为指数函数
一次计算只求一个幂;函数则把每个 x 都映射到 ax。若 a>1,每向右走 1 格,函数值乘 a;若 0<a<1,每向右走 1 格,函数值反而缩小。
| x | x²(加法差值变化) | 2ˣ(每步乘 2) | (1/2)ˣ(每步乘 1/2) |
|---|---|---|---|
| 0 | 0 | 1 | 1 |
| 1 | 1 | 2 | 0.5 |
| 2 | 4 | 4 | 0.25 |
| 3 | 9 | 8 | 0.125 |
| 5 | 25 | 32 | 0.03125 |
拖动底数:同样向右走一步,函数值每次乘多少?
e≈2.71828:一个特别适合描述连续变化的底数
像圆周率 π 一样,e 是自然出现的重要常数。用它作底数的指数函数有一个漂亮性质:曲线在每一点的“增长速度”正好等于自己的高度。
为什么机器学习爱写 exp?
exp(x) 接受任何实数,却永远输出正数。它适合把模型的任意分数变成可比较的正权重。
一般底数的变化率
d(aˣ)/dx=aˣ ln(a)
e 的 ln(e)=1,所以公式最简洁。导数细节可当作进阶内容,先记住“eˣ 的斜率就是 eˣ”。
把任意模型分数塞进指数,就能压进 0 到 1 的概率范围
模型给“正类”的概率
指数让模型把分数变成权重、概率和可学习的曲线
二分类
垃圾邮件模型先算任意实数分数,再用 Sigmoid 输出“是垃圾邮件”的概率。
多分类
Softmax 对每类分数取 exp,再除以总和,让所有类得到正概率且总和为 1。
分布与注意力
正态分布含有 exp;注意力也常用 Softmax。指数会放大分数差异,让更相关的对象获得更大权重。
把本章浓缩成四张卡片
选择后立即出答案,并指出没有掌握的知识点
固定增加和不断倍增,为什么后来差距巨大?
上方每站只拿到同样多的能量;下方每站都在上一站基础上翻倍,所以前期接近、后期迅速拉开。
读图顺序
每一步增加相同数量,形成稳定的直线式增长。
每一步都乘同一个倍数,新增量本身也越来越大。
指数增长开始可能不显眼,但越过反超点后差距会快速放大。