机器学习数学 · 16
0% READ
课程首页
JUNIOR ML MATH / EXPONENTIAL

指数函数每走一步都“乘一下”,为什么很快冲上天?

1、2、4、8、16……增加的不是固定数量,而是固定倍数。指数让我们简洁描述复制、衰减、概率权重和神经网络里的数值变化。

幂运算增长与衰减自然常数 eSigmoid
LEARNING ROUTE① 认清底数与指数② 理解规则而非死背③ 观察固定倍数变化④ 接到神经网络概率
00 / WHY EXPONENTIALS

“每次多 2 个”和“每次变成 2 倍”,走几步后完全不同

校园社团做传话实验:每位知道消息的同学下一轮告诉 2 位新同学。第 0 轮有 1 人,第 1 轮 2 人,第 2 轮 4 人。轮数写在右上角,正好是指数。

第 0 轮1
第 1 轮2
第 2 轮4
第 3 轮8
第 4 轮16
第 5 轮32

指数在机器学习里解决什么?

压缩重复乘法把长串乘法写成一个幂
表示正权重exp(x) 永远大于 0
比较相对强弱分数差一点,权重可差很多
构造概率Sigmoid、Softmax 都用到 exp
01 / BASE AND EXPONENT

在 an 里,a 是反复相乘的数,n 是乘了几个 a

an = a × a × … × a (共有 n 个 a)
3⁴

底数是 3,指数是 4

3⁴=3×3×3×3=81。指数 4 不是“再乘 4”,而是告诉我们出现 4 个底数 3。

(−2)⁴

括号会改变底数

(−2)⁴=16;但 −2⁴ 通常理解为 −(2⁴)=−16。负数做底数时要把它括起来。

读式子时先做角色检查:底数回答“每次乘谁”,指数回答“重复多少次”。这是后面所有规则的起点。
02 / THREE LAWS

指数规则来自“数一数一共有几个相同底数”

am·an=am+n乘法:指数相加
aa×aaa=aaaaa

必须是相同底数相乘。2²·3² 不能合成 6⁴。

am/an=am−n除法:指数相减

分子分母消掉 n 个相同的 a;要求 a≠0。

(am)n=amn幂的幂:指数相乘

每组有 m 个 a,一共 n 组,所以有 mn 个 a。

指数塔不是随便从左算:abc 通常按 a(bc) 理解。例如 2=2⁹=512,而 (2³)²=64。写括号最安全;不同软件的输入规则也要看说明。
03 / EXTENDING THE PATTERN

让原来的规则继续成立,就自然得到零、负数和分数指数

a⁰=1零指数

a³/a³=a3−3=a⁰,同时一个非零数除自己等于 1,所以 a⁰=1(a≠0)。

a−n=1/an负指数

负号不是说答案为负,而是把幂移到分母。例如 2⁻³=1/8。

a1/n=ⁿ√a分数指数

因为 (a1/n)n=a,所以它表示 n 次方根。81/3=2。

am/n = (ⁿ√a)m = ⁿ√(am)
本章讨论实数指数函数时:通常要求底数 a>0 且 a≠1。这样 ax 对每个实数 x 都能稳定定义;a=1 只会得到一条 y=1 的平线。
04 / EXPONENTIAL FUNCTION

当指数 x 变成可以滑动的变量,ax 就成为指数函数

一次计算只求一个幂;函数则把每个 x 都映射到 ax。若 a>1,每向右走 1 格,函数值乘 a;若 0<a<1,每向右走 1 格,函数值反而缩小。

xx²(加法差值变化)2ˣ(每步乘 2)(1/2)ˣ(每步乘 1/2)
0011
1120.5
2440.25
3980.125
525320.03125
增长还是衰减,只看底数:a>1 是增长;0<a<1 是衰减。无论哪一种,aˣ 都始终大于 0,并且经过 (0,1)。
05 / GROWTH LAB

拖动底数:同样向右走一步,函数值每次乘多少?

增长与衰减轨道
橙色是 aˣ,蓝色虚线是 x²;图形超过 32 的部分会被裁到顶部。
8
向右一步的倍数×2
变化类型增长
必过点(0, 1)
06 / THE NUMBER e

e≈2.71828:一个特别适合描述连续变化的底数

像圆周率 π 一样,e 是自然出现的重要常数。用它作底数的指数函数有一个漂亮性质:曲线在每一点的“增长速度”正好等于自己的高度。

exp(x)=ex  并且 d(ex)/dx=ex

为什么机器学习爱写 exp?

exp(x) 接受任何实数,却永远输出正数。它适合把模型的任意分数变成可比较的正权重。

一般底数的变化率

d(aˣ)/dx=aˣ ln(a)

e 的 ln(e)=1,所以公式最简洁。导数细节可当作进阶内容,先记住“eˣ 的斜率就是 eˣ”。

07 / SIGMOID

把任意模型分数塞进指数,就能压进 0 到 1 的概率范围

sigmoid(x) = 1/(1+e−x)
S
二分类概率门
x 是模型的原始分数;它可以很大、很小或为负。Sigmoid 把它变成 0 到 1。
50%

模型给“正类”的概率

e−x1
sigmoid(x)0.5
x=0 时,两类各占 50%。
Sigmoid 不会输出 −1:它的范围是 0 到 1。分数很负时概率接近 0,分数很正时概率接近 1,但有限 x 下不会真的等于端点。
08 / MACHINE LEARNING

指数让模型把分数变成权重、概率和可学习的曲线

二分类

垃圾邮件模型先算任意实数分数,再用 Sigmoid 输出“是垃圾邮件”的概率。

多分类

Softmax 对每类分数取 exp,再除以总和,让所有类得到正概率且总和为 1。

分布与注意力

正态分布含有 exp;注意力也常用 Softmax。指数会放大分数差异,让更相关的对象获得更大权重。

数值计算提醒:exp(很大的数) 会溢出。真正的机器学习程序常先减去最大分数,再做 Softmax;概率结果不变,计算却更稳定。
09 / RECAP

把本章浓缩成四张卡片

指数是重复乘法aˣ 中,底数是每次乘谁,指数是重复多少。
规则有条件同底数相乘才加指数;幂的幂才乘指数。
固定倍数变化a>1 增长,0<a<1 衰减;都经过 (0,1)。
exp 连接概率它给正数;Sigmoid 和 Softmax 再把权重正规化。
10 / CHECK

选择后立即出答案,并指出没有掌握的知识点

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 3⁴ 表示什么?
2. 2³·2⁴ 等于?
3. (5²)³ 等于?
4. 当 a≠0 时,a⁰ 等于?
5. 2⁻³ 等于?
6. 161/2 等于?
7. y=3ˣ 中 x 每增加 1,y 会怎样?
8. y=(0.7)ˣ 随 x 增大通常怎样变化?
9. 合法的指数函数 y=aˣ 一定经过哪个点?
10. exp(x)=eˣ 的输出有什么重要性质?
11. sigmoid(0) 等于?
12. 多分类模型为什么常对各类分数使用 exp?
0

VISUAL FIRST · 一图读懂

固定增加和不断倍增,为什么后来差距巨大?

上方每站只拿到同样多的能量;下方每站都在上一站基础上翻倍,所以前期接近、后期迅速拉开。

固定增加能量与每站倍增能量的两条机器人赛道对比无文字插图
HOW TO READ
读图顺序
固定加法

每一步增加相同数量,形成稳定的直线式增长。

固定倍数

每一步都乘同一个倍数,新增量本身也越来越大。

越过反超点

指数增长开始可能不显眼,但越过反超点后差距会快速放大。