机械学习 数学研究室
0% READ
课程首页
JUNIOR ML MATH / PARTIAL DERIVATIVE

偏导数一次只动一个旋钮

模型有很多可以调节的“旋钮”。偏导数让我们逐个查清它们对错误的影响,再把所有旋钮一起朝更好的方向更新。

参数与输入3 个图形数据实验3 个数学游戏即时错误诊断
LEARNING ROUTE① 多个输入② 一次只看一个③ 计算偏导④ 一起训练参数
00 / WHY ONE KNOB AT A TIME

多个因素一起影响结果,怎样知道谁该负责?

房租会受面积、楼龄、位置影响;模型的错误也会同时受许多参数影响。若全部一起乱动,我们看不出是哪一个改变造成了结果。偏导数提供一种公平的比较方法。

3 个旋钮

同时乱动

结果变了,却不知道面积、楼龄还是位置起了作用。

1 个旋钮

一次只研究一个

固定其他量,只改变目标变量,就能测出它自己的影响方向和速度。

偏导数解决的核心问题

多个输入结果由 x、y 等共同决定
固定其他量制造公平的小实验
测局部变化得到一个方向的斜率
更新全部参数让模型损失逐步下降

把第 5 章的“一条山谷”升级成“多旋钮地形”

第 5 章:一个参数
E(a)

只有一个旋钮 a,普通导数 E′(a) 告诉它向左还是向右。

第 6 章:很多参数
L(w₁,w₂,…)

每个旋钮都要一个偏导。所有偏导合在一起,就是引导模型下山的梯度。

机器学习对应:一次预测可能由几千、几百万个参数共同完成。偏导数就是给每个参数单独发一张“该往哪边调”的方向卡。
  • 能说出多变量函数是什么
  • 能区分输入特征与模型参数
  • 能解释“把其他变量当常数”
  • 能计算简单偏导数
  • 能说明偏导、梯度与机器学习训练的关系
01 / MULTIVARIABLE FUNCTION

多变量函数:一个结果,同时听多个输入的

以前的函数 y=f(x) 只有一个输入。现在 z=f(x,y) 有两个输入;x 与 y 一起决定 z。

输入 1

x:面积

房间越大,租金通常越高。

输入 2

y:楼龄

楼龄变化也可能影响租金。

输出

z:预测租金

模型把两个线索合在一起给出数值。

z = f(x,y) = x² + xy + y²
读成人话:给定 x 和 y,先算 x²、xy、y²,再相加得到 z。这里 x、y 都能变化,所以它是二变量函数。
输入特征

x、y 是模型“看到的线索”

例如 x=房屋面积,y=楼龄。它们来自样本,用来描述这套房子。

模型参数

w₁、w₂ 是模型“能调的旋钮”

例如 ŷ=w₁x+w₂y。训练时不会改变房屋面积,而是调 w₁、w₂,让预测更准。

不同房屋样本保持锁定,三个不同文化背景的孩子只调机器内部的两个旋钮,预测点逐渐接近目标点,误差小球变少
按从左到右读图:五个房屋样本被透明锁扣固定;孩子只转机器里面的两个大齿轮;右边橙色预测逐渐靠近绿色答案,底部红色误差球也越来越少。这就是“数据不改,改模型参数”。
同一种偏导方法,可以研究不同对象。研究函数形状时,我们可以对输入 x、y 求偏导;训练机器学习模型时,更常见的是对损失 L 的参数 w₁、w₂ 求偏导。先看清“正在对谁求偏导”,就不会把特征和参数混在一起。
02 / MEANING OF ∂

偏微分:冻结一个方向,只测另一个方向

对 x 偏微分时,把 y 当作已经固定的数字;对 y 偏微分时,则把 x 固定。符号 ∂ 可以读作“偏 d”或“del”。

关注 x

y 暂时冻结

∂f/∂x

问:x 增加一点,f 改变多快?

关注 y

x 暂时冻结

∂f/∂y

问:y 增加一点,f 改变多快?

f(x,y)=x²+xy+y² → ∂f/∂x=2x+y | ∂f/∂y=x+2y
“固定 y”绝不等于“让 y=0”。如果当前位置是 (x,y)=(1,2),对 x 偏导时,y 就保持当前的 2;函数截面是 f(x,2)=x²+2x+4。我们只是不让 2 在这次小实验里改变。
最容易错的地方:对 x 求偏导时,xy 不是常数项。因为 y 固定后,xy 就像“y×x”;若 y=2,它就是 2x,对 x 的导数当然是 2,也就是一般写法中的 y。
03 / HOW TO CALCULATE

计算方法和普通求导一样,只多一个“冻结”动作

例:g(x,y)=4x²+4xy+2y²+5,求它对 x 的偏导数。

  1. 先圈出本次变量 x。我们只研究 x 改变时的影响。
  2. 把 y 当作固定数字。4xy 可以看成 (4y)x;2y²+5 整体是常数项。
  3. 逐项求导。(4x²)′=8x,((4y)x)′=4y,常数项变成 0。
  4. 合并答案。∂g/∂x=8x+4y
只含目标变量
3x² → 6x

照普通幂函数规则。

目标变量 × 其他量
4xy → 4y

把 4y 当系数,不要全删。

完全不含目标变量
2y²+5 → 0

对 x 来说整体不变化。

若 g(x,y)=4x²+4xy+2y²+5,则 ∂g/∂y=4x+4y
04 / SLICE LAB

截面实验:从一张曲面切出一条普通曲线

二变量函数像一张起伏的地形。固定 y,相当于沿一个方向切一刀;截面是一条只随 x 变化的曲线,就可以使用第 4 章的导数。

三位不同文化背景的学生操作曲面模型,一个旋钮被固定,透明截面切出一条曲线
先不要急着看公式。左边旋钮被透明装置固定,右边旋钮还能转;竖直透明片把整张曲面切成一条发光曲线。偏导就是在这条曲线上测当前点的斜率。
ONE-KNOB LAB / 单变量截面实验
函数 f(x,y)=x²+xy+y²
改变 x,固定 y
f(x,y)7.00
∂f/∂x4.00
∂f/∂y5.00
现在改变 x、固定 y=2.0;橙线斜率为 4.00。
任务:分别体验“对 x 偏导”和“对 y 偏导”,并拖动至少一个旋钮。
图形含义:蓝线不是整张曲面,而是“固定另一个变量”后切出的截面;橙线才是当前位置沿所选方向的切线。
05 / MACHINE LEARNING

机器学习为什么需要很多个偏导数?

模型可能有成千上万个参数。损失函数 L 同时受所有参数影响;每个偏导数负责回答一个参数该往哪边调。把它们排在一起,就叫梯度。

梯度 ∇L = (∂L/∂w₁, ∂L/∂w₂, …)  更新:w ← w − η∇L
不是一次只更新一个参数。“一次只看一个”发生在计算影响时;得到所有偏导数后,电脑通常可以一起更新全部参数。
四位不同文化背景的学生调节两个参数旋钮,橙色小球沿轨迹走向损失谷最低点
图中两个大旋钮就是两个参数。蓝色方向和橙色方向分别由两个偏导决定,合起来变成小球的一步移动;前方高低不一的积木表示损失在逐步减小。
GRADIENT WALK / 两参数训练实验
损失 L=(w₁−2)²+(w₂+1)²,目标点是 (2,−1)
最低点
损失 L41.00
∂L/∂w₁−10.00
∂L/∂w₂8.00
w₁ 应增大,w₂ 应减小。
任务:连续点击“训练一步”,观察两个参数同时移动,直到损失小于 0.15。
这就是模型“学习”的缩小版。橙点不是数据样本,而是当前参数组合;点移动,代表模型内部的参数被更新。真正神经网络的损失地形更复杂,但“算每个参数的偏导,再沿梯度反方向小步走”的核心相同。
06 / PARTIAL DERIVATIVE MISSION

偏导任务站:先看懂图,再练会算

图形实验负责建立直觉,数据实验负责连接机器学习,数学训练负责让你真正会算。三条路线分开记录,不会出现“实验玩过了,就误以为公式也会了”的情况。

图形与数据实验护照

完成三项观察任务,亲眼看见“固定一个方向”“两个参数一起下山”和“一批样本共同产生损失”。

实验完成 0 / 3

截面侦察

切换 x、y 两种偏导模式,并拖动旋钮观察蓝色截面和橙色切线。

待体验两个方向
回到截面实验 ↑

损失谷降落

用梯度更新两个参数,让橙点沿轨迹靠近最低点,直到损失小于 0.15。

待降低损失
回到训练实验 ↑

五样本调参

让同一个模型同时服务五个样本,观察每个误差怎样共同决定两个参数的偏导。

待让数据损失下降
前往数据实验 ↓
实验完成表示你“看见了偏导”;下面三项训练完成,才表示你能独立“算偏导、代数值、判方向”。
5
FIVE-SAMPLE TUNER / 五样本调参实验
同一个预测模型 ŷ=w₁x+w₂y,要同时照顾 5 个样本
样本 1样本 2样本 3样本 4样本 5
平均平方误差7.20
已训练步数0
∂L/∂w₁−2.40
∂L/∂w₂2.40
绿色点是固定答案, 橙色点是模型预测;两点间的线越短,那个样本的误差越小。
当前梯度建议:增大 w₁,减小 w₂。
任务:点击梯度训练,让 5 个样本的平均平方误差小于 0.03。
HANDS-ON ARCADE / 不是选择题

主动操作挑战

亲手加工公式,再自己驾驶参数点走向谷底。

图形游戏完成 0 / 2
GAME A / DRAG & BUILD

偏导齿轮工坊

拖动公式中的每一项,送进正确的加工轨道。手机也可以先点算式卡,再点轨道。

本轮:对 x 求偏导
f=3x²+4xy+5y²
降幂加工目标变量带平方
留下伙伴目标变量在交叉项中
变成 0整项不含目标变量
把三张算式卡都送进正确轨道,机器会自动拼出偏导结果。

数学训练区

答错会立即指出缺少的知识点;每题改对后才进入下一轮。

训练完成 0 / 3
TRAINING 01 / 4 轮

项扫描器

锁定一个变量,判断单独这一项的偏导。

对 x 求偏导
5y² → ?
先看目标变量,再决定这一项是常数、幂还是交叉项。
TRAINING 02 / 4 轮

局部斜率定位

先得到偏导公式,再把当前点代进去。

在 (1,2) 求 ∂f/∂x
f=x²+xy+y²
不要先把坐标代进原函数;我们要的是该方向的斜率。
TRAINING 03 / 3 轮

参数方向控制台

根据梯度的正负,为两个参数分别选择更新方向。

当前梯度
∇L=(+4, −2)
w₁ 应该
w₂ 应该
记住更新公式里有一个减号:w ← w − η∇L。
07 / RECAP

把偏导数压缩成四句话

先认清对象x、y 可以是输入,w₁、w₂ 可以是参数
L=L(w₁,w₂)
冻结其他量固定当前值,不是把它设为 0
∂f/∂x
不要误删交叉项xy 对 x 的偏导是 y
∂(xy)/∂x=y
机器学习全部偏导组成梯度
w←w−η∇L
STORY LAB / 一株小苗与两个旋钮

小苗低下了头,该先调灯还是先浇水?

一个雨天清晨,窗台上的小番茄苗忽然垂下叶子。开米想调亮补光灯,米悦急着浇水。妈妈没有替她们选择,而是陪姐妹俩把一个看似简单的问题,慢慢变成一场能分清每个方向的实验。

妈妈 · 提问、陪伴并在最后总结姐姐 · 开米 Kimi · 13 岁妹妹 · 米悦 · 6 岁任务 · 分清灯光与浇水各自怎样影响小苗
ACT01
雨天窗边,米悦给低头的小番茄苗浇水,开米同时调亮蓝色补光灯,穿绿色外套的妈妈摊开双手提出疑问
PICTURE KEY / 看图读数学水量和灯光同时改变,第二天即使叶片变了,也无法判断是哪一个因素造成的。

两只手同时伸过去,答案反而不见了

星期一清晨,米悦发现窗台上的小番茄苗低下了头。她认定小苗口渴,赶紧多浇两勺水;开米却觉得连日阴雨光照不足,同时把补光灯调亮一档。

傍晚时,小苗稍微抬起一片叶子,可泥土已经湿漉漉的,另一片叶尖还泛出淡黄。米悦说是水救了它,开米觉得也可能是灯。两件事一起改变,结果虽然变了,证据却说不清是谁的作用。

妈妈只问:如果两个旋钮同时转动,我们明天还能知道是哪一只造成变化吗?
灯光一个可能因素浇水另一个可能因素困难同时改变就无法分清责任
ACT02
开米在无文字记录本上摆放蓝色灯光、橙色水滴和绿色叶片图块,米悦用两根手指指出灯光与水量共同通向一个叶片结果,妈妈在旁提问
PICTURE KEY / 看图读数学两条输入路径汇到同一个叶片结果:一个输出可以同时听多个输入变量。

一株小苗,同时听两个条件的话

开米把每天的补光时间、浇水量和第二天的叶片状态分开记录。她们把补光时间叫作 x,浇水量叫作 y,把小苗的恢复状态叫作 z。

z=f(x,y)

这个式子读作:结果 z 同时由 x 和 y 决定。它是二变量函数。现在的问题不再是争论“灯和水谁更重要”,而是怎样分别听清每个条件在当前位置说了什么。

妈妈把两张旋钮卡并排放好:如果明天还是同时转动它们,我们会不会又回到今天的问题?
ACT03
三盆相近小苗得到相同的两小勺水,却接受不同强度的灯光,米悦准备拿走水杯,妈妈指向干土,开米保持水量一致
PICTURE KEY / 看图读数学三盆都保留同样的两勺水,只改变灯光。固定水量是让它保持当前值,不是变成没有水。

固定水量,不是让水消失

姐妹俩找来三盆状态相近的小苗。为了研究灯光,她们让三盆每天都得到两勺水,只把补光灯调成不同的小档位。米悦听见“固定水量”,差点把一只水杯整个拿走。

妈妈摸摸干土,只问:一盆有水,另一盆完全没水,明天的差别还能只算在灯光身上吗?米悦把水杯放回去。固定 y,是让它保持当前的两勺水;绝不是强迫 y=0。

固定 y,只看 x:∂z/∂x

反过来,保持灯光不变、只让浇水量改变一点,就是研究 ∂z/∂y。

米悦写下自己的提醒:固定不是消失,只是请它暂时站着别动。
ACT04
不同灯光和水量下的几盆小苗出现低头、舒展和叶缘发干等变化,开米摆出向上向下的方向块,米悦用双色绳连接灯光与水量标记,妈妈观察
PICTURE KEY / 看图读数学不同方向可能让结果改善或变坏;同样增加灯光,在水分不同的情况下也可能产生不同效果。

叶片终于给出了不同方向的回答

几天后,补光太少的小苗仍偏向窗户,补光适中的舒展开来,补光太久的叶缘却有些发干。浇水实验也出现差别:太少会发软,太多会让土壤长时间湿润。

偏导数像一支局部方向箭头:它不替我们解释所有植物生理,只回答“在当前位置,沿这个方向再增加一点,结果会改善还是变坏,变化有多快”。

米悦还发现,同样增加一点灯光,在水分充足和缺水时效果不同。灯和水不一定各做各的,它们可能存在交叉影响。

箭头方向结果上升或下降箭头长短局部变化快慢双色绳两个因素可能互相影响
ACT05
开米准备擦掉一组蓝橙相连的算式积木,米悦按住橡皮并指出蓝色部分仍会变化,固定的橙色积木留作系数,妈妈转动花盆让姐妹思考
PICTURE KEY / 看图读数学交叉项里仍含目标变量,不能整项擦掉;固定的伙伴会留下来成为系数。

开米差点把“固定的伙伴”也擦掉

等待观察结果时,开米练习一个教学函数。它不是植物真实的生长公式,只用来练习偏导:

f(x,y)=x²+xy+y²

对 x 求偏导时,开米看见 xy 含有 y,顺手准备把它整个划掉。米悦却拦住橡皮:水量虽然不动了,可它还在花盆里。

如果当前 y=2,那么 xy=2x。x 改变时,2x 仍会改变,因此 ∂(xy)/∂x=y。只有完全不含 x 的 y²,对 x 来说才会变成 0。

∂f/∂x=2x+y | ∂f/∂y=x+2y
米悦的新规则:先找正在变化的字母;固定的伙伴要留下,完全没有它的那一项才消失。
ACT06
姐妹俩用绿蓝积木搭出表示植物状态的起伏曲面,橙色与蓝色丝带从同一点沿两个方向切过曲面,妈妈抱着小苗观察不同坡度
PICTURE KEY / 看图读数学同一位置沿两个方向切开,会得到坡度不同的两条曲线。偏导数只测指定方向的局部斜率。

从同一座“小苗山”,切出两条不同的路

开米把不同灯光和水量对应的恢复状态做成积木山:平面位置代表两个条件,积木高度代表结果。米悦保持水量相同,横着铺一条丝带,复杂曲面便切出一条只随 x 变化的普通曲线。

换个方向保持灯光相同,又会切出另一条曲线。同一个位置朝两个方向走,坡度可以完全不同。偏导数测量的正是指定方向的局部坡度。

在 (x,y)=(1,2):∂f/∂x=4,∂f/∂y=5
妈妈问:只知道灯光方向是下坡,却不知道浇水方向往哪里走,能放心迈出下一步吗?
ACT07
透明罩锁住过去的灯光水量和叶片记录,预测装置中央有蓝橙两个可调旋钮,米悦想移动真实叶片卡,开米阻止并指向内部旋钮,妈妈在旁观察
PICTURE KEY / 看图读数学过去的数据和真实答案已经固定;训练不能篡改它们,只能调整模型内部的参数旋钮。

不能修改小苗的过去,只能调整模型

开米利用记录做了一个简化的小苗状态预测器。每张记录卡保存当天的灯光、浇水和第二天的真实叶片状态;这些已经发生过的事实被锁进透明盒。

模型内部有两个能调的参数旋钮 w₁、w₂。模型预测错时,米悦想移动一张真实叶片卡,让结果看起来更接近。开米拦住她:训练不是修改答案,而是调整模型内部参数。

输入 x、y 不改 | 真实答案不改 | 学习参数 w₁、w₂
记录卡模型看到的数据真实叶片训练目标内部旋钮可以学习的参数
ACT08
姐妹俩分别取得蓝色与橙色方向卡,再把两张卡合成一个斜向移动,模型标记沿损失谷轨迹下降,两个内部旋钮同时转动,妈妈点头
PICTURE KEY / 看图读数学先分别测清每个参数的方向,再把全部方向合成梯度;行动时,多个参数可以同时更新。

分开询问方向,再让旋钮一起行动

损失 L 同时受到 w₁、w₂ 影响。开米暂时固定 w₂,检查 ∂L/∂w₁;米悦固定 w₁,检查 ∂L/∂w₂。两张方向卡排在一起,就是梯度。

∇L=(∂L/∂w₁, ∂L/∂w₂)

“一次只看一个”发生在测量影响时,不表示训练永远只能动一个参数。得到全部偏导以后,电脑通常会让多个参数一起沿梯度反方向走一小步。

w←w−η∇L
姐妹俩共同发现:分开问,是为了听清;一起走,是因为所有方向已经知道了。
ACT09
雨后阳光照进窗台,小苗重新挺立并长出新叶,米悦只加一小勺水,开米把灯调到适中并记录,妈妈把两个控制卡、两张方向卡和共同下坡步骤依次摆好
PICTURE KEY / 看图读数学新叶恢复却仍保留一片旧黄叶:小步更新可以改善结果,但模型和实验都不是不会出错的魔法。

小苗抬起了头,旧黄叶却没有被公式擦掉

一个星期后,姐妹俩根据观察选择适中的补光和水量。她们没有一次改很多,只调整一小步,再等待新的叶片反应。第二天,小苗抬起头,长出两片健康新叶;旧叶尖仍有一点黄,提醒她们误差不会凭空消失。

妈妈最后才总结:一个结果受到多个因素影响时,先保持其他条件在当前值,一次检查一个方向;固定不是归零,交叉项的伙伴不能误删;所有参数方向的偏导合成梯度,再让参数共同向损失较小的地方走。

多个输入 → 分别求偏导 → 组成梯度 → 一起更新参数
米悦记住的一句话:先别急着拧旋钮。分开问清方向,再一起向更好的地方走。
09 / CHECK

知识检测:选择后立即诊断

第一次选错会被记录;改对后仍会提醒你复习曾经暴露的薄弱点。

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 哪个是二变量函数?
2. 对 x 求偏导时,应该怎样处理 y?
3. ∂f/∂x 在问什么?
4. f(x,y)=3x²+5y,对 x 的偏导数是?
5. 4xy 对 x 的偏导数是?
6. f=x²+xy+y²,对 y 的偏导数是?
7. 固定 y 后观察 f(x,y),图形上相当于什么?
8. 若 ∂f/∂x=2x+y,在 (x,y)=(1,2) 处的值是?
9. 梯度 ∇L 是什么?
10. 若 ∂L/∂w₁ 为正,为降低损失通常应怎样小步调整 w₁?
11. “一次只看一个变量”是否表示训练时永远只能更新一个参数?
12. 神经网络训练为什么需要偏导数?
0