机器学习数学 · 07
0% READ
课程首页
JUNIOR ML MATH / MULTIPLE REGRESSION

多元回归让多个线索一起预测

只看面积,可能把新旧不同的房子看成一样。多元回归让楼龄、面积等多个特征同时发言,再用偏导数学习每个线索应该占多大分量。

多个特征回归平面残差平方和多参数训练
LEARNING ROUTE① 收集多个线索② 写预测公式③ 全部样本评分④ 学习每个系数
00 / WHY MORE CLUES

同样大的房间,租金为什么可能不同?

面积是重要线索,但不是唯一线索。楼龄、到车站的距离、采光等也会影响租金。若只看一个特征,模型会遗漏信息;多元回归就是让多个数值线索一起参与预测。

1 个线索

简单回归

只用面积预测租金,得到一条直线。

2+ 个线索

多元回归

同时考虑面积和楼龄;每个线索都有自己的系数。

它解决的问题

现实有多个原因一个输入往往不够
每个线索加权学习重要程度与方向
全部样本评分避免只照顾一套房
预测新情况输入多个特征得到数值
  • 能区分特征、目标与参数
  • 能解释每个系数的含义
  • 能写出残差平方和
  • 能说明偏导数如何训练多个参数
01 / FEATURES

特征:模型拿来判断的线索

机器学习把每条数据描述成一组特征。本章令 x₁=楼龄x₂=面积,目标 y=租金

楼龄(年)

数值越大表示房屋越旧。

面积(平方米)

数值越大表示房间越宽敞。

租金(示例单位)

这是模型需要预测的连续数值。

样本楼龄 x₁面积 x₂真实租金 y
A43711
B16186
C244312
下标不是乘法。x₁、x₂ 表示第 1、2 种特征;表格每一行则是一个样本。不要把“特征编号”和“样本编号”混在一起。
02 / MODEL FORMULA

预测公式:每个线索乘自己的权重,再加起来

ŷ = a₀ + a₁x₁ + a₂x₂
ŷ预测值

模型算出的租金。

a₀常数项

整套预测的基础起点。

a₁楼龄系数

面积不变时,楼龄增加 1 的预测变化。

a₂面积系数

楼龄不变时,面积增加 1 的预测变化。

最终学到:ŷ ≈ 1.9292 − 0.0243x₁ + 0.2478x₂
符号怎样读:楼龄系数为负,表示在其他条件相同的模型比较中,楼龄增加时预测租金略降;面积系数为正,表示面积增加时预测租金上升。
系数描述模型中的关系,不自动证明因果。它还会受数据范围、样本量、遗漏特征和特征之间关系的影响。
03 / LINE TO PLANE

一个特征是一条线,两个特征变成一个平面

简单回归只有 x、y 两个轴;多加入一个输入后,需要 x₁、x₂、ŷ 三个方向。模型公式画出来像一张倾斜的平面。

楼龄 x₁面积 x₂租金 ŷ
平面上的高度

给定楼龄和面积,平面的高度就是预测租金。

点到平面的竖直差

真实租金与预测租金之差仍叫残差。

特征更多时

我们无法直接画出高维空间,但公式和计算方法不变。

04 / RESIDUAL SUM OF SQUARES

还是同一个原则:让所有样本共同给模型打分

第 i 个样本的预测是 ŷᵢ=a₀+a₁x₁ᵢ+a₂x₂ᵢ,残差取真实值减预测值。平方后求和得到总损失 Q。

eᵢ = yᵢ − ŷᵢ  Q = Σ [yᵢ − (a₀+a₁x₁ᵢ+a₂x₂ᵢ)]²
  1. 逐行预测:把一套房的楼龄、面积代入公式。
  2. 计算残差:真实租金 yᵢ 减去预测租金 ŷᵢ。
  3. 每个残差平方:避免正负错误互相抵消。
  4. 把所有样本相加:Q 越小,模型整体越贴近数据。
不要把“先求和再平方”写成正确公式。Σeᵢ² 是每个残差先平方再相加;(Σeᵢ)² 会让正负残差先抵消,含义不同。
05 / PARTIAL DERIVATIVES

三个未知参数,就分别问三次“怎样才到谷底”

Q 同时受 a₀、a₁、a₂ 影响。分别对三个参数求偏导并令结果为 0,就得到三条必须同时满足的方程。

∂Q/∂a₀=0  ∂Q/∂a₁=0  ∂Q/∂a₂=0
3a₀ + 44a₁ + 98a₂ = 29
44a₀ + 848a₁ + 1468a₂ = 428
98a₀ + 1468a₁ + 3542a₂ = 1031
这些数字从哪里来?例如 44 是楼龄总和 4+16+24;848 是楼龄平方和 4²+16²+24²;428 是楼龄与租金乘积之和 4×11+16×6+24×12。
联立求解 → a₀=218/113≈1.9292,a₁=−11/452≈−0.0243,a₂=28/113≈0.2478
选学提醒:手算三元联立方程很长。本章主线是理解“每个参数都有一条偏导条件”;计算机可以负责解方程或用梯度下降逐步逼近。
06 / REGRESSION LAB

调三个参数,看每套房的预测怎样一起变化

拖动 a₀、a₁、a₂。橙色代表真实租金,蓝色代表预测;两者之间的差会进入残差平方和。

ŷ
MULTI-FEATURE FITTER / 多元回归实验室
原文数据:A(4,37,11)、B(16,18,6)、C(24,43,12)
样本 A样本 B样本 C租金
真实值 y预测值 ŷ虚线=残差
残差平方和 Q4.68
拟合状态继续调整
a₀ 方向增大
a₁ 方向增大
a₂ 方向增大
预测租金 ŷ=8.00
为什么最佳损失几乎为 0?这个教学例子只有 3 个样本,模型恰好也有 3 个参数,因此能穿过三点。现实数据通常样本更多、带有噪声,最佳损失一般不会为 0。
07 / MACHINE LEARNING

机器学习通常不手解长方程,而是反复小步更新

aₖ ← aₖ − η · ∂Q/∂aₖ

一次训练循环

1 预测用当前参数计算 ŷ
2 算损失汇总全部残差平方
3 求偏导判断各参数的方向
4 更新乘学习率后反向移动
为什么实验室显示三个方向?它们由当前点的三个偏导符号决定。正偏导通常提示减小参数,负偏导提示增大参数;越接近最低点,偏导通常越接近 0。
不同特征的单位会影响训练。面积几十平方米、楼龄几十年还算接近;若一个特征是 0.001,另一个是 100000,常会先做标准化,让梯度下降更稳定。
08 / USE & LIMITS

多个线索更丰富,但不代表模型自动正确

USE 01

房价或租金

面积、楼龄、距离等共同预测连续价格。

USE 02

学习用时

题量、难度、熟练度共同估计完成时间。

USE 03

能源消耗

温度、面积、人数共同估计用电量。

三条边界:样本太少会不稳定;遗漏关键特征会造成偏差;两个高度重复的特征可能让系数难以解释。回归找到的是数据中的近似关系,不是因果证明。
09 / RECAP

多元回归的四个动作

收集特征一行样本有多个输入
x₁,x₂,…
加权预测每个特征乘一个系数
ŷ=a₀+Σaⱼxⱼ
整体评分全部残差平方求和
Q=Σ(y−ŷ)²
学习参数对每个系数求偏导
∂Q/∂aⱼ
10 / CHECK

知识检测:选择后立即诊断

题目会同时检查符号、计算、图像理解与机器学习用途。

题目
已作答0
当前答对0
首次薄弱点0
历史最好
1. 多元回归与简单回归的主要区别是?
2. 本章数据中,哪个是需要预测的目标?
3. 在 ŷ=a₀+a₁x₁+a₂x₂ 中,a₂ 表示什么?
4. a₀ 的主要作用是?
5. 两个输入特征加一个预测输出,线性模型在三维图中通常像什么?
6. 若真实租金为 11、预测为 10.5,残差 y−ŷ 是?
7. 哪个式子表示残差平方和?
8. 模型有 a₀、a₁、a₂ 三个待学习参数,求谷底时通常需要?
9. 为什么三条偏导为 0 的方程要联立求解?
10. 若 ŷ=2−0.02x₁+0.25x₂,x₁=10、x₂=20,预测值为?
11. 机器学习中使用偏导数的主要目的是什么?
12. 哪句话最准确?
0

VISUAL FIRST · 一图读懂

为什么所有房屋要共同校准参数?

模型只有一组共享参数,不能为每套房偷偷换一套答案。看图时沿着两条控制线走一遍。

多套不同房屋共同连接到两个回归参数控制杆的无文字插图
HOW TO READ
读图顺序
同一组旋钮

同一组参数同时作用于所有房屋,代表模型必须使用统一规则。

每条误差线

每套房都会贡献一份预测误差,不能只让其中一套满意。

一起变短

训练寻找的是让所有误差合起来尽量小的一组参数。