机械学习 数学研究室 CHAPTER 02 阅读进度
JUNIOR ML MATH / 文字式

让字母替数字工作

数字只能讲一个例子,字母却能写下一整类规律。本章从平均数出发,学会读公式、管理一串数据,并第一次看见机器学习如何寻找“误差最小”的答案。

50 分钟05 个互动实验12 道即时诊断

图中“字母公式机器”把具体分数装进字母盒子:数字可以换,平均数规则保持不变。

本章路线 / ROADMAP
1用字母代表数字
2读懂并变形公式
3用下标管理数据
4找到最小误差
00 / MISSION

这一章要解决什么问题?

机器学习常常要处理成百上千个数字。如果每次都把数字完整抄一遍,规律会被淹没。我们需要一种语言,能写出所有同类问题都适用的规则

?
核心任务

怎样用一条短公式描述许多数据,并判断哪个答案让整体误差最小?

READ

会读

看到 3xx₄(a+b)² 时,能逐字翻译它们的含义。

CALCULATE

会算

能代入数字、使用分配律,并计算一组数据到候选值的平方误差。

EXPLAIN

会解释

能说明为什么平均数会出现在“寻找最小误差”的机器学习任务中。

01 / LETTERS AS CONTAINERS

字母不是神秘数字,而是“有名字的盒子”

假设三次数学测验是 56、78、91 分。要算平均分,我们写 (56+78+91)÷3。换一位同学,三个数字变了,但“相加再除以 3”的规则没有变。

FROM ONE EXAMPLE TO A RULE / 从一个例子到通用规则
(56 + 78 + 91) ÷ 3 → (a + b + c) ÷ 3

a、b、c 是三个盒子的名字。把不同分数放进去,同一条公式仍然能工作。

字母公式机器先把五十六、七十八、九十一装进a、b、c并算出平均分七十五,再换一组数字继续使用同一条公式
手机上可左右滑动图片 →看图时抓住不变量:第一组数字换成第二组数字以后,a、b、c 盒子里的内容变了,但“相加再除以 3”的规则完全没有变。这就是使用字母的真正原因。
a, b, c

常用来表示已知数或固定参数。
例如三次已经得到的分数。

x, y, z

常用来表示会变化或待寻找的数。
例如我们正在尝试的预测值 x

i, j, k

常用来表示位置编号。
例如第 i 个数据,但这只是习惯,不是死规定。

!
容易误会:字母一定等于某个固定数字?不一定。字母的身份由题目决定。a 在一道题里可以是 56,在另一道题里可以是 82;先看定义,再计算。
WHY MACHINE LEARNING?

模型必须用同一条规则处理新数据

训练时和预测时的数据都可能改变,公式不能只为一个数字服务。字母让我们先写下通用关系,再把每个样本的具体数值代进去。

02 / AVERAGE MACHINE

一条平均数公式,能处理无数组数字

三个数的平均数,就是总和平均分给三份。括号很重要:它告诉我们先把三个数加起来,再除以 3。

a + b + c把三个数据合成总量。
÷ 3总量平均分成 3 份,因为现在有 3 个数据。
(a+b+c)÷3得到这三个数据的“中心位置”——平均数。
互动实验:给字母换数字LAB 01 / 05
LIVE FORMULA / 实时代入 (56+78+91)÷3
平均数 = 75
三个分数总共 225 分,平均分成 3 份,每份 75 分。
03 / MATH SHORTHAND

为什么 3 × x 可以写成 3x

字母已经让公式变短,数学家还会省略乘号。数字写在字母前面时,3x 就表示“3 乘 x”。

THREE EQUIVALENT WRITINGS / 三种写法含义相同
3 × x = 3 · x = 3x

如果 x=4,那么 3x=3×4=12。它绝不是 34,也不是

×
3xx₃ 是三件不同的事3x 是 3 乘 x;x₃ 是第 3 个 x; 是 x 自己相乘 3 次。数字的位置决定含义。
互动实验:代入以后再计算LAB 02 / 05

看到字母式时,先把字母替换为括号里的具体数字,再按运算顺序计算。

SUBSTITUTION / 代入过程 3x = 3×4 = 12
x² = 4×4 = 16
注意:系数 3 和平方 ² 做的事情不同。
04 / DISTRIBUTIVE LAW

分配律:括号外的数,要送给里面每一项

买 3 份套餐,每份有一瓶水 x 元和一块面包 y 元。可以先算一份套餐再乘 3,也可以分别算 3 瓶水和 3 块面包。

DISTRIBUTIVE LAW / 分配律
a(x + y) = ax + ay

括号外的 a 必须分别乘括号里的 xy,不能漏掉任何一项。

图解:把 a 分给两项LAB 03 / 05
a
x
y
a(x + y) = ax + ay
想象 a 是快递员:括号里有几户人家,它就必须把包裹送到几户。
!
常见错误:3(x+4)=3x+4右边漏乘了 4。正确是 3x+12。可以代入 x=2 检查:左边是 18,错误写法只有 10。
05 / SQUARE FORMULA

(a+b)² 为什么不等于 a²+b²

(a+b)² 表示边长为 a+b 的正方形面积。把大正方形切开,会得到四块,而不是两块。

SQUARE EXPANSION / 完全平方公式
(a + b)² = a² + ab + ab + b² = a² + 2ab + b²

中间的两块长方形面积都是 ab,所以绝不能漏掉 2ab

互动实验:把平方公式看成面积LAB 04 / 05
a² = 9 ab = 6 ab = 6 b² = 4

(3+2)² = 9+12+4 = 25

:左上正方形2ab:两块一样的长方形:右下正方形
WHY MACHINE LEARNING?

平方会把正负误差都变成非负数

预测高了 3 和预测低了 3,一个误差是 +3,一个是 −3;直接相加会互相抵消。平方后都变成 9,而且较大的错误会受到更重惩罚。

06 / SUBSCRIPTS

数据太多时,用下标给它们编号

如果有 1000 个分数,不可能一直发明新字母。我们用同一个字母 x 表示“同一类数据”,再用右下角的小数字表示它的位置。

ONE DATASET, MANY POSITIONS / 同一组数据的不同位置
x₁, x₂, x₃, …, xᵢ, …, xₙ

xᵢ 读作“x 下标 i”,表示第 i 个数据;n 常表示数据总数。

x₁
第 1 个数据 = 72 分

下标 1 是位置标签,不是“x 乘 1”,也不是“一次方”。

xᵢ第 i 个数据;i 可以依次取 1、2、3……
xₙ第 n 个数据;如果一共有 n 个,它就是最后一个。
程序里的 data[0]许多编程语言从 0 开始编号;数学教材常从 1 开始。规则不同,含义相同:都是定位。
07 / WRITE THE ERROR

把“猜得好不好”写成一个能计算的数

有三个数据 2、5、8。我们只用一个数 x 代表它们。怎样判断某个候选值好不好?分别计算每个数据和 x 的距离,再平方、相加。

一句话

损失函数就是机器能读懂的“评分尺”。人能说“5 看起来比较合适”,机器只会比较数字;于是我们规定:损失越小,猜得越好。

先把 2、5、8 放回一个生活场景

假设同一条配送路线最近三天分别晚到 2、5、8 分钟。最简单的模型暂时不看天气和路况,只学习一个固定数 x,作为“这条路线通常会晚几分钟”的预测。

DATA / 数据2、5、8

三天真实发生的晚点分钟数,是模型必须尊重的证据。

MODEL / 模型统一预测 x

这是只有一个参数的最小模型;它对每个相似日子先给同一个答案。

LOSS / 损失预测与真实有多不合

把三天的错误合成一个分数,才能公平比较不同候选值。

?
学生会问:为什么三天都预测同一个 x?真正的机器学习不是应该每天猜得不一样吗?

问得对。本章故意从最简单的基准模型开始:它还不会看天气、距离等条件,只学习“通常是多少”。等我们加入输入特征后,模型就能根据不同情况给出不同预测。这里的简单模型是起点,不是机器学习的全部。

SQUARED ERROR SUM / 平方误差和
E(x) = (2−x)² + (5−x)² + (8−x)²

E 可以理解为 Error(误差)。它不是一个固定数,因为换一个候选值 x,总误差也会改变。

(2−x)²第 1 个数据与候选值的平方距离
(5−x)²第 2 个数据与候选值的平方距离
(8−x)²第 3 个数据与候选值的平方距离
损失计分板比较候选值二、五、八,三个总损失依次为四十五、十八、四十五,因此五最好
手机上可左右滑动图片 →别只看某一天:x=2 完美符合第一天,却离第三天很远;x=8 也有同样问题。x=5 没有照顾某一天而牺牲另外两天,所以总损失最小。

别把“误差、平方误差、总损失”混成一个东西

ONE SAMPLE / 一条数据带方向的误差真实值减预测值,正负号告诉我们预测偏高还是偏低。
8 − 5 = +3
ONE SAMPLE / 一条数据平方误差把这一次误差平方,避免正负抵消,并让大错误更显眼。
(+3)² = 9
ALL SAMPLES / 整组数据总损失把所有样本的平方误差相加,得到比较模型的训练分数。
9 + 0 + 9 = 18
单位提醒:晚点距离是“分钟”,平方误差是“分钟²”,总损失主要是训练用的评分。看到损失 18,不能说“模型晚了 18 分钟”。

为什么一定要变成一个数?

如果模型 A 在第一天更准、模型 B 在第三天更准,仅靠“看起来不错”无法决定谁更好。损失把所有样本的错误合成一个统一分数,计算机才能完成三件事:比较两个模型、判断这次调整有没有进步、决定下一步往哪里改

Σ
如果有 1000 个数据怎么办?

下一章会用求和符号 Σ 把这类长算式压缩成一行。本章先把三项写全,确保你知道每一项来自哪里。

!
距离与平方误差不是同一个数当距离是 3 时,平方误差是 9。平方是为了让方向不互相抵消,并让大错误更显眼,不是因为原来的距离“算错了”。
08 / ERROR VALLEY

拖动候选值,寻找误差山谷的最低点

把每个 x 对应的总误差画成点,会形成一条 U 形曲线。曲线越低,代表这个候选值让三个数据的整体误差越小。

横轴:模型正在猜什么x=2、3、4、5…,每个位置都是一个候选参数。
纵轴:这次猜得多差E(x) 越大,整体错误越严重;越小越好。
曲线上的点:一次试验例如点 (5,18) 表示猜 5 时,总损失是 18。
候选值和损失试算表被画成坐标点,连接后形成最低点位于五的U形误差山谷
手机上可左右滑动图片 →山谷的来源:先计算许多组 x → E(x),再把这些点画出来。所谓“走到谷底”,其实就是让损失数字从 45、30、21 一路下降到 18。
不要把“山谷”误会成真实地形。它只是一张成绩变化图:横向换候选参数,纵向记录损失。真实程序通常不会先画图再用眼睛找,而是用优化方法计算应该往哪个方向调整。
互动实验:哪一个 x 最能代表 2、5、8?LAB 05 / 05
E(x) = 18.00
(2−5)² + (5−5)² + (8−5)² = 9 + 0 + 9
你找到了最低点:x=5,正好也是 2、5、8 的平均数。

机器怎样知道应该往左还是往右?

最直观的方法是试一下旁边的位置:如果损失下降,就继续朝那个方向移动。真实机器学习常用“梯度”更快地判断下坡方向;你现在只需把它理解成观察哪边更低

x=2:E=45试试右边的 x=3,损失变成 30,说明应该向右走。
x=5:E=18向左到 4 或向右到 6,损失都会变成 21,因此这里是最低点。
x=8:E=45试试左边的 x=7,损失变成 30,说明应该向左走。
为什么
不是 0

因为一个固定的 x 不可能同时等于 2、5、8。最低损失是 18,不代表训练失败,而是说明这个只有一个参数的简单模型能力有限。加入天气、距离等特征后,真实模型可以对不同日子给出不同预测。

为什么最低点恰好是平均数?

把代表值向右移动,会离左边的数据更远、离右边的数据更近。平均数是平方误差彼此平衡的位置。对任意一组数据,平方误差和最小时的代表值就是平均数

选学挑战:用公式证明最低点是 5

看不懂这一段也不影响继续学习。它只是把刚才图上的“最低点”变成严格的代数结论。

E(x)=(2−x)²+(5−x)²+(8−x)²
先写出总误差。
E(x)=3x²−30x+93
使用平方公式和分配律展开,再合并同类项。
E(x)=3(x−5)²+18
把式子重新整理成“一个平方 + 18”。
(x−5)² ≥ 0
平方不可能小于 0;当 x=5 时,它才等于 0,所以最小总误差是 18。
09 / MACHINE LEARNING BRIDGE

机器学习,其实在重复“尝试—算错—改进”

刚才的 x 可以看成一个极简模型的参数。机器不断尝试不同的 x,用损失函数评分,再朝误差更小的方向调整。这个反复降低损失的过程,就是“训练”。

配送机器人小达进行三轮学习,预测参数从十二改到十八再改到二十,损失从二百降到二十再降到八
手机上可左右滑动图片 →沿着三轮分镜读:小达第一次猜 12,损失 200;修改到 18 后损失降到 20;再修改到 20,损失只剩 8。参数在变、损失在降,这就是“学会了”的可观察证据。
尝试发生在哪里?蓝色参数从 x=12 变成 18,再变成 20。
算错怎样被记录?每轮都把三次误差平方相加,得到损失 200、20、8。
改进的证据是什么?不是机器人“感觉更好”,而是同一把评分尺测得的损失持续下降。
STEP 01选一个参数

先猜候选值 x,例如 2。

STEP 02做出预测

用同一个 x 代表所有数据。

STEP 03计算损失

平方误差和告诉我们整体错得多不多。

STEP 04找到最低点

不断调整,直到损失不能再变小。

参数 parameter模型中可以被调整的数;本例是 x
损失 loss把“模型有多差”压缩成一个可比较的数;本例是 E(x)
优化 optimization寻找让损失尽可能小的参数;本例的最佳参数是 5。

本章模型和真实模型,差别在哪里?

本章的起步模型

不看条件,只学一个通常值

预测晚点 = x
  • 参数只有 x 一个。
  • 每个日子都会得到同一个预测。
  • 适合先理解损失与优化。
更接近真实的模型

读取特征,再产生不同预测

预测时间 = w₁×距离 + w₂×雨量 + b
  • 距离、雨量是输入特征。
  • w₁、w₂、b 是要学习的参数。
  • 条件不同,预测结果也不同。

换成真实任务,哪些东西变了?

配送时间

预测一单需要多久

模型读取距离、天气和时段,预测 28 分钟;真实用了 30 分钟。训练时把这 2 分钟误差计入许多订单的总损失。

单次平方误差:(30−28)² = 4
房价回归

学习每个特征的影响

面积、楼层、位置都有自己的参数。模型预测 105 万,真实成交 100 万;优化器调整多个参数,让许多房子的总损失下降。

单次平方误差:(100−105)² = 25
食堂备餐

预测明天准备多少份

模型根据星期、天气和历史销量预测 210 份,实际卖出 220 份。损失帮助模型判断新的参数是否比昨天更好。

误差:220−210 = 10 份
平方误差不是所有机器学习的唯一选择。预测连续数字(时间、价格、销量)经常使用平方损失;识别猫狗等分类任务常使用别的损失函数。但共同原则不变:必须把“预测有多差”变成可计算、可比较的分数。

训练分数低,就一定真的学会了吗?

训练数据:平时练习模型可以查看这些记录并调整参数。训练损失下降,说明它越来越会处理已经看过的例子。
测试数据:没见过的新题训练结束后,用新的记录检查模型。新数据上也表现好,才说明它学到了可推广的规律,而不是只记住答案。
学有余力:真实世界的“山谷”还会更复杂

本章只有一个参数,损失曲线是清楚的 U 形。真实模型可能有许多参数,损失图更像有山脊、平地和多个低洼处的复杂地形;调整一步的大小叫“学习率”,太大可能跨过谷底,太小又会走得很慢。你暂时不需要计算它们,只需记住:寻找更小损失的核心思想没有变

IMPORTANT BOUNDARY / 别把类比当全部

真实模型通常不只有一个参数

本章是一个最小模型:只寻找一个代表值。现实中的图像识别模型可能有数百万甚至更多参数,但基本逻辑仍相似——定义损失、调整参数、让损失下降。聚类算法 K-means 中的“聚类中心”也会用到平均数与平方距离。

10 / ONE-PAGE RECAP

离开这一章前,你应该能说清四件事

01 字母是可替换的盒子同一条公式换入不同数字,仍能执行相同规则。
02 位置改变,符号含义改变3x 是乘法,x₃ 是编号, 是三次方。
03 公式变形要保持等值分配律不能漏项,平方展开不能漏掉中间的 2ab
04 训练就是反复降低损失模型先预测,损失函数打分,优化器调整参数;在本章的单参数模型中,最低点是平均数。
STORY LAB / 先在生活里遇见公式

面包香来时,牛奶也正好温热

开米和米悦想在周六早晨给爸爸一个小惊喜:等他买面包回来,桌上的牛奶既不能早早凉掉,也不能还没热好。她们没有从公式开始,而是先翻出三个旧周六留下的等待记录。

姐姐 · 开米 Kimi · 13 岁妹妹 · 米悦 · 6 岁爸爸 · 先提问题,最后再总结任务 · 让热牛奶与新面包尽量同时到桌
ACT01
周六早晨的厨房里,米悦捧着已经不冒热气的杯子,开米比较冰箱上长短不同的三条计时带,爸爸准备出门买面包
PICTURE KEY / 看图读数学看图:三条计时带都来自真实的周六。机器学习不是挑一条顺眼的记录,而是先让整组经历留下证据。

米悦第三次把凉牛奶端回厨房

前一个周六,爸爸很快就带着面包回来,米悦还没来得及热牛奶;再前一个周六,她提前端上桌,牛奶等到没有热气。米悦不想再把早餐变成碰运气。

开米翻出三条旧计时带:从爸爸发来“买到了”的消息,到门锁响起,分别等了 2 分钟、5 分钟和 8 分钟。米悦伸手去拿最短的一条,因为她最不喜欢等待。

爸爸只问:如果今天不像最快的那一次,你愿不愿意先让另外两次也把经过说完?
故事里三个周六留下三次等待 数学里2、5、8 是三个数据 机器学习里它们是训练样本
ACT02
姐妹把三条不同长度的计时带轮流放进三个相同的空木盒,桌边还有一个可以左右移动的橙色候选旋钮,爸爸在门边提出问题
PICTURE KEY / 看图读数学看图:木盒没有规定里面必须是哪一个数字;它只负责给一个值留位置。橙色旋钮则代表这一次准备尝试的等待时间。

会换数字的小盒子,需要一个不会换的名字

开米想做一张下周还能继续用的记录卡。如果每次都把 2、5、8 印死在卡上,新周六一来,整张卡就要重做。她画了三个空盒,先叫它们 a、b、c。

米悦把三条计时带换着塞进盒子,终于明白:字母不是神秘数字,而是“这个位置以后会装一个值”的名字。开米又把等待旋钮叫作 x,因为 x 还要试很多次,并没有提前决定。

三个数据的平均数 = (a+b+c)÷3
x = 模型这一次尝试的等待时间
爸爸仍然只问:下周换成三条新记录时,是公式跟着换,还是只换盒子里的内容?
ACT03
桌面上用三组蓝色方块、空记录盒和立方体展示同一枚橙色标记放在不同位置时承担不同任务,姐妹俩靠近观察,爸爸在旁提问
PICTURE KEY / 看图读数学看图:三份、第三个和连乘三次是三件不同的事。小数字放在字母的前面、右下角或右上角,工作也随之改变。

米悦把小小的 3 搬了三次家

米悦想在卡片上写“有三份 x”,先把 3 放到 x 的脚边,又举到 x 的头顶。开米没有擦掉,而是拿来木块,让三个写法各自做一次工作。

3x3 在前面:3 个 x,也就是 3×x x₃3 在右下角:第 3 条 x 数据 3 在右上角:x×x×x

米悦给三个位置起了小名:“几份座”“号码座”和“连乘座”。这样一来,她不再只看见一个小小的 3,而会先问它坐在哪里。

爸爸只指着三个位置问:它们长得一样,就一定在做同一份工作吗?
ACT04
三只早餐盘中有两只缺少酸奶,米悦正把两杯酸奶补进去;桌前的正方形隔热垫由两个方块和两条长方形拼成,爸爸摊开手发问
PICTURE KEY / 看图读数学看图:三只盘子都要得到括号里的完整一份;边长分成两段的正方形,中间还会出现两块相同的长方形。

不能让第三只早餐盘少一杯酸奶

爸爸出门前,姐妹先摆三份早餐。每份都有一块 x 元的面包和一杯 y 元的酸奶。米悦写成 3x+y,开米却指了指两只空着酸奶格的盘子。

3(x+y)=3x+3y

括号外的 3 要分给里面每一项。随后,她们用两种花布拼边长为 a+b 的正方形隔热垫。两个角落之外,还剩两条同样大小的长方形,谁也不能凭空消失。

(a+b)²=a²+ab+ab+b²=a²+2ab+b²
爸爸临出门前问:少掉一杯酸奶,早餐还完整吗?少掉一块 ab,大正方形还铺得满吗?
ACT05
爸爸离开后,开米和米悦观察三条计时轨道,同一个候选位置在三条轨道上留下大小不同的误差方块,越远的记录方块越多
PICTURE KEY / 看图读数学看图:候选时间照顾好一条记录,并不会让另外两条的差距消失。所有样本都要给同一个参数打分。

只讨好最快的一天,另外两天就被忘了

门关上后,米悦立刻把旋钮推到 2。这样确实能完美配合最快的一天,可 5 和 8 仍离它很远。开米让每条记录都算一次“真实等待减去候选时间”,再把结果平方。

E(x)=(2−x)²+(5−x)²+(8−x)²

E 是总损失:不是某一天的错误,而是三天共同给 x 打出的分数。平方让正负误差都留下来,也让离得特别远的候选值受到更明显的惩罚。

E(2)=0+9+36=45
E(5)=9+0+9=18
E(8)=36+9+0=45
2、5、8三个训练样本 x模型正在尝试的参数 E(x)整组样本的总损失
ACT06
姐妹把不同候选时间产生的误差方块堆成两端高中央低的山谷,橙色旋钮从高处滚向最低处,三条旧计时轨道仍摆在桌前
PICTURE KEY / 看图读数学看图:每试一个候选值,就得到一堆总损失。把这些分数排起来,最低的一堆就是当前规则最合适的位置。

厨房桌上,真的长出了一座误差山谷

开米没有直接说答案。她们继续试 3、4、6、7,把每个候选时间的总损失都用方块堆起来。两边越堆越高,中间只剩一处低低的谷底。

米悦把橙色旋钮从左边往右推:只要方块变少,就继续;一旦方块变多,就退回上一步。最后旋钮停在 5。她重新算了一遍,2、5、8 相加再除以 3,也正好得到 5。

平均数=(2+5+8)÷3=5
对“只预测一个固定值”的模型,平均数使平方误差和最小。
米悦终于说清楚:机器不是因为喜欢 5 才选它,而是因为三条记录一起评分时,5 的总损失最低。
尝试先放一个候选参数 算错计算整组数据的损失 改进向损失更低的位置移动
ACT07
大雨中爸爸很晚才带面包回家,桌上的牛奶已经不冒热气,米悦有些失落,开米搂着妹妹并拿起雨云形状的新线索,爸爸指向雨衣和旧模型发问
PICTURE KEY / 看图读数学看图:旧谷底还在原处,但今天多了大雨。规则若从没看见天气,就不可能根据雨势改变预测。

第五分钟响了,门外却只有雨声

橙色旋钮停在 5,米悦准时端出牛奶。可窗外突然下起大雨,五分钟过去,门锁没有响;又等了很久,浑身湿透的爸爸才提着面包回来。

米悦摸着凉掉的杯子,小声问:“我们不是已经找到最低点了吗?”开米没有马上回答,只把旧记录排开:那三天都是普通天气,也没有记录面包店前排了多少人。

爸爸仍然只问:今天和那三个周六有什么不同?你们的旧规则,看得见这些不同吗?
旧模型每天都只预测同一个 x 漏掉的线索雨势、排队情况 这次失败暴露模型缺少哪些特征

姐妹终于明白:谷底只保证“在旧数据和旧规则里已经尽力”,并不保证每个新日子都正确。最小训练损失不是永远正确的证明。

ACT08
几个周六后,姐妹把晴雨和排队线索加入新的预测装置,爸爸带面包进门时杯中仍有热气,米悦把当天结果继续放入空记录盒
PICTURE KEY / 看图读数学看图:新模型根据不同线索给出不同等待时间;新一天用来检验预测,检验后的结果还会成为下一轮学习证据。

几个周六以后,蒸汽和门锁几乎同时出现

姐妹又记录了几个周六。这一次,她们除了等待时间,还留下晴雨和排队情况。开米把模型写成一条会读取条件的规则,米悦负责把当天线索放进对应的小盒。

预测时间 = w₁×排队情况 + w₂×雨势 + b

她们还保留了一个新周六,不让它参与调参数,只用来检查规则有没有学会。那天定时器响起不久,门锁也“咔哒”一声。米悦捧起仍有热气的杯子,却没有把记录卡收起来,而是把今天的结果放进下一轮资料。

爸爸最后的总结:字母给会变化的数留位置;参数 x 是模型正在调整的猜测;损失把许多样本的错误合成一个可比较的分数;寻找谷底,就是让模型朝整体错误更小的方向学习。平均数是“固定预测模型”的最佳答案,而天气、排队等特征能让更完整的模型针对不同日子作出不同预测。
收集数据 → 尝试参数 → 计算损失 → 向低处调整 → 用新数据检验
故事里姐妹调整早餐等待时间 数学里寻找平方误差和的最小值 机器学习里根据数据训练并检验模型
FAMILY MEMORY KEY / 一家人的记忆口诀
字母给变化留座位,样本一起给参数评分;试一个数,算整组错,往低处改,再让新一天检验。
早餐总错时保留旧数据字母留位置看懂代数样本共同评分寻找谷底发现缺少特征用新周六检验
11 / LIVE DIAGNOSTIC

选择后立刻知道:你是算错,还是概念没懂

每道题选完马上反馈。答错后可以去对应知识点复习,再回来修改;章末报告仍会记住你第一次暴露的漏洞。

已答 0 / 12当前正确 0
Q01(56+78+91)÷3 写成 (a+b+c)÷3,主要好处是什么?
Q02三个数 a、b、c 的平均数应写成:
Q03x=4 时,3x 等于多少?
Q043(x+4) 正确展开是:
Q05(x+2)² 展开后是:
Q06一组成绩写成 x₁,x₂,…,xₙ,其中 x₇ 表示:
Q07用一个数 x 代表数据 2、5、8,总平方误差应写成:
Q08在数据 2、5、8 中,哪一个候选值使平方误差和最小?
Q09预测误差分别是 +3 和 −3。为什么不直接相加,而常把它们平方?
Q10在本章的极简模型中,“优化”最接近下面哪件事?
Q11数据是 2、5、8,最佳候选值 x=5 时损失仍然是 18,没有变成 0。最合理的解释是:
Q12为什么真实的配送时间模型可以对不同订单给出不同预测,而本章模型只能预测同一个 x?