不是背公式,而是看懂公式在做什么
学完后你能完成三件事
- 用“预测 → 误差 → 调整”解释机器学习
- 计算数轴和平面上两点之间的距离
- 判断直线距离与街区距离适合什么问题
不需要任何编程基础
你只要见过加减乘除、负数和直角三角形。忘记的知识会在本章重新讲清楚。
为什么 AI 要“猜、比、改”?
如果没有正确答案与预测答案的比较,AI 就不知道这次比上次好还是坏。数学把这种“差多少”变成一个明确数字。
机器学习的四拍循环
快速理解:“太大”或“太小”就是反馈。机器根据反馈改变下一次预测;真正的模型也是这样,只是一次会调整许多个数。
二分猜数每次都能得到明确的“太大或太小”,所以可以把范围砍掉一半。真实模型通常只知道总损失变大还是变小,会把许多参数各调整一点,不一定减半,也不一定一步走对。
四则运算为什么会出现在机器学习里?
因为机器学习需要汇总数据、比较预测、计算影响和求平均。看起来复杂的模型,最后仍由很多简单运算按顺序组合起来。
加法:汇总信息
把多个数据或多项误差合在一起。
减法:找出差异
真实值减预测值,得到误差的方向和大小。
乘法:表示影响
同一个数重复相加,也可以表示某个因素的权重。
除法:平均与缩放
把总量均分,或让不同量级的数据容易比较。
权重像音量旋钮。乘 0.7 的线索声音更大,乘 0.3 的线索声音更小;最后用加法把它们合成一个分数。
乘方让“大错误”变得更显眼
乘方是重复乘法的短写法。机器学习最常见的是平方:把同一个数作为两个因数相乘,例如 5²=5×5。
为什么不用直接相加?如果误差是 +5 和 −5,直接相加会得到 0,好像完全没有错误。平方后变成 25 和 25,总损失是 50,不会互相抵消。
运算顺序保证所有人算出同一个答案
数轴距离:误差最简单的样子
数轴上两点 a、b 的距离写成 |a−b|。两条竖线叫绝对值,它会去掉正负号,所以距离不会是负数。
带符号误差
回答“预测偏低还是偏高?”正负号给出调整方向。
距离
回答“相差多远?”没有方向,单位仍然是原来的单位。
平方损失
回答“训练要惩罚多少?”它是训练分数,不再是普通距离。
为什么三个量都要看?误差告诉机器往哪个方向调;距离告诉我们差多远;损失把错误变成训练要尽量降低的分数。
平面距离:把横向和纵向误差合起来
一个点用坐标 (x,y) 表示。两点的横向差和纵向差形成一个直角三角形,因此可以用勾股定理求斜边。
Δ 读作“德尔塔”
Δx = x₂−x₁这里不用记希腊语,只要记住:Δ 表示“变化了多少”或“两个数的差”。
右下角的小数字
x₁、x₂它不是乘方,只是编号:x₁ 是第一个点的横坐标,x₂ 是第二个点的横坐标。
√ 表示开平方
√25 = 5意思是寻找一个非负数,使它乘自己得到 25。因为 5×5=25,所以 √25=5。
公式从哪里来?
- 横向差:
Δx = x₂−x₁ - 纵向差:
Δy = y₂−y₁ - 勾股定理先求“距离的平方”:
d² = Δx²+Δy² - 开平方变回距离:
d = √(Δx²+Δy²)
具体例子
点 A(2,3),点 B(8,7)
Δx=8−2=6Δy=7−3=4
d=√(6²+4²)=√52≈7.21
√52 不是整数,所以用小数 7.21 表示近似值。
7.21
可以直接穿过平面时的最短直线。
10
只能沿横竖网格移动时的路程。
坐标不一定是地点,也可以是动物的特征
在机器学习里,横轴和纵轴可以换成任何能用数字表示的特征。这里让横轴代表体重,纵轴代表身高:每只动物就会变成坐标图上的一个点。
参考动物:猫 A
猫 A = (4 千克,30 厘米)
第一个数放在横轴,表示体重;第二个数放在纵轴,表示身高。
待判断动物:猫 B
猫 B = (5 千克,32 厘米)
体重只差 1 千克,身高只差 2 厘米,所以它在坐标图上离猫 A 很近。

图上的动物不是站在真实地图上,而是站在“特征空间”里。两只猫的体重和身高接近,所以点也靠近;柴犬的两项特征差得更多,所以距离更远。
距离不只有一种:规则要符合现实
同样的起点和终点,如果小鸟可以直飞,就用直线距离;如果车辆只能沿街道走,就要计算横向与纵向路程之和。

蓝色路线代表可穿过开放空间的直线距离;橙色路线代表必须遵守街道方向的曼哈顿距离。数学公式的选择,本质上是在描述现实世界的规则。
| 距离 | 怎样计算 | 先问自己 |
|---|---|---|
| 欧几里得距离 | √(横向差²+纵向差²) | 可以沿直线直接过去吗? |
| 曼哈顿距离 | |横向差|+|纵向差| | 只能沿横竖网格移动吗? |
| 绝对距离 | |a−b| | 是不是只比较一个数值? |
小鸟从公园飞到学校
空中没有障碍,可以沿最短直线飞过去。应该用哪种距离?
这些距离知识在机器学习里怎么用?
预测房价
回归:让机器预测一个连续变化的数字。预测 320 万,真实 350 万,相差 30 万。训练就是不断让预测与真实答案之间的损失变小。
判断新水果
KNN:问离新数据最近的几个“邻居”属于哪一类。把重量和甜度画成点,新水果离苹果组更近,就更可能被判断为苹果。
自动给用户分组
聚类:没有现成答案,机器自己把相似数据聚在一起。兴趣和行为相近的用户在“数据空间”里更靠近,机器可以把他们分成不同群组。
寻找相似歌曲
推荐:找出与你喜欢内容距离较近的新内容。用速度、响度、节奏感表示歌曲。两首歌的这些特征越接近,听感通常越相似。
一分钟回顾
豆包留下的雨后脚印
周六早晨,豆包没有来等米悦的鸡蛋。姐妹俩从两个相距很远的猜测出发,在雨后的路灯、方砖、花园和围墙之间,一点点学会怎样把“猜错了”变成下一步有用的线索。
鸡蛋凉了,豆包还是没有出现
豆包每天都会在米悦吃早餐时等一小块鸡蛋。今天,椅子边空空的,猫窝、窗帘和阳台都没有那条白色尾尖。开米只在半开的纱窗旁找到几根橘色猫毛。
开米猜豆包在东边第三盏路灯旁晒太阳;米悦闻着远处的面包香,坚持它跑到了第十三盏路灯。姐妹都想让爸爸宣布自己正确,爸爸却只给她们两枚彩色夹子。
一个向前错,一个向后错
第八盏路灯旁,米悦发现湿泥里的梅花脚印和一根橘色猫毛。开米从第三盏走到第八盏,隔了五段;米悦从第十三盏往回走,也隔了五段。
开米用向东的箭头表示自己的改进方向,米悦则需要向西。两个错误方向相反,但她们鞋底走过的间隔同样是五。
两人的距离:|+5|=|−5|=5
正五加负五,真的等于没有猜错吗?
米悦把 +5 和 −5 相加,得意地宣布姐妹合起来一次也没猜错。爸爸没有纠正她,只请她看看两双沾满泥的鞋:如果错误消失了,刚才多走的路也会消失吗?
姐妹用粉笔把两个五格误差各画成一块正方形。方向虽然相反,两块方格谁也擦不掉谁。大错误会长成更大的“错误地毯”,小错误只留下小方巾。
这个 50 不是普通路程,而是给两次猜测的整体错误打出的训练分数。
三格向东,四格向北,蓝绳为什么只有五格?
猫脚印进入方砖广场,先横向延伸三格,再纵向延伸四格。米悦沿方砖走了七格;开米却用蓝绳直接连接起点和花坛,绳子只有五格。
爸爸把三根木条摆成直角三角形,只问姐妹:一条是在数实际沿方砖走的路,另一条是在量没有障碍时的最短直线,它们为什么一定要相等?
离米悦最近的猫,反而不是豆包
小花园里出现了三只橘猫。米悦先把饼干递给离自己最近的一只,它的尾巴尖却是橘色;另一只圆滚滚、腿很短;第三只体型接近豆包,却没有熟悉的小铃铛。
爸爸仍然不替她们选择,只问:现在要比较的是猫站在哪里,还是猫本身拥有什么特点?开米翻出豆包的健康记录,米悦也开始观察体重、身高、尾尖和项圈。
她们画出了一张看不见街道的“特点地图”
开米让横向表示体重,纵向表示身高。豆包大约 4 千克、30 厘米高;一只候选猫大约 5 千克、32 厘米高。它们在现实中可能站得很远,在特点地图上却可以靠得很近。
米悦很快发现:厘米常写成几十,千克通常只有几。如果直接混合,数字较大的特征可能抢走太多影响。爸爸拿出一长一短两把尺子,问“都叫一格就一定公平吗”,姐妹决定先换成相近的比例再比较。
原始特征距离=√[(5−4)²+(32−30)²]=√5
米悦画出的近路,穿过了别人家的围墙
线索朝面包店后门延伸。米悦在地图上画出最短斜线,走到花园尽头却撞上上锁的围墙。一只麻雀沿她画的方向飞了过去,一家三口却只能沿横竖人行道绕行。
爸爸指指麻雀,又指指围墙,没有说公式。开米自己发现:起点和终点没有改变,能不能穿过中间区域,决定了应该怎样计算距离。
只能沿街区走:|横向差|+|纵向差|
纸箱里传来一声轻轻的喷嚏
绕过两个街角,米悦摇响铃铛球。纸箱里探出一只橘色脑袋,白色尾巴尖也跟着晃了晃。豆包的胡子粘着面包屑,脚底还带着花园里的湿泥。
回家后,爸爸才把一路用过的猜测夹、方向带、平方方格、蓝绳、特征记录和围墙地图排在桌上,给姐妹的发现补上数学名字。
开米说,数学没有替她们把豆包抱回来,却让下一步更有根据。米悦把自己的结论写在寻猫记录封面上:猜错不是白走,只要留下方向和距离,下一次就能少绕一点路。
猜错以后别急着擦掉:看方向,量距离,记下损失,再用新线索猜一次。
读完故事,我知道自己要做什么
- 看到预测值和真实值,先分清误差方向、距离与平方损失
- 比较多个特点时,把数据放进特征空间并检查单位是否公平
- 选择距离公式前,先问它是否符合真实世界的移动或比较规则
知识检测:选完马上知道
12 道题覆盖计算、概念和情境选择。选择后立即判定;答错会指出薄弱知识点,并带你回到对应内容。