机械学习 数学研究室
CHAPTER 01阅读进度
给初中生的机器学习数学

AI 是怎样学会猜答案的?

机器学习不是电脑突然“想通了”,而是它先猜一个答案,计算自己差了多远,再调整一点。四则运算、平方和距离,就是这个过程的基础工具。

适合:初中生预计:45 分钟互动实验:6 个检测题:12 道
AI 不是一次命中:候选越来越少,误差越来越小,答案才逐渐浮现。
本章学习路径
1认识学习循环
2准备运算工具
3学会计算距离
4连接真实应用
01 / LEARNING MISSION

不是背公式,而是看懂公式在做什么

3

学完后你能完成三件事

  • 用“预测 → 误差 → 调整”解释机器学习
  • 计算数轴和平面上两点之间的距离
  • 判断直线距离与街区距离适合什么问题
0

不需要任何编程基础

你只要见过加减乘除、负数和直角三角形。忘记的知识会在本章重新讲清楚。

02 / THE LEARNING LOOP

为什么 AI 要“猜、比、改”?

如果没有正确答案与预测答案的比较,AI 就不知道这次比上次好还是坏。数学把这种“差多少”变成一个明确数字。

机器学习的四拍循环

① 输入数据给机器一些线索
② 做出预测先猜一个答案
③ 计算误差比较差了多远
④ 调整数值让下次误差更小
?
二分猜数机
观察反馈怎样把 100 个候选逐步缩小
可能范围0—99
本次预测
尝试次数0 次

    快速理解:“太大”或“太小”就是反馈。机器根据反馈改变下一次预测;真正的模型也是这样,只是一次会调整许多个数。

    注意
    猜数字是“学习循环”的类比,不是所有机器学习的算法。

    二分猜数每次都能得到明确的“太大或太小”,所以可以把范围砍掉一半。真实模型通常只知道总损失变大还是变小,会把许多参数各调整一点,不一定减半,也不一定一步走对。

    03 / ARITHMETIC TOOLKIT

    四则运算为什么会出现在机器学习里?

    因为机器学习需要汇总数据、比较预测、计算影响和求平均。看起来复杂的模型,最后仍由很多简单运算按顺序组合起来。

    加法:汇总信息

    把多个数据或多项误差合在一起。

    3 + 5 + 7 = 15
    为什么需要:训练时要把许多样本的错误合成一个总分。

    减法:找出差异

    真实值减预测值,得到误差的方向和大小。

    真实 80 − 预测 74 = 6
    为什么需要:不做比较,就不知道预测偏高还是偏低。
    ×

    乘法:表示影响

    同一个数重复相加,也可以表示某个因素的权重。

    3 + 3 + 3 + 3 = 3 × 4
    为什么需要:模型会给不同线索乘上不同权重,表示它们的重要程度。
    ÷

    除法:平均与缩放

    把总量均分,或让不同量级的数据容易比较。

    (70 + 80 + 90) ÷ 3 = 80
    为什么需要:平均误差能公平比较数据量不同的两次训练。
    例子:三次预测的误差怎样汇总?
    1分别做减法2、−1、3
    2先取绝对值|−1|=1绝对值会去掉方向,下一节会用数轴看懂它。
    3加总再平均(2+1+3)÷3=2
    ×
    权重实验:哪条线索更重要?
    一个简化的“下雨信号”玩具模型
    WHY MULTIPLY?

    权重像音量旋钮。乘 0.7 的线索声音更大,乘 0.3 的线索声音更小;最后用加法把它们合成一个分数。

    综合下雨信号7.4/ 10
    8 × 0.7 + 6 × 0.3 = 7.4
    别把例子当成真正天气预报:真实模型会从大量历史数据中学出权重。这里的 70% 和 30% 是为了看清“乘法如何控制线索的影响”。
    04 / POWER & PRIORITY

    乘方让“大错误”变得更显眼

    乘方是重复乘法的短写法。机器学习最常见的是平方:把同一个数作为两个因数相乘,例如 5²=5×5。

    重复乘法
    5 × 5 × 5 = 5³
    右上角 3 叫指数,表示有 3 个 5 相乘。
    负数平方
    (−4)² = (−4)×(−4)=16
    括号告诉我们:整个 −4 都要参与平方。
    误差放大
    2²=4,5²=25
    大误差会受到更重的惩罚。
    单个样本的平方损失(也叫平方误差)= (真实值 − 预测值)2

    为什么不用直接相加?如果误差是 +5 和 −5,直接相加会得到 0,好像完全没有错误。平方后变成 25 和 25,总损失是 50,不会互相抵消。

    运算顺序保证所有人算出同一个答案

    括号乘方乘除加减
    一步一步算:3 + (8 − 5)² × 2
    1先算括号8−5=3
    2再算平方与乘法3²×2=18
    3最后加法3+18=21
    05 / DISTANCE ON A LINE

    数轴距离:误差最简单的样子

    数轴上两点 a、b 的距离写成 |a−b|。两条竖线叫绝对值,它会去掉正负号,所以距离不会是负数。

    d = |a − b|
    01

    带符号误差

    真实 − 预测 = 8−3 = +5

    回答“预测偏低还是偏高?”正负号给出调整方向。

    02

    距离

    |+5| = 5

    回答“相差多远?”没有方向,单位仍然是原来的单位。

    03

    平方损失

    5² = 25

    回答“训练要惩罚多少?”它是训练分数,不再是普通距离。

    一维误差观察器
    改变真实值与预测值,观察误差、距离和损失
    真实
    预测
    带方向的误差5
    距离 |误差|5
    平方损失25
    小挑战:拖动任一滑块,让距离等于 3、平方损失等于 9。还差一点

    为什么三个量都要看?误差告诉机器往哪个方向调;距离告诉我们差多远;损失把错误变成训练要尽量降低的分数。

    06 / DISTANCE ON A PLANE

    平面距离:把横向和纵向误差合起来

    一个点用坐标 (x,y) 表示。两点的横向差和纵向差形成一个直角三角形,因此可以用勾股定理求斜边。

    Δ 读作“德尔塔”

    Δx = x₂−x₁

    这里不用记希腊语,只要记住:Δ 表示“变化了多少”或“两个数的差”。

    右下角的小数字

    x₁、x₂

    它不是乘方,只是编号:x₁ 是第一个点的横坐标,x₂ 是第二个点的横坐标。

    √ 表示开平方

    √25 = 5

    意思是寻找一个非负数,使它乘自己得到 25。因为 5×5=25,所以 √25=5。

    三四五直角三角形把横向差三、纵向差四合成直线距离五,并逐步解释根号二十五
    手机上可左右滑动图片 →先不要背公式:横向和纵向组成直角的两条边,真正想求的是斜着走的蓝线。平方相加得到斜边的平方,再开平方把它变回长度。

    公式从哪里来?

    1. 横向差:Δx = x₂−x₁
    2. 纵向差:Δy = y₂−y₁
    3. 勾股定理先求“距离的平方”:d² = Δx²+Δy²
    4. 开平方变回距离:d = √(Δx²+Δy²)

    具体例子

    点 A(2,3),点 B(8,7)

    Δx=8−2=6
    Δy=7−3=4

    d=√(6²+4²)=√52≈7.21

    √52 不是整数,所以用小数 7.21 表示近似值。

    二维距离实验室
    拖动坐标,比较直线距离与街区距离
    AB
    蓝线 · 欧几里得距离
    7.21

    可以直接穿过平面时的最短直线。

    橙线 · 曼哈顿距离
    10

    只能沿横竖网格移动时的路程。

    观察任务:摆出 3-4-5 三角形后,直线距离应为 5,街区距离应为 7。等待尝试
    07 / FEATURE SPACE

    坐标不一定是地点,也可以是动物的特征

    在机器学习里,横轴和纵轴可以换成任何能用数字表示的特征。这里让横轴代表体重,纵轴代表身高:每只动物就会变成坐标图上的一个点。

    它解决什么问题?当机器需要同时比较两个或更多特点时,不能只看其中一个。把每个特点变成一个坐标方向,再计算总距离,就能回答“这个新动物与哪一类最相似”。

    参考动物:猫 A

    猫 A = (4 千克,30 厘米)

    第一个数放在横轴,表示体重;第二个数放在纵轴,表示身高。

    待判断动物:猫 B

    猫 B = (5 千克,32 厘米)

    体重只差 1 千克,身高只差 2 厘米,所以它在坐标图上离猫 A 很近。

    两只猫在体重身高特征空间中靠得很近,兔子稍远,柴犬更远
    03

    图上的动物不是站在真实地图上,而是站在“特征空间”里。两只猫的体重和身高接近,所以点也靠近;柴犬的两项特征差得更多,所以距离更远。

    🐾
    动物相似度实验
    以猫 A 为参考,切换动物并比较特征距离
    比较模式
    体重(千克)→身高(厘米)→🐈猫 A (4,30)🐈猫 B (5,32)
    体重差 |Δx|1 千克
    身高差 |Δy|2 厘米
    原始特征距离√5 ≈ 2.24
    公平缩放把体重差除以 12、身高差除以 30,让它们都变成“占各自范围的比例”。
    猫 B 离猫 A 最近:两项特征都很接近,因此最像参考猫。
    原始距离 = √[(体重差)2 + (身高差)2] = √5 ≈ 2.24
    猫A与猫B的体重和身高差从不同单位的原始数字转换为可公平比较的比例
    手机上可左右滑动图片 →为什么要缩放?直接把千克和厘米混在一起,哪个单位写出来的数字大,哪个特征就可能抢走更多影响力。缩放是换尺子,不是篡改动物。
    一条重要规则:“距离近 = 更相似”不是自动成立的。只有选对特征、把不同单位公平缩放、再选择适合问题的距离公式,距离才有意义。
    08 / CHOOSE A DISTANCE

    距离不只有一种:规则要符合现实

    同样的起点和终点,如果小鸟可以直飞,就用直线距离;如果车辆只能沿街道走,就要计算横向与纵向路程之和。

    机器人在城市模型中比较直线路径与沿街区拐弯路径
    02

    蓝色路线代表可穿过开放空间的直线距离;橙色路线代表必须遵守街道方向的曼哈顿距离。数学公式的选择,本质上是在描述现实世界的规则。

    距离怎样计算先问自己
    欧几里得距离√(横向差²+纵向差²)可以沿直线直接过去吗?
    曼哈顿距离|横向差|+|纵向差|只能沿横竖网格移动吗?
    绝对距离|a−b|是不是只比较一个数值?
    规则选择训练场
    换一个情境,先想现实限制,再选公式
    🐦

    小鸟从公园飞到学校

    空中没有障碍,可以沿最短直线飞过去。应该用哪种距离?

    先观察情境中的移动规则,再选择答案。
    09 / REAL APPLICATIONS

    这些距离知识在机器学习里怎么用?

    回归 REGRESSION

    预测房价

    回归:让机器预测一个连续变化的数字。

    预测 320 万,真实 350 万,相差 30 万。训练就是不断让预测与真实答案之间的损失变小。

    平方损失 = (350−320)²
    分类 KNN

    判断新水果

    KNN:问离新数据最近的几个“邻居”属于哪一类。

    把重量和甜度画成点,新水果离苹果组更近,就更可能被判断为苹果。

    比较:新点到各组的距离
    聚类 CLUSTERING

    自动给用户分组

    聚类:没有现成答案,机器自己把相似数据聚在一起。

    兴趣和行为相近的用户在“数据空间”里更靠近,机器可以把他们分成不同群组。

    目标:组内距离尽量小
    推荐 RECOMMENDATION

    寻找相似歌曲

    推荐:找出与你喜欢内容距离较近的新内容。

    用速度、响度、节奏感表示歌曲。两首歌的这些特征越接近,听感通常越相似。

    歌曲 = (速度, 响度, 节奏感)

    一分钟回顾

    运算加总、比较、加权、平均
    平方消除正负抵消,突出大误差
    距离把“像不像、差多少”变成数字
    STORY LAB / 先用故事看见整章

    豆包留下的雨后脚印

    周六早晨,豆包没有来等米悦的鸡蛋。姐妹俩从两个相距很远的猜测出发,在雨后的路灯、方砖、花园和围墙之间,一点点学会怎样把“猜错了”变成下一步有用的线索。

    姐姐 · 开米 Kimi · 13 岁妹妹 · 米悦 · 6 岁爸爸 · 只提问题,最后再总结任务 · 根据线索找到豆包
    ACT01
    早餐桌旁豆包平时等待鸡蛋的位置空着,开米和米悦在无文字地图上放下两个相距很远的彩色猜测夹,爸爸站在身后倾听
    PICTURE KEY / 看图读数学看图:同一张地图上出现两个不同猜测,但豆包还没有被找到。预测只是暂时判断,必须等待可靠线索检验。

    鸡蛋凉了,豆包还是没有出现

    豆包每天都会在米悦吃早餐时等一小块鸡蛋。今天,椅子边空空的,猫窝、窗帘和阳台都没有那条白色尾尖。开米只在半开的纱窗旁找到几根橘色猫毛。

    开米猜豆包在东边第三盏路灯旁晒太阳;米悦闻着远处的面包香,坚持它跑到了第十三盏路灯。姐妹都想让爸爸宣布自己正确,爸爸却只给她们两枚彩色夹子。

    爸爸只问:在找到可靠线索以前,你们能不能先把两个猜测都留下,不急着擦掉其中一个?
    ACT02
    雨后路灯间的猫脚印位于中央,开米和米悦从相反两侧用彩色圆片标出到脚印的等长间隔,爸爸蹲下观察
    PICTURE KEY / 看图读数学看图:姐妹从相反方向来到同一串脚印。方向不同,但两边相隔的长度可以一样。

    一个向前错,一个向后错

    第八盏路灯旁,米悦发现湿泥里的梅花脚印和一根橘色猫毛。开米从第三盏走到第八盏,隔了五段;米悦从第十三盏往回走,也隔了五段。

    开米用向东的箭头表示自己的改进方向,米悦则需要向西。两个错误方向相反,但她们鞋底走过的间隔同样是五。

    开米的误差:8−3=+5  米悦的误差:8−13=−5
    两人的距离:|+5|=|−5|=5
    米悦的发现:误差的正负告诉我往哪边改;距离不管方向,只回答相差多远。
    ACT03
    雨后地面有两块同样大的粉笔方格和方向相反的彩色带,开米和米悦比较方格,爸爸指向两双沾泥的鞋
    PICTURE KEY / 看图读数学看图:相反方向可以互相抵消,两块平方却都保留下来;两次错误都真实发生过。

    正五加负五,真的等于没有猜错吗?

    米悦把 +5 和 −5 相加,得意地宣布姐妹合起来一次也没猜错。爸爸没有纠正她,只请她看看两双沾满泥的鞋:如果错误消失了,刚才多走的路也会消失吗?

    姐妹用粉笔把两个五格误差各画成一块正方形。方向虽然相反,两块方格谁也擦不掉谁。大错误会长成更大的“错误地毯”,小错误只留下小方巾。

    (+5)²+(−5)²=25+25=50

    这个 50 不是普通路程,而是给两次猜测的整体错误打出的训练分数。

    误差保留调整方向距离表示相差多远平方损失让大错误更显眼
    ACT04
    方砖路上的猫脚印横向走三格再纵向走四格,米悦沿直角路线摆圆片,开米从起点拉出蓝色斜绳,爸爸摆放木条
    PICTURE KEY / 看图读数学看图:横向与纵向组成直角两边,蓝绳连接起点与终点;沿方砖走和直接拉直线回答的是不同问题。

    三格向东,四格向北,蓝绳为什么只有五格?

    猫脚印进入方砖广场,先横向延伸三格,再纵向延伸四格。米悦沿方砖走了七格;开米却用蓝绳直接连接起点和花坛,绳子只有五格。

    爸爸把三根木条摆成直角三角形,只问姐妹:一条是在数实际沿方砖走的路,另一条是在量没有障碍时的最短直线,它们为什么一定要相等?

    d²=3²+4²=25  d=√25=5
    姐妹的发现:平面上不能只看横向或纵向,要把两个方向的差合成一条斜边。
    ACT05
    雨后花园里正好有三只体型不同的橘猫,米悦向最近的猫递饼干并观察尾尖,开米拿着空白记录本,爸爸在身后观看
    PICTURE KEY / 看图读数学看图:现实中离米悦最近的猫不一定最像豆包。寻找“相似”时,需要比较动物本身的特点。

    离米悦最近的猫,反而不是豆包

    小花园里出现了三只橘猫。米悦先把饼干递给离自己最近的一只,它的尾巴尖却是橘色;另一只圆滚滚、腿很短;第三只体型接近豆包,却没有熟悉的小铃铛。

    爸爸仍然不替她们选择,只问:现在要比较的是猫站在哪里,还是猫本身拥有什么特点?开米翻出豆包的健康记录,米悦也开始观察体重、身高、尾尖和项圈。

    ACT06
    花园里的三只候选橘猫形态不同,开米和米悦用体重与身高两种测量工具比较特点,爸爸拿着不同尺度的工具提醒她们观察单位
    PICTURE KEY / 看图读数学看图:体重与身高变成两条特征方向;点靠近表示特点接近,但两种单位需要先换成公平刻度。

    她们画出了一张看不见街道的“特点地图”

    开米让横向表示体重,纵向表示身高。豆包大约 4 千克、30 厘米高;一只候选猫大约 5 千克、32 厘米高。它们在现实中可能站得很远,在特点地图上却可以靠得很近。

    米悦很快发现:厘米常写成几十,千克通常只有几。如果直接混合,数字较大的特征可能抢走太多影响。爸爸拿出一长一短两把尺子,问“都叫一格就一定公平吗”,姐妹决定先换成相近的比例再比较。

    豆包=(4,30),候选猫=(5,32)
    原始特征距离=√[(5−4)²+(32−30)²]=√5
    重要提醒:距离近只表示选定特征更相似,不等于已经证明它就是豆包。
    ACT07
    麻雀沿斜线飞过上锁围墙,开米、米悦和爸爸只能沿围墙外的横竖人行道绕行,猫脚印朝远处建筑延伸
    PICTURE KEY / 看图读数学看图:麻雀能走直线,一家三口却必须绕过围墙;同一对起点终点,会因现实限制需要不同距离。

    米悦画出的近路,穿过了别人家的围墙

    线索朝面包店后门延伸。米悦在地图上画出最短斜线,走到花园尽头却撞上上锁的围墙。一只麻雀沿她画的方向飞了过去,一家三口却只能沿横竖人行道绕行。

    爸爸指指麻雀,又指指围墙,没有说公式。开米自己发现:起点和终点没有改变,能不能穿过中间区域,决定了应该怎样计算距离。

    可以直达:√(横向差²+纵向差²)
    只能沿街区走:|横向差|+|纵向差|
    开米对米悦说:纸上的线再短,如果现实中走不过去,它就不是这道题需要的距离。
    ACT08
    开米、米悦和爸爸找到纸箱里的橘猫豆包,豆包有白色尾尖和绿色项圈,米悦递出猫饼干,开米拿着线索记录本
    PICTURE KEY / 看图读数学看图:姐妹没有靠第一次猜测找到豆包,而是保留每次结果,用新线索不断修正下一步。

    纸箱里传来一声轻轻的喷嚏

    绕过两个街角,米悦摇响铃铛球。纸箱里探出一只橘色脑袋,白色尾巴尖也跟着晃了晃。豆包的胡子粘着面包屑,脚底还带着花园里的湿泥。

    回家后,爸爸才把一路用过的猜测夹、方向带、平方方格、蓝绳、特征记录和围墙地图排在桌上,给姐妹的发现补上数学名字。

    爸爸最后的总结:先根据线索作出预测,再用真实发现计算差异;误差保留方向,距离表示远近,平方损失给错误打分;平面距离把多个方向合起来,特征距离比较数据是否相似;选择公式前,还要先问它是否符合现实规则。
    输入线索 → 做出预测 → 比较误差与损失 → 调整判断 → 再预测

    开米说,数学没有替她们把豆包抱回来,却让下一步更有根据。米悦把自己的结论写在寻猫记录封面上:猜错不是白走,只要留下方向和距离,下一次就能少绕一点路。

    FAMILY MEMORY KEY / 一家人的记忆口诀
    猜错以后别急着擦掉:看方向,量距离,记下损失,再用新线索猜一次。
    做出预测误差与距离平方损失平面距离特征空间公平缩放选择距离根据反馈再预测

    读完故事,我知道自己要做什么

    • 看到预测值和真实值,先分清误差方向、距离与平方损失
    • 比较多个特点时,把数据放进特征空间并检查单位是否公平
    • 选择距离公式前,先问它是否符合真实世界的移动或比较规则
    10 / CHECKPOINT

    知识检测:选完马上知道

    12 道题覆盖计算、概念和情境选择。选择后立即判定;答错会指出薄弱知识点,并带你回到对应内容。

    最好成绩:
    已回答 0/12 · 当前答对 0 · 首次薄弱点 0
    1. 机器学习最基础的循环是什么?
    2. 计算 4 + 2 × 5 的结果是?
    3. 为什么不把 +5 和 −5 直接相加作为总误差?
    4. 数轴上 −3 与 5 的距离是多少?
    5. 点 (0,0) 到点 (3,4) 的欧几里得距离是?
    6. 配送车只能沿方格街道行驶,更适合用哪种距离?
    7. 误差从 2 变成 5,平方误差从多少变成多少?
    8. 推荐系统计算歌曲之间的距离,是想知道什么?
    9. 为什么 √25 等于 5?
    10. 真实值 8、预测值 3,三个量分别是多少?
    11. 乌云 8 分占 70%,湿度 6 分占 30%,综合分是多少?
    12. 为什么比较体重和身高前常要做特征缩放?
    0 / 100