为什么机器学习离不开“全部加起来”?
一位老师可以看一份作业;机器学习却常常要同时检查成千上万份“训练作业”。它需要一个简短写法,告诉电脑怎样对每一份数据执行同样的计算。
不用 Σ 时
如果有 1000 个样本,就要写 loss₁ + loss₂ + loss₃ + … + loss₁₀₀₀。式子很长,也不方便改成 5000 个样本。
使用 Σ 后
只写 Σ lossᵢ,就能表达“把每个样本的损失都算出来,再全部加起来”。数据数量改变,规则不变。
Σ 负责把许多“小意见”合成一个“总意见”
- 学完后能把 Σ 翻译成普通加法
- 能解释 i 为什么只是编号
- 能用平均损失比较模型
- 能看懂重心与 k-means 为什么需要 Σ
拆开 Σ:只看三个零件
每次读 Σ,都按同一个顺序提问:从哪里开始?到哪里结束?每次加什么?
下限 i=1
告诉 i 从 1 出发。若写 i=2,就从第二项开始,不会自动补上 x₁。
上限 4
告诉 i 到 4 停下。1、2、3、4 一共是 4 个编号。
被加项 xᵢ
i 每改变一次,就取对应位置的数据:x₁、x₂、x₃、x₄。
i 是号码牌,Σ 是一段循环
电脑不会一眼看完长加法。它会让一个号码牌 i 逐步变化:找数据、计算、加入累计结果。这正是程序里的“循环累加”。
看不懂时,就把 Σ 展开
展开不是“笨办法”,而是检查公式最可靠的办法。你可以立刻看到一共有几项、每项做了什么。
试一试:选 xᵢ+2。括号里的 “+2” 会在每一轮都执行,所以 4 项数据会多出 4 个 2。
范围、括号和三条求和规则
不必死背规则。先拿三项数据展开,左右两边若完全相同,规则才成立。
先数清一共有几项
从 a 到 b(两端都算)共有 b−a+1 项。所以上限 5 不等于“有 5 项”。
括号决定 Σ 的“管辖范围”
若有 3 项:
(x₁+2)+(x₂+2)+(x₃+2)
总共出现三个 2。
若有 3 项:
x₁+x₂+x₃+2
全部求和结束后,只加一次 2。
总和回答“合起来多少”,平均数回答“每份大约多少”
Σ 只负责加法。要得到平均数,还要除以数据个数 n。漏掉 ÷n,是这一章最常见的计算错误。
数据 3、7、4、6 合起来是 20。样本越多,总和通常越大。
平均到每个数据大约是 5。它把不同数量的数据放到“每份”尺度上。
- 先数:数据 3、7、4、6 一共有 n=4 个。
- 再加:Σxᵢ=3+7+4+6=20。
- 后除:x̄=20÷4=5。
机器学习例子:让一批样本共同给模型打分
模型不能只在一道题上表现好。训练时,它会对一批样本逐个预测,算出每个样本的损失,再用 Σ 汇总。这样才能判断“整体猜得好不好”。
先说答案:这个知识点到底是干什么的?
它的目的,是把模型在许多样本上的表现,压缩成一个可以比较、可以改进的分数。这个分数通常叫“平均损失”。没有它,电脑只知道每道题各错了多少,却不知道这轮训练整体好不好,也不知道改完以后有没有进步。

只看一题,会被运气骗
假设猫图片 A 猜对了,但猫图片 B、C、D 全猜错。只检查 A,会误以为模型很聪明;把整批图片一起评分,问题才会暴露。
一批样本:更接近模型真正的能力。

一批样本,像一个评审团
每个样本都拿自己的真实答案检查预测,并交出一个 lossᵢ。Σ 把所有意见收齐,平均损失就是这批样本给模型的“综合分”。

综合分,告诉模型有没有进步
模型调整一次以后,再用同样方法评分。如果平均损失从 8 降到 4.67,说明整体预测变好了;如果升高,就说明这次调整方向不对。
它在训练中怎样真正发挥作用?
挑战:把三个预测都拖到真实值,平均损失就会变成 0。
房价预测
每套房都有一个预测价。Σ 把所有房子的预测误差合在一起,避免模型只照顾某一套房。
图片识别
一批猫狗图片各自产生损失。平均损失下降,通常说明模型对整批图片的判断正在改善。
天气温度
连续多天的预测一起评分。某一天猜对,不能掩盖其他许多天的错误。
二维重心:横坐标平均一次,纵坐标再平均一次
在机器学习里,点的坐标不一定是真实位置,也可以是两个特征。比如游戏角色的横轴是“速度”,纵轴是“力量”。重心就是一群角色的平均特征位置。
k-means:用“最近 + 平均”让数据自己组队
聚类是一种没有现成答案标签的机器学习任务。k-means 先放几个临时重心,再重复“分给最近重心”和“用 Σ 更新平均位置”。
先说答案:k-means 到底是干什么的?
它用来在“没有现成分组答案”的大量数据中,自动寻找几个相似的小队。例如你有 5000 首没有分类标签的歌曲,只有速度、响度、节奏感等数字;k-means 可以根据这些特征,把位置接近的歌曲聚成几组,供你继续观察和命名。

为什么要用:数据太多,又没有标签
如果每首歌曲都让人手工试听、贴标签,会非常慢。k-means 先根据“节奏速度、能量”等数值寻找自然靠近的几堆,人再查看每堆有什么共同点。

核心动作:先就近入队,再移动队旗
每个学生先走向最近的队旗;接着队旗移动到本队学生的平均位置。旗子一动,有些学生可能发现另一面旗更近,于是再检查一次。
它怎样和前面学过的数学建立对应?
(x,y)
- 先放两枚临时重心:C₁=(1,1),C₂=(8,8)。它们只是起点,不是正确答案。
- 比较距离:A、B、C 离 C₁ 更近;D、E、F 离 C₂ 更近,于是暂时分成两组。
- 更新蓝组:((1+2+1)÷3, (1+1+2)÷3)=(1.33,1.33)。
- 更新橙组:((7+8+7)÷3, (7+7+8)÷3)=(7.33,7.33)。
- 必须再检查:重心移动后,“最近的队旗”可能改变。不断重复,直到分组和重心几乎不再变化。
为什么这也叫“机器学习”?
因为程序没有得到“A 应该属于第 1 组”这样的标准答案。它只得到数据和一个目标——让组内距离平方和更小。算法通过多轮“尝试分组 → 计算损失 → 更新重心”,从数据中学出重心位置和分组结果。这叫无监督学习。
适合使用 k-means
- 没有标签,想先发现大致群体
- 对象能用数字特征表示
- 希望每组都有一个平均代表
- 例如歌曲分组、顾客分群、颜色压缩
不适合直接使用
- 已经有明确正确标签,要做分类预测
- 组形状弯曲、大小差别特别大
- 特征单位差很多却没有先缩放
- 不知道 k 时,需要尝试并评估多个 k
给歌曲自动分组
坐标可用“节奏速度、能量”。相近歌曲会形成几堆,之后可以做成不同风格的候选歌单。
发现顾客类型
坐标可用“每月购买次数、平均消费”。商店能先发现不同购物习惯,再研究服务方式。
压缩图片颜色
每个像素是一个颜色坐标。把相近颜色聚成 k 组,再用重心色代表整组,可以减少颜色数量。
把本章主线压缩成四句话
妈妈的屋顶菜园,水壶为什么总在搬家?
暑假的第一个热天,妈妈发现屋顶菜园的番茄和薄荷都耷拉着叶子。四个人原本只想赶快浇水,却从一次漏数开始,慢慢找到一种能让全部花盆参与、还能让两只水壶自己“找到队伍”的办法。

一片番茄叶,让米悦忘了数到哪里
妈妈用手指探了探土,给四盆最需要照顾的植物分别准备了 3、7、4、6 杯水。米悦抱着量杯从左往右走,到第三盆时,一片叶子挂住她的袖口。等她摘下叶子,已经想不起刚才浇过哪一盆。
“全部浇完”听起来只是一句话,真正做起来却包含四次不同的读取。漏掉一盆,叶子会继续发蔫;重复一盆,水又可能过多。

i 是手指点到的号码,不是那盆水
开米给四盆植物排好顺序,让米悦沿绳珠一次只走一格。当前号码叫 i,第 i 盆需要的水量叫 xᵢ。点到第二盆时,i=2;从记录里取出的却是 x₂=7 杯。
Σ 像一段不会分心的循环:下方写从哪里开始,上方写到哪里停止,右边写每一轮要取什么。米悦负责移动号码,妈妈递出这一盆的量杯,开米把量杯放进同一个总碗。

“每盆多两杯”,不能只让第一盆收到
太阳越来越高。妈妈再次摸土,发现每盆都需要多两杯。米悦在原来的 20 后面加了 2,准备让爸爸提 22 杯。爸爸摊开手,指向整排花盆。
开米把 Σ 展开后,米悦才看见:括号里的“+2”会跟着 i 走四轮。如果把 +2 写在 Σ 外面,它只在所有求和完成以后执行一次。
=(3+2)+(7+2)+(4+2)+(6+2)=28
原来四盆共需要 20 杯,这是总和;20÷4=5 杯,是原来平均每盆的水量。总和回答“合起来多少”,平均数回答“每盆大约多少”。

最近的一盆很满意,妈妈却还在来回走
总水量算清后,米悦把橙色水壶放在离自己最近的薄荷旁。薄荷当然很方便,妈妈照顾远处番茄时,却要一次次走回角落取水。
开米把每盆到水壶的距离平方当作这盆给出的损失。三盆示例的损失分别是 4、1、9;只看 1 分的那盆,会误以为位置已经很好。Σ 把三张评分全部收齐。
平均损失=14÷3≈4.67

没有花盆的空方砖,为什么反而最公平?
开米先选三盆做小实验:A=(2,2)、B=(4,2)、C=(3,5)。米悦一直想把水壶放在某一盆旁边,开米却让横坐标先平均一次,纵坐标再平均一次。
ȳ=(2+2+5)÷3=3
重心 G=(3,3)
(3,3) 是一块没有花盆的方砖,却代表三盆的平均位置。把水壶放在那里,这一组到水壶的距离平方和最小。重心不是“长得最像中心的那一盆”,而是每个坐标方向都让所有数据参与平均。

两只水壶没有队名,花盆先自己选近的
菜园里的花盆越来越多,一只水壶不够。妈妈拿出橙色水壶,爸爸拿出蓝色水壶。开米先把它们放在两个临时位置,没有提前规定哪盆属于哪一组。
每盆都比较自己到两只水壶的距离,米悦给更近的一边系上同色带。这样得到的组不是家人凭喜好命名,而是数据根据当前距离形成的。
这正是 k-means 适合解决的问题:数据很多,又没有现成标签,希望先看它们能否形成几堆自然靠近的群体。

水壶一搬家,边界花盆又改变了主意
分组只是第一步。妈妈和开米分别算出蓝组、橙组的平均坐标,再把两只水壶搬到各组重心。水壶一动,米悦发现一盆辣椒离另一只水壶更近,只好把彩带换色。
换组以后,两组的成员变了,平均位置也可能改变。于是全家再做一轮:按最近距离分组,再把中心搬到本组平均位置。
重复几轮后,彩带不再换色,两只水壶也几乎不动。k-means 不是一步猜中答案,而是用“最近+平均”的循环逐渐稳定。

重心算得很漂亮,妈妈的花坛却没有让路
分组终于稳定,爸爸按橙色中心推水车,却被抬高花坛挡住。地图里的直线可以穿过去,现实中的轮子只能沿通道绕行。米悦不明白:“我们不是已经算到最好了吗?”
妈妈用水管沿真实通道走了一遍,开米才发现:刚才交给算法的只有花盆坐标,没有矮墙、台阶和水车宽度。k-means 认真优化了收到的问题,却不可能自动看见没有写进数据的现实。
全家把聚类结果当作第一份安排,再在重心附近寻找能够到达的位置,并沿通道重新检查路程。妈妈终于能顺手取水,爸爸也少绕了许多趟。
i 按顺序点名,xᵢ 才是真数据;Σ 收齐全部再求平均。每个点先找最近中心,每个中心再搬到本组平均位置。
知识检测:选择后立即知道哪里没掌握
系统会保留“第一次选择”暴露出的薄弱点。即使后来改对,完成检测时仍会提醒你定向复习。