感知初现
你以为训练集上100%准确就是好模型——但它让模型在测试集上崩溃。记住的不是模式,是数据本身。
模式之门
模式之门前的雾是紫色的,比别处更暗。门楣上"感知"二字被影子咬掉了一半。石阶上飘着五面光屏——每一面都在吞吐数据,像活的。门楣底座刻着一行小字:此门之后,不再有人写规则。规则,从数据里长出来。
「这是机器学习——让程序从经验E中,针对任务T,用度量P衡量,性能随E提升。这五面屏,哪一面是死规矩写死的?猜错一笔,影记一笔。」
「打个赌吧。这五面屏里,总有一面是死规矩写死的——猜猜,是哪面?猜错一笔,我记一笔。账记满了,到 S9 一起算。」
机器学习依赖预测挑战器
反直觉下注(五选一)→ 每点一次露出真实模型架构 → 机器学习文明图谱拼合
机器学习文明图谱
时间轴暗流 · ML 发展简史
训灵坛 · 百分百的诱惑
光径尽头是一座悬空石坛,坛上摆着一摞带标签的数据石片——左边标着"猫/狗",右边标着房价数字。贝叶斯先师站在坛边,过拟合之影在你耳边轻笑。
「左边标签离散——分类。右边标签连续——回归。两者都需要带标签的数据,这叫监督学习。挑一摞,训一个模型出来。」
「训练集嘛,往死里贴就对了。贴到100%,你就毕业了。100%,多完美。」
训灵坛 · 范式抉择 + 复杂度滑块 + 本命灵模成型
选分类/回归 → 拖复杂度滑块 → 训练集准确率爬到100% → 本命灵模成型
万象阁 · 特征与暗流
阁里悬着两面碑:一面刻"特征工程",一面刻"无监督"。过拟合之影递来一筐特征石——多加点,特征越多,它记得越牢,分数越高。
「特征工程是你替模型把数据看清楚的手艺——标准化、独热编码、构造新特征。无监督学习连标签都不给你,让模型自己找结构:聚类、降维、密度估计。」
「多加点。特征越多,它记得越牢。记得越牢,分数越高。」
万象阁 · 特征工程三步 + 无监督三范式暗室
标准化→独热→多项式 → 本命灵模紫光增强 → 无监督三范式各亮一灯
特征工程台
无监督暗室 · 三范式
试炼场 · 测试集的耳光
试炼场中央立着一座天平,左边写着"训练集",右边写着"测试集"——从未见过的新数据。你把本命灵模放上训练盘——指针稳稳压在100%。你得意地把它推向测试盘——指针猛地一沉,停在62%。
「100%?那是它背下来的。新题一上来,原形毕露。」
「100%不是完美,是它把训练集背下来了——这叫过拟合。点开诊断,看它到底错在哪。」
试炼场 · 训练/测试天平 + 混淆矩阵 + 四指标
拖模型切换训练/测试盘 → 100%→62%断崖 → 混淆矩阵样本归位 → 四指标实时计算
混淆矩阵 · 把测试样本归位
假设殿 · 没有免费的午餐
殿中央悬着一个巨大的函数空间球——里面密密麻麻全是曲线,每一条都是一个"假设"。球上刻着一句话:没有免费的午餐。
「模型能表示的所有函数,组成它的假设空间。你的本命灵模假设空间太大——大到能把训练集每个点都穿过去,当然100%。没有免费午餐:平均而言,在所有可能的问题上,没有任何一个学习算法比另一个更好。要泛化,你必须先有假设——这叫归纳偏置。」
「找个万能模型?不存在的。数学上不存在。」
假设殿 · 假设空间球 + NFL五模型对比 + 强化学习迷宫
拖复杂度看假设空间膨胀 → 五模型NFL对比 → 迷宫试错学策略
假设空间球 · 复杂度调节
没有免费午餐 · 五模型对比
强化学习迷宫 · 探索 vs 利用
诊断台 · 偏差与方差的拉锯
诊断台上摆着一架天平,左盘刻"偏差Bias",右盘刻"方差Variance",中间悬着"不可约误差"。欠拟合之残在偏差盘的阴影里一闪而过,低语:另一种死法——连训练集都学不会。
「任何模型的期望误差,都能拆成三份:偏差的平方、方差、和老天爷定的噪声。过拟合,是方差那盘太重;欠拟合,是偏差那盘太重。」
诊断台 · 学习曲线 + 偏差-方差五步推导 + 本命灵模验算
拖样本数看双线分叉 → 五步分解拖块 → 本命灵模旧伤复发换样重测
学习曲线 · 训练误差 vs 验证误差
偏差-方差分解 · 五步推导
本命灵模验算 · 旧伤复发
折折磨室 · 交叉验证的徒劳
磨室中央是一台巨大的切割机,能把数据石片切成K份。你切了5折,转完5圈,验证准确率稳定在60–64%。你松了口气。过拟合之影冷笑:稳了?它只是把同一个过拟合切成了5份,每份都一样烂。
「K折交叉验证:把数据切成K份,每次留1份当验证、其余K-1份训练,转K圈取平均。它能让你的评估更稳——但它不改变模型本身。」
「交叉验证是尺,不是药。你量出它病了,可你治了吗?」
折折磨室 · K-fold切割 + 留一法 + 分层对比 + CV前后对照
切K份转K圈 → 留一法计算量爆炸 → 分层vs普通对比 → CV前后都是62%
K-fold 切割旋转
分层采样对比 · 不平衡数据(猫90/狗10)
真相暴击 · CV前后对照
正则之泉 · 惩罚的智慧
泉边立着两把锁:一把刻"L1",一把刻"L2"。过拟合之影第一次退了一步:惩罚我?你惩罚的是记忆。没有记忆,你算什么?
「正则化就是在损失函数后面加一项惩罚。L1加的是|w|的和,会把不重要的权重直接压成0,顺带做特征选择;L2加的是w²的和,把权重都缩小、磨平,但不归零。调λ——惩罚的力度。太小锁不住,太大锁死。」
「惩罚我?你惩罚的是记忆。没有记忆,你算什么?」
正则之泉 · L1/L2双锁 + λ滑块 + 记忆之痕消退
选L1/L2锁 → 拖λ滑块 → 权重归零/磨平 → 伤痕消退测试爬到88%
评估殿 · 完整的审判
评估殿立着两面审判碑:左面刻"分类",右面刻"回归"。过拟合之影在殿角低语:指标。又是指标。你量来量去,敢不敢把它真的扔进未知的世界?
「准确率会骗你——样本不平衡时,全猜多数类都有90%。ROC曲线画的是不同阈值下真阳率对假阳率的权衡,AUC是曲线下面积,1.0完美、0.5等于瞎猜。回归用MSE/RMSE/MAE/R²,各管一摊。」
评估殿 · ROC阈值绘制 + AUC计算 + 回归四指标台
拖决策阈值画ROC → AUC实时跳动 → 切回归算MSE/RMSE/MAE/R²
Boss 战 · 过拟合之影
殿门砰然合拢。紫色浓影从四面八方涌来,在空中凝成一张脸——和你本命灵模的轮廓一模一样,只是布满记忆之痕。过拟合之影:我不住在你的错误里——错误救不了我。我住在你"训练集上100%准确就是好模型"的幻觉里。
「三问。答得清,我散;答不清,你留在100%的幻觉里,永远。我在每一处都欠了我的账——现在,一笔笔还。」
拟合债累计 0 笔 · 三问全对后清零
尾声 · 流水之门
影散尽时数据光径重新亮起,你手里的本命灵模微微发紫——记忆之痕还在,像一枚没说出口的印章。高斯老祖手一挥,全章的环节自动连成一条流水线。
「你入门了。不是因为你答对了三问——答对的会忘。是因为你摔过的每一跤,都刻在模型上了。这叫ML pipeline——数据收集→预处理→特征工程→训练→评估→部署。少一环,整条线就转不动。可特征还得你亲手喂——什么时候它能自己学?下一座山,叫深度学习。」
流水之门 · ML pipeline六环组装 + 知识图谱 + 境界突破
拖六环到正确顺序 → 流水线贯通 → 点亮知识图谱 → 境界突破