SICI · 蕴灵宗 · 第十章 · 筑基收官

深度学习优化算法进阶 · 筑基五层

你以为训练就是堆层调参。可在融合之门,真正的战场在训练动力学里——优化器在鞍点搁浅、归一化层撕裂训练曲线、生成器在博弈里找到捷径。模式崩溃之蚀在暗处立赌:你训不出稳定的生成模型。

模式崩溃之蚀低语:「你觉得自己能训出一个稳定的生成模型?我赌你训不出。你的每一次失败,我都会记下来。」
序章

融合之门

生成之赌 · 训练日志剪影 · 方法论全景

融合之门的门楣上刻着八个字:万物可生,万物可崩。门内是一片悬浮的数据荒原——荒原上散落着无数碎片:有的在生成人脸,有的在写诗,有的碎片已碎成梯度噪声。高斯老祖站在门内,手里只有一块黑板,上面写着:深度学习没有免费午餐。荒原深处传来一万台GPU过载的嗡鸣。

词嵌入之谷,词语映射到向量空间
高斯老祖 高斯老祖

「你想生成万物。先搞清楚——生成万物到底难在哪里。荒原上四组训练日志,你猜哪一组训练最稳定?」

模式崩溃之蚀 模式崩溃之蚀

「又来了一个想生成万物的。打个赌——你觉得自己能训出稳定的生成模型?我赌你训不出。你的每一次失败,我都会记下来。」

生成之赌 · 训练日志预测挑战器

反直觉下注(四选一,可连错)→ 训练曲线展开 → 方法论全景图拼合

模式崩溃之蚀逼你下注:荒原上四组训练日志,哪一组训练最稳定?逐个点击。
第一幕 · 自信→崩塌 前奏

优化阵 · 收敛之路

SGD/Momentum/Adam/AdamW · Loss Landscape · 鞍点陷阱

数据通道尽头是一片三维 Loss Landscape——山峦起伏,沟壑纵横。高斯老祖递给你四枚令牌:SGD、Momentum、Adam、AdamW。「把它们丢进这片地形,看谁先走到谷底。」

高斯老祖 高斯老祖

「在高维空间里,让你卡住的几乎从不是局部最优——是鞍点。梯度为零的地方,有些方向上坡、有些下坡。Adam 的自适应学习率能帮你逃出鞍点,但逃出去之后,平坦和尖锐的谷底决定了你能不能泛化。」

模式崩溃之蚀 模式崩溃之蚀

「你肯定选 Adam。所有人都选 Adam——然后看着它在平坦极小值处反复震荡。」

优化器对决 · 四轨迹动画 + Loss Landscape 热区

四选一下注 → 四条轨迹同时动画 → 点击四个标注点(鞍点/局部最优/平坦/尖锐)

Loss Landscape · 四优化器轨迹

第一幕 · 自信→崩塌 前奏

正则殿 · 约束之道

L1/L2/标签平滑 · Mixup/CutMix/AutoAugment · 双 loss 曲线

正则殿的墙壁上挂着六面镜子,每面镜子里映着同一只猫——但每面镜子里的猫都不一样。有的猫被磨去轮廓(L1),有的被柔化纹理(L2),有的标签从"猫"变成"70%猫+30%狗"(标签平滑)。高斯老祖指着一面空镜:「把你的模型放进去,看看约束会把它变成什么。」

高斯老祖 高斯老祖

「L1 给你稀疏,L2 给你平滑,标签平滑给你谦逊。Mixup 和 CutMix 不是在增加数据,是在模糊决策边界。约束的代价是训练集表现,回报是真实世界的泛化。」

正则化实验台 · 三选 + 三混 + 双 loss 曲线

切换 L1/L2/标签平滑看权重直方图 → 切换 Mixup/CutMix/AutoAugment 看混合预览 → 拖滑块找折中点

权重约束 · 权重直方图

数据增强 · 混合预览

训练/验证 loss 双曲线 · 拖动约束强度

0.20
第一幕 · 第一崩塌

归一化渊 · 第一崩塌

BatchNorm 崩塌复现 · BN→LN→GN→RMSNorm · 场景匹配

门后是一个圆形深渊,渊壁嵌着四层石阶。渊底是你的训练台,loss 正稳定下降。高斯老祖突然把 batch_size 从 64 拖到了 2:「现在再看。」训练曲线像被人从中间撕开——loss 从 0.3 直接跳到 NaN。

高斯老祖 高斯老祖

「BatchNorm 归一化的是 batch——所以它怕小 batch。LayerNorm 归一化的是特征——所以它不怕 batch。你选的不是归一化方法,你选的是'在什么尺度上让分布稳定'的世界观。」

模式崩溃之蚀 模式崩溃之蚀

「你的 BN 在 batch=2 时,方差估计用的是两个样本。两个样本的方差,你觉得可靠吗?第一笔账,我记下了。」

归一化渊 · 崩塌复现 + 四层石阶 + 场景匹配

拖 batch_size 看曲线断裂 → 踏四层石阶 → 四种归一化匹配四种场景

BatchNorm 崩塌复现 · batch_size 滑块

64

四层石阶 · BN/LN/GN/RMSNorm

场景匹配 · 拖归一化到对应场景

第二幕 · 挣扎→再崩塌 前奏

自监督阁 · 无标注之力

Pretext Task · SimCLR 对比学习 · MoCo 队列

通道尽头是一座没有标签的阁楼,堆满了无标注图片。高斯老祖指着这堆图片:「标签不是力量。结构才是。你能不能从这些图片里,自己造出监督信号?」

高斯老祖 高斯老祖

「Pretext task 是自己给自己出题。对比学习跳过了出题,直接定义目标:同一张图的不同视图应该相似,不同图的视图应该不同。SimCLR 用大 batch 装负样本,MoCo 用队列装负样本。」

自监督实验台 · Pretext + 对比学习 + MoCo 队列

三选 Pretext Task → 拖正负样本对看 NT-Xent 损失 → 拖队列大小看表征质量

Pretext Task 三选

对比学习潜空间 · 正负样本对

MoCo 队列 · 动量编码器

4096
第二幕 · 挣扎→再崩塌 前奏

变分渊 · 潜空间之门

重参数化技巧 · ELBO 推导 · β-VAE 旋钮

光门后是一片星空——每颗星不是点,而是一团概率云。高斯老祖递给你编码器和解码器:「把真实样本喂进编码器,它给你一团云——均值和方差。从云里采样,喂给解码器重建。」你照做了,但采样这一步,梯度传不过去。

高斯老祖 高斯老祖

「重参数化不是数学技巧——它把'从分布采样'拆成'从标准分布采样+确定性变换',让随机性从梯度路径上搬走。ELBO 是 log 似然的下界,最大化 ELBO 就是在最大化'模型生成真实数据的概率'。」

VAE 实验台 · 重参数化 + ELBO 推导 + β-VAE

直接采样 vs 重参数化对比 → ELBO 五步填空 → 拖 β 看重建/结构权衡

重参数化计算图 · 梯度连通

ELBO 五步推导

β-VAE 旋钮 · 重建 vs 结构

β=1.0
第二幕 · 挣扎→再崩塌 前奏

对抗阵 · 博弈之局

Minimax 博弈 · DCGAN/WGAN/StyleGAN · JS 散度陷阱

镜子碎裂,碎片重组为一片棋盘——两端各坐着一个棋手。左边是生成器 G,握着噪声;右边是判别器 D,握着真实样本。高斯老祖:「G 的目标是骗过 D,D 的目标是分辨真假。这就是 GAN。」模式崩溃之蚀的声音变得兴奋:「博弈开始了。博弈里,捷径总是存在的。」

高斯老祖 高斯老祖

「GAN 不是在最小化距离,是在玩零和博弈。JS 散度在分布不重叠时梯度为零——这就是生成器卡死的数学原因。WGAN 把 JS 换成 Wasserstein 距离,即使分布不重叠也有有意义的梯度。」

对抗阵 · 博弈天平 + 三变体 + JS 陷阱

拖 G/D 力量滑块看天平 → 切换 DCGAN/WGAN/StyleGAN 看 JS vs Wasserstein 梯度

博弈天平 · G/D 力量滑块

GAN 变体切换 · DCGAN/WGAN/StyleGAN

第二幕 · 第二崩塌

坍缩深渊 · 第二崩塌

模式崩溃复现 · 根因诊断 · 博弈天平终态

棋盘碎裂,你跌入深渊。深渊中央是你的 GAN 训练台——一开始生成多样:人脸、风景、动物、建筑。然后人脸越来越多,风景越来越少。最后,无论你喂什么噪声,生成器只输出同一张图。模式崩溃之蚀的声音变成清晰的语言:

模式崩溃之蚀 模式崩溃之蚀

「你以为对抗训练能生成多样样本。但你的生成器找到了欺骗判别器的捷径——只生成一种样本。多样性从未被写进你的目标函数。第二笔账,我记下了。」

高斯老祖 高斯老祖

「模式崩溃不是训练失败——它是训练的'成功'。生成器完美最小化了 loss,只不过不是你期望的方式。捷径即最优解——这是博弈论的预言。」

模式崩溃诊断器 · 复现 + 根因 + 天平终态

拖训练进度条看多样性下降 → 展开目标函数看根因 → 看天平完全倾斜

模式崩溃复现 · 训练进度条

epoch 1
第三幕 · 顿悟→突破 前奏

蒸馏殿 · 师徒传承

知识蒸馏温度 T · 量化/剪枝/蒸馏 · Boss 武器锻造

联结窄廊尽头是一间教室,坐着庞大的教师模型和瘦小的学生模型。教师输出层 T=1,softmax 尖锐。高斯老祖:「把温度调高。」你把 T 拖到 10,教师的 softmax 变软——"猫 70%,狗 20%,汽车 5%"。高斯老祖:「那些非猫的概率,就是暗知识。它告诉学生:猫和狗长得像,猫和汽车不像。hard label 里没有这些。」

高斯老祖 高斯老祖

「知识不等于参数。一个 90% 压缩的模型可保留 95% 性能——知识存在于参数之间的关系中。如果你能蒸馏一个稳定的预训练大模型,你就不需要从头训练不稳定的 GAN。」

蒸馏实验台 · 温度 T + 压缩三路径 + 武器锻造

拖温度 T 看 softmax 软化 → 切换量化/剪枝/蒸馏 → 蒸馏+WGAN 联合训练曲线

温度 T 蒸馏 · softmax 软化

T=1
0.50

压缩三路径 · 量化/剪枝/蒸馏

第三幕 · 最高潮

Boss 战 · 模式崩溃之蚀

三问对决 · 蚀账清算 · 排除刻痕收网

深渊中央,模式崩溃之蚀完整现身——它不是人形,是一张无限重复的同一张脸,千面千面俱是同一面。它翻开一本账册:「你来了。带着你的两道刻痕,和你的蚀账。三问。答对,我消散。答错,你的筑基修为归零。」

模式崩溃之蚀 模式崩溃之蚀

「你说你的生成器背叛了你——它没有背叛,它只是找到了最优解。证明给我看:为什么模式崩溃是博弈论的必然?你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。」

蚀账累计 0 笔 · 三问全对后清零

第三幕 · 收束 · 筑基收官

归一之巅 · 筑基收官

三道工程墙 · 方法论全景 · 境界突破 筑基→结丹

深渊之上,你站在山顶。山脚是你走过的路——优化阵、正则殿、归一化渊、自监督阁、变分渊、对抗阵、坍缩深渊、蒸馏殿。山顶放着一台巨大的训练集群,几百张 GPU 连在一起。高斯老祖:「你想训练更大的模型。面前有三道墙:显存、通信、稳定性。」

高斯老祖 高斯老祖

「训练大型模型不是算法问题,是工程问题。梯度检查点省显存但慢 30%,混合精度省显存但有精度风险,ZeRO 省显存但通信增加——你选的不是'最好的方案',是'最适合你约束的方案'。这就是深度学习方法论的全部:没有免费午餐,只有显式权衡。筑基五层,深度融合——你已圆满。但金丹之路的第一块基石,不在算力,在数据。」

筑基收官 · 三道墙 + 方法论全景 + 境界突破

突破显存/通信/稳定性三道墙 → 点亮方法论全景 → 境界突破动画(筑基→结丹)

三道工程墙 · 各三选一