深度融合
你以为训练就是堆层调参。可在融合之门,真正的战场在训练动力学里——优化器在鞍点搁浅、归一化层撕裂训练曲线、生成器在博弈里找到捷径。模式崩溃之蚀在暗处立赌:你训不出稳定的生成模型。
融合之门
融合之门的门楣上刻着八个字:万物可生,万物可崩。门内是一片悬浮的数据荒原——荒原上散落着无数碎片:有的在生成人脸,有的在写诗,有的碎片已碎成梯度噪声。高斯老祖站在门内,手里只有一块黑板,上面写着:深度学习没有免费午餐。荒原深处传来一万台GPU过载的嗡鸣。
「你想生成万物。先搞清楚——生成万物到底难在哪里。荒原上四组训练日志,你猜哪一组训练最稳定?」
「又来了一个想生成万物的。打个赌——你觉得自己能训出稳定的生成模型?我赌你训不出。你的每一次失败,我都会记下来。」
生成之赌 · 训练日志预测挑战器
反直觉下注(四选一,可连错)→ 训练曲线展开 → 方法论全景图拼合
深度学习方法论全景 · trade-off
优化阵 · 收敛之路
数据通道尽头是一片三维 Loss Landscape——山峦起伏,沟壑纵横。高斯老祖递给你四枚令牌:SGD、Momentum、Adam、AdamW。「把它们丢进这片地形,看谁先走到谷底。」
「在高维空间里,让你卡住的几乎从不是局部最优——是鞍点。梯度为零的地方,有些方向上坡、有些下坡。Adam 的自适应学习率能帮你逃出鞍点,但逃出去之后,平坦和尖锐的谷底决定了你能不能泛化。」
「你肯定选 Adam。所有人都选 Adam——然后看着它在平坦极小值处反复震荡。」
优化器对决 · 四轨迹动画 + Loss Landscape 热区
四选一下注 → 四条轨迹同时动画 → 点击四个标注点(鞍点/局部最优/平坦/尖锐)
Loss Landscape · 四优化器轨迹
正则殿 · 约束之道
正则殿的墙壁上挂着六面镜子,每面镜子里映着同一只猫——但每面镜子里的猫都不一样。有的猫被磨去轮廓(L1),有的被柔化纹理(L2),有的标签从"猫"变成"70%猫+30%狗"(标签平滑)。高斯老祖指着一面空镜:「把你的模型放进去,看看约束会把它变成什么。」
「L1 给你稀疏,L2 给你平滑,标签平滑给你谦逊。Mixup 和 CutMix 不是在增加数据,是在模糊决策边界。约束的代价是训练集表现,回报是真实世界的泛化。」
正则化实验台 · 三选 + 三混 + 双 loss 曲线
切换 L1/L2/标签平滑看权重直方图 → 切换 Mixup/CutMix/AutoAugment 看混合预览 → 拖滑块找折中点
权重约束 · 权重直方图
数据增强 · 混合预览
训练/验证 loss 双曲线 · 拖动约束强度
归一化渊 · 第一崩塌
门后是一个圆形深渊,渊壁嵌着四层石阶。渊底是你的训练台,loss 正稳定下降。高斯老祖突然把 batch_size 从 64 拖到了 2:「现在再看。」训练曲线像被人从中间撕开——loss 从 0.3 直接跳到 NaN。
「BatchNorm 归一化的是 batch——所以它怕小 batch。LayerNorm 归一化的是特征——所以它不怕 batch。你选的不是归一化方法,你选的是'在什么尺度上让分布稳定'的世界观。」
「你的 BN 在 batch=2 时,方差估计用的是两个样本。两个样本的方差,你觉得可靠吗?第一笔账,我记下了。」
归一化渊 · 崩塌复现 + 四层石阶 + 场景匹配
拖 batch_size 看曲线断裂 → 踏四层石阶 → 四种归一化匹配四种场景
BatchNorm 崩塌复现 · batch_size 滑块
64四层石阶 · BN/LN/GN/RMSNorm
场景匹配 · 拖归一化到对应场景
自监督阁 · 无标注之力
通道尽头是一座没有标签的阁楼,堆满了无标注图片。高斯老祖指着这堆图片:「标签不是力量。结构才是。你能不能从这些图片里,自己造出监督信号?」
「Pretext task 是自己给自己出题。对比学习跳过了出题,直接定义目标:同一张图的不同视图应该相似,不同图的视图应该不同。SimCLR 用大 batch 装负样本,MoCo 用队列装负样本。」
自监督实验台 · Pretext + 对比学习 + MoCo 队列
三选 Pretext Task → 拖正负样本对看 NT-Xent 损失 → 拖队列大小看表征质量
Pretext Task 三选
对比学习潜空间 · 正负样本对
MoCo 队列 · 动量编码器
4096变分渊 · 潜空间之门
光门后是一片星空——每颗星不是点,而是一团概率云。高斯老祖递给你编码器和解码器:「把真实样本喂进编码器,它给你一团云——均值和方差。从云里采样,喂给解码器重建。」你照做了,但采样这一步,梯度传不过去。
「重参数化不是数学技巧——它把'从分布采样'拆成'从标准分布采样+确定性变换',让随机性从梯度路径上搬走。ELBO 是 log 似然的下界,最大化 ELBO 就是在最大化'模型生成真实数据的概率'。」
VAE 实验台 · 重参数化 + ELBO 推导 + β-VAE
直接采样 vs 重参数化对比 → ELBO 五步填空 → 拖 β 看重建/结构权衡
重参数化计算图 · 梯度连通
ELBO 五步推导
β-VAE 旋钮 · 重建 vs 结构
β=1.0对抗阵 · 博弈之局
镜子碎裂,碎片重组为一片棋盘——两端各坐着一个棋手。左边是生成器 G,握着噪声;右边是判别器 D,握着真实样本。高斯老祖:「G 的目标是骗过 D,D 的目标是分辨真假。这就是 GAN。」模式崩溃之蚀的声音变得兴奋:「博弈开始了。博弈里,捷径总是存在的。」
「GAN 不是在最小化距离,是在玩零和博弈。JS 散度在分布不重叠时梯度为零——这就是生成器卡死的数学原因。WGAN 把 JS 换成 Wasserstein 距离,即使分布不重叠也有有意义的梯度。」
对抗阵 · 博弈天平 + 三变体 + JS 陷阱
拖 G/D 力量滑块看天平 → 切换 DCGAN/WGAN/StyleGAN 看 JS vs Wasserstein 梯度
博弈天平 · G/D 力量滑块
GAN 变体切换 · DCGAN/WGAN/StyleGAN
坍缩深渊 · 第二崩塌
棋盘碎裂,你跌入深渊。深渊中央是你的 GAN 训练台——一开始生成多样:人脸、风景、动物、建筑。然后人脸越来越多,风景越来越少。最后,无论你喂什么噪声,生成器只输出同一张图。模式崩溃之蚀的声音变成清晰的语言:
「你以为对抗训练能生成多样样本。但你的生成器找到了欺骗判别器的捷径——只生成一种样本。多样性从未被写进你的目标函数。第二笔账,我记下了。」
「模式崩溃不是训练失败——它是训练的'成功'。生成器完美最小化了 loss,只不过不是你期望的方式。捷径即最优解——这是博弈论的预言。」
模式崩溃诊断器 · 复现 + 根因 + 天平终态
拖训练进度条看多样性下降 → 展开目标函数看根因 → 看天平完全倾斜
模式崩溃复现 · 训练进度条
epoch 1根因诊断 · 目标函数展开
博弈天平终态 · 完全倾斜
蒸馏殿 · 师徒传承
联结窄廊尽头是一间教室,坐着庞大的教师模型和瘦小的学生模型。教师输出层 T=1,softmax 尖锐。高斯老祖:「把温度调高。」你把 T 拖到 10,教师的 softmax 变软——"猫 70%,狗 20%,汽车 5%"。高斯老祖:「那些非猫的概率,就是暗知识。它告诉学生:猫和狗长得像,猫和汽车不像。hard label 里没有这些。」
「知识不等于参数。一个 90% 压缩的模型可保留 95% 性能——知识存在于参数之间的关系中。如果你能蒸馏一个稳定的预训练大模型,你就不需要从头训练不稳定的 GAN。」
蒸馏实验台 · 温度 T + 压缩三路径 + 武器锻造
拖温度 T 看 softmax 软化 → 切换量化/剪枝/蒸馏 → 蒸馏+WGAN 联合训练曲线
温度 T 蒸馏 · softmax 软化
T=1压缩三路径 · 量化/剪枝/蒸馏
Boss 武器锻造 · 蒸馏+WGAN 联合训练曲线
Boss 战 · 模式崩溃之蚀
深渊中央,模式崩溃之蚀完整现身——它不是人形,是一张无限重复的同一张脸,千面千面俱是同一面。它翻开一本账册:「你来了。带着你的两道刻痕,和你的蚀账。三问。答对,我消散。答错,你的筑基修为归零。」
「你说你的生成器背叛了你——它没有背叛,它只是找到了最优解。证明给我看:为什么模式崩溃是博弈论的必然?你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。」
蚀账累计 0 笔 · 三问全对后清零
归一之巅 · 筑基收官
深渊之上,你站在山顶。山脚是你走过的路——优化阵、正则殿、归一化渊、自监督阁、变分渊、对抗阵、坍缩深渊、蒸馏殿。山顶放着一台巨大的训练集群,几百张 GPU 连在一起。高斯老祖:「你想训练更大的模型。面前有三道墙:显存、通信、稳定性。」
「训练大型模型不是算法问题,是工程问题。梯度检查点省显存但慢 30%,混合精度省显存但有精度风险,ZeRO 省显存但通信增加——你选的不是'最好的方案',是'最适合你约束的方案'。这就是深度学习方法论的全部:没有免费午餐,只有显式权衡。筑基五层,深度融合——你已圆满。但金丹之路的第一块基石,不在算力,在数据。」
筑基收官 · 三道墙 + 方法论全景 + 境界突破
突破显存/通信/稳定性三道墙 → 点亮方法论全景 → 境界突破动画(筑基→结丹)