预训练成丹
你以为炼丹就是堆参数堆算力。可在炼丹之门,真正的炉火是数据——海量语料里藏着世界的影子。过拟合之雾潜伏在小数据集的角落,专收"训练loss下降但验证loss反弹"的缝隙。BERT 用掩码偷看左右,GPT 用因果只看左侧,Chinchilla 告诉你数据与参数的最优比是 20:1。
炼丹之门
炼丹之门的门楣上刻着八个字:万物可炼,万物可崩。门内是一座巨大的炼丹炉,炉膛里燃烧的不是木柴,是流动的语料——网页、书籍、代码、对话,亿万 token 在炉中翻滚。高斯老祖站在炉前,手里只有一块黑板,上面写着:预训练 = 用海量无标注数据,炼出世界知识的金丹。炉火深处传来一万张 GPU 过载的嗡鸣。
「你想炼一颗通用的金丹。先搞清楚——预训练里最重要的因素到底是什么。四个选项,你下注。」
「又来了一个想炼丹的。打个赌——你觉得预训练最重要的是模型架构、数据质量、计算量、还是随机种子?我赌你猜错。你的每一次过拟合,我都会记下来。」
预训练之赌 · 因素预测挑战器
反直觉下注(四选一,可连错)→ 因素展开 → 预训练-微调范式全景图拼合
预训练-微调范式全景 · 炼丹流水线
范式殿 · 从专用到通用
范式殿的两侧各立着一面巨镜。左镜里映着传统炼丹:每个任务一座小炉,从零点火,只烧这一味药——炼完即弃,下次重来。右镜里映着预训练炼丹:一座大炉先烧尽天下语料,炼出一颗通用金丹,再把金丹分给千千万万个小炉,每座小炉只需微调几缕火候。高斯老祖指着右镜:「这就是范式革命——把'学任务'变成'学世界'。」
「传统范式每个任务从零训练,数据利用率低、迁移能力为零。预训练范式先在海量无标注语料上学通用表征,再在小标注数据上微调——一次预训练,服务千任务。这就是'世界知识'的炼法:把语料的统计规律蒸馏成参数。」
范式对比器 · 传统 vs 预训练+微调
切换范式看数据流 → 对比训练曲线 → 三维度指标权衡
传统单任务训练
预训练 + 微调
训练曲线对比 · 从零 vs 预训练初始化
掩码阁 · BERT 双向注意力
掩码阁的墙上挂着一句话,其中一个字被金光遮住:「炼丹之法,[MASK]在其中。」高斯老祖递给你一支掩码笔:「把任意一个字遮住,看 BERT 能不能从左右两边同时推断出它是什么。」你遮住"炉"字——BERT 同时看到左边的"炼丹之法"和右边的"在其中",给出的预测是"炉"。
「BERT 是 Bidirectional Encoder Representations from Transformers。它的杀手锏是 MLM——随机掩码 15% 的 token,让模型从左右上下文同时预测被掩码的词。双向注意力让每个 token 都能'偷看'整句话,这是它理解能力的根源。」
MLM 实验台 · 掩码语言模型
点击任意词掩码 → BERT 双向注意力可视化 → 候选词概率分布
输入句子 · 点击任意词进行掩码
双向注意力热力图 · [MASK] 同时看左右
过拟合渊 · 第一崩塌
掩码阁后是一片灰雾弥漫的深渊。你把一座小炉点着,喂进一小批语料,开始预训练。训练 loss 稳定下降——0.8、0.5、0.3、0.1。你正要欢呼,高斯老祖却指着验证集的曲线:「看这条。」验证 loss 在 0.4 处触底,然后开始反弹——0.5、0.7、1.2。灰雾从渊底升起,凝成过拟合之雾的轮廓。
「训练 loss 下降而验证 loss 上升,就是过拟合。你的模型在小数据上把训练集的每个样本都背下来了——它不是在学世界的规律,是在背题。数据不够,参数再大也只是更强的记忆力,不是更强的理解力。」
「你的模型把训练集背得滚瓜烂熟,可一遇到新题就露馅。第一笔雾账,我记下了——你的金丹是空的,里面装的是记忆,不是知识。」
过拟合渊 · 小数据预训练复现 + 根因诊断
拖数据量滑块看 loss 分叉 → 展开根因 → 雾账记录
小数据预训练复现 · 数据量滑块
15M tokens根因诊断 · 目标函数展开
自回归阵 · GPT 因果生成
过拟合渊后是一片棋盘,棋盘上的字从左到右依次落下。高斯老祖递给你一枚起手令:「给 GPT 一个开头,它一个字一个字往下续。」你写下"炼丹之法",GPT 接着吐出"在于"、"积累"、"火候"——每个字都只看它左边的字,绝不偷看右边。这就是因果掩码。
「GPT 是 Generative Pre-trained Transformer。它的杀手锏是自回归——从左到右逐 token 预测下一个。因果掩码让每个位置只能看到左侧,这是它能生成的根本:生成时未来尚未存在,自然不能偷看。代价是它理解单句不如 BERT,但能生成是它的王权。」
自回归生成器 · GPT 逐 token 生成 + 注意力对比
输入提示词 → GPT 逐 token 生成动画 → 因果掩码 vs BERT 双向对比
提示词 · GPT 从此续写
生成输出 · 逐 token 落子
注意力对比 · BERT 双向 vs GPT 因果
分词殿 · 词元切割术
分词殿中央悬着一把刻刀,殿内三座石碑各刻一种切法。高斯老祖把一句话"pretraining is alchemy"投到刻刀下,刻刀落下——BPE 切成"pre/train/ing/is/alche/my",WordPiece 切成"pre/##train/##ing/is/alche/##my",Unigram 切成"pretrain/ing/is/alchemy"。同一句话,三种切法,token 数不同,词表不同。
「分词器是模型与文本的接口。BPE 从字符出发贪心合并高频对,WordPiece 类似但用似然选择,Unigram 用概率模型反向选词表。词表太小则序列太长、训练慢;词表太大则稀疏、多语言不友好。词表大小是预训练的第一个工程权衡。」
分词器实验台 · BPE / WordPiece / Unigram 对比
输入文本 → 三种分词并列对比 → 拖词表大小看切分变化
输入文本 · 实时分词
三种分词法对比
词表大小滑块 · 影响 token 数与覆盖率
30000规模殿 · Scaling Laws 规模法则
规模殿的穹顶上刻着三条曲线——模型规模、数据量、计算量,每一条都随着 x 轴增长而下降,下降的形状是幂律。高斯老祖指着三条曲线的交点:「这就是 Chinchilla 最优点——在固定算力下,数据量与参数量的最优比约 20:1。违背这个比例,要么数据不够过拟合,要么参数不够欠拟合。」
「Scaling Laws 说 loss 随规模幂律下降——这是炼丹的物理定律。Chinchilla 进一步告诉你:多数大模型'参数过剩、数据不足'。一个 70B 的模型,最优训练数据量约 1.4T tokens。在此之前,业界普遍只用了 1/20 的数据,却堆了 20 倍的参数——浪费。」
Scaling Laws 曲线追踪器 · 幂律 + Chinchilla 最优比
Canvas 三条幂律曲线 → 滑块调参数/数据 → Chinchilla 最优比判定
Scaling Laws · 模型/数据/计算 vs Loss
参数量
70B数据量
0.8T tokensChinchilla 最优比判定
涌现崖 · 第二崩塌
规模殿后是一道悬崖。悬崖这边,小模型的曲线平坦如死水——无论怎么训练,某些任务准确率都在 0% 附近。悬崖那边,大模型的曲线在某一个规模点突然跃升——0% 直接跳到 60%。这不是平滑上升,是相变。高斯老祖的声音从崖底传来:「这就是涌现——能力不是渐变的,是突变的。」
「你以为规模法则能预测一切。可涌现能力偏偏不服从幂律——小模型完全做不到,大模型突然就会了。你猜不到阈值在哪里。第二笔雾账,我记下了——你的预测在涌现面前失效。」
「涌现是规模法则的'断点'。某些能力(多步推理、指令遵循、代码生成)在小模型上几乎为零,越过某个参数/数据阈值后突然出现。我们至今无法精确预测阈值——这是预训练最大的谜,也是最大的赌注。」
涌现之谜 · 能力相变复现 + 阈值不可测
拖规模滑块看能力跃变 → 切换任务看不同阈值 → 诊断不可预测性
涌现能力复现 · 模型规模滑块
2B炼丹炉 · 预训练基础设施
悬崖之后是一座真正的炼丹炉——但这座炉子由上千张 GPU 串联而成,炉壁上刻着三行字:显存、通信、稳定性。高斯老祖递给你一块算盘:「选个参数量——7B、13B、还是 70B?我帮你算算要多少张卡、烧多久、花多少钱。」
「炼大模型不是算法问题,是工程问题。7B 模型用 8 张 A100 训两周,70B 模型要 256 张 A100 训两个月。混合精度把显存砍半,梯度累积用小 batch 模拟大 batch,ZeRO 把优化器状态切片到多卡——每一项技术都在'显存、通信、稳定性'三角里权衡。你选的不是最好的方案,是算得起的方案。」
训练配置计算器 · GPU / 时间 / 成本
选参数量 7B/13B/70B → 算 GPU 数/训练时间/成本 → 切换训练技术看节省
模型参数量选择
训练资源估算 · GPU / 时间 / 成本
训练技术切换 · 看显存/速度节省
Boss 战 · 预训练三问
炼丹炉之上,过拟合之雾完整现身——它不是人形,是一团无限翻涌的灰绿雾气,雾里反复回放着同一段训练曲线:loss 下降,验证 loss 反弹,循环往复。它翻开一本雾账:「你来了。带着你的两道刻痕,和你的雾账。三问。答对,我消散。答错,你的结丹修为归零。」
「你说你的模型在背题——它没有错,它只是把训练集记住了。证明给我看:你真的懂预训练了吗?Chinchilla 告诉你什么?BERT 和 GPT 差在哪?涌现为什么测不准?你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。」
雾账累计 0 笔 · 三问全对后清零
顿悟 · 预训练即炼丹
雾散之后,你站在炼丹炉顶。山脚是你走过的路——范式殿、掩码阁、过拟合渊、自回归阵、分词殿、规模殿、涌现崖、炼丹炉。炉顶放着一颗刚炼成的金丹,金丹表面流动着 token、注意力、幂律曲线。高斯老祖:「这颗金丹不是参数,是世界知识的影子。你炼的不是模型,是语料里的规律。」
「预训练范式的全部,就是一句:用海量无标注数据,把世界的统计规律蒸馏成参数。数据是炉火,参数是丹炉,算力是薪柴,架构是丹方。Chinchilla 给你配比,Scaling Laws 给你物理定律,涌现给你赌注,工程给你可行性。结丹二层·预训成丹——你已圆满。但金丹要化为器用,还差最后一步:微调与对齐。」
顿悟 · 预训练刻文 + 知识图谱 + 境界突破
点亮预训练刻文 → 知识图谱点亮 → 境界突破动画(结丹二层圆满)