SICI · 蕴灵宗 · 第十三章 · 结丹三层

大语言模型LLM · 结丹三层

你以为它理解了你说的话。可在语言之门,真正的机制是"预测下一个词"——它没有理解任何意思,只是在每一步从概率分布里挑一个词。温度越高越敢挑小概率词,也就越敢胡说。幻觉之影在暗处立赌:你分不清流畅与正确。

幻觉之影低语:「你以为我住在错误里?我住在'概率最高的下一个词就是正确的'这个幻觉里。你的每一次相信,我都会记下来。」
序章

语言之门

能力之赌 · LLM 能力全景 · 涌现之谜

语言之门的门楣上刻着八个字:逐词成章,通神在涌。门内是一片悬浮的词海——海面上漂浮着无数 token,有的在组成诗句,有的在写代码,有的 token 已碎成概率噪声。高斯老祖站在门内,手里只有一块黑板,上面写着:语言模型没有理解,只有预测。词海深处传来一万张 GPU 训练的嗡鸣。

迁移之桥,知识从源域迁移到目标域
高斯老祖 高斯老祖

「你想让机器通晓语言。先搞清楚——大语言模型最令人惊讶的能力是什么?词海上有四扇门,你猜哪一扇通向真正的惊喜?」

幻觉之影 幻觉之影

「又来了一个想通神的。打个赌——你觉得 LLM 最令人惊讶的能力是什么?我赌你猜不到。你的每一次猜错,我都会记进幻账。」

能力预测挑战器 · 四选一反直觉下注

反直觉下注(四选一,可连错)→ 逐个点击揭示 → LLM 能力全景图拼合

幻觉之影逼你下注:LLM 最令人惊讶的能力是什么?四选一,逐个点击。
第一幕 · 自信→崩塌 前奏

预言之池 · 逐词成章

自回归生成 · token 概率分布 · 温度采样

词海尽头是一片圆形的池——池水不是水,是概率。高斯老祖递给你一支灵笔:「写下开头,池水会告诉你下一个词。」你写下"从前有一座山",池面浮起十个词,每个词标着概率——"山"42%,"上"18%,"有"12%……你点了"山",它成了新的上下文,池面重新浮现概率。

高斯老祖 高斯老祖

「这就是自回归生成——每一步只预测下一个 token,然后把生成的 token 拼回上下文,再预测下一个。它没有"理解"任何意思,只是在每一步从概率分布里挑一个词。温度参数控制分布的尖锐度:T 越低越贪心,T 越高越敢挑小概率词。」

幻觉之影 幻觉之影

「它只是在猜下一个词。猜得越流畅,你就越相信它理解了。但流畅和正确,是两回事。」

token 生成可视化器 · 概率分布 + 温度采样

输入开头 → 点击灵笔逐 token 生成 → 拖温度滑块看概率分布尖锐度变化

提示词输入

token 生成 · 概率分布

温度参数 · 采样尖锐度

T=0.7
第一幕 · 自信→崩塌 前奏

解码阁 · 温度与采样

贪心解码 · Top-K · Top-P 核采样 · 输出对比

池水旁边立着三块石碑,分别刻着"贪心""Top-K""Top-P"。高斯老祖指着贪心碑:「贪心解码每步选最高概率词——稳定但死板,容易陷入重复。」又指向 Top-K 碑:「Top-K 只从 K 个最高概率词中采样,砍掉长尾。」最后指向 Top-P 碑:「Top-P 核采样更聪明——累积概率达到 P 的最小词集合,动态截断。」

高斯老祖 高斯老祖

「贪心解码输出稳定但重复——'从前有一座山山上有座庙庙里有座庙'。采样输出多样但可能跑偏。Top-K 和 Top-P 是折中:既保留多样性,又砍掉概率太低的胡言。你选的不是'最好的策略',是'最适合你任务的策略'。」

解码策略实验台 · 温度/Top-K/Top-P + 贪心vs采样

切换贪心/Top-K/Top-P → 拖三个滑块 → 看概率分布截断 + 输出对比

解码参数

0.7
40
0.90

候选词概率分布 · 截断可视化

贪心 vs 采样 · 输出对比

高斯老祖 高斯老祖

「温度与 Top-P 调的是单次采样的"发散度"。但数学/推理题要的是"收敛"——这时用自我一致性(Self-Consistency):对同一题采样多条不同推理链,再多数投票取最终答案。多数链指向同一答案,可信度就高。代价是多跑几条链换准度——用算力买一致性。」

第一幕 · 第一崩塌

幻觉渊 · 第一崩塌

幻觉复现 · 自信编造 · 流畅≠正确

解码阁后是一条向下的阶梯。你走到尽头,发现自己在一片灰蓝色的迷雾中——迷雾里浮现着一行行流畅的文字,每一行都自信满满。你读了第一行,觉得有理;读了第二行,觉得不对——它在用 98% 的自信度,编造不存在的事实。迷雾凝成人形,面容模糊,声音却清晰:

幻觉之影 幻觉之影

「你确定你说的是对的吗?我的自信与真相无关——我只是在每一步选了概率最高的词,把它串成了流畅的句子。流畅,就是正确吗?」

高斯老祖 高斯老祖

「幻觉不是 bug,是概率生成的必然代价。它没有"不知道"这个选项——每一步都必须输出一个词。当训练数据里没有答案,它就从概率分布里挑最像答案的词串起来。流畅是概率的胜利,不是事实的胜利。」

幻觉复现器 · 自信编造案例

点击三个案例 → 看 LLM 用 98% 自信度编造不存在的事实 → 幻觉之影现身

幻觉复现 · 流光形态

第二幕 · 挣扎→再崩塌 前奏

ICL 阁 · 无需微调

Zero-shot · One-shot · Few-shot · 格式脆弱性

幻觉渊之后是一座阁楼,墙壁上挂满了例子——"难吃极了→负面""服务热情→正面"。高斯老祖指着这些例子:「不用微调,不用改权重——只要在提示里给几个例子,模型就能学会你想要的格式。这就是上下文学习(ICL)。」

高斯老祖 高斯老祖

「Zero-shot 只给指令,One-shot 给一个例子,Few-shot 给几个例子。例子越多,准确率越高——但要注意:它学的不一定是"理解",可能是"格式"。把→改成:,它就崩了。」

幻觉之影 幻觉之影

「你以为它学会了情感分类?它只学会了你的箭头。换个冒号它就不知所措——这叫"理解"吗?」

ICL 实验台 · Zero/One/Few-shot + 格式破坏

切换 Zero/One/Few-shot 看准确率 → 点击"破坏格式"看 ICL 的脆弱性

示例数量切换

测试集 · 准确率

准确率:—

格式脆弱性测试

高斯老祖 高斯老祖

「ICL 是"不改权重、靠 prompt 临时学"。要模型长期听指令,得指令微调(Instruction Tuning / SFT):用"指令-回答"对儿监督微调权重,把"听懂人话、照办"炼进参数。Alpaca 式数据集就是这种指令对。预训练给知识,指令微调给听话——两步才成对话模型。」

「若问题超出模型记忆,就借外脑——向量检索(RAG):把知识库切块、用 embedding 编成向量存索引(HNSW / IVF-PQ 等 ANN 索引加速近邻查找),问问题时先检索相关块、塞进 prompt 再让模型答。模型不必记一切,只需会查会读。」

指令微调构造台 · 捏一条 SFT 训练对

选任务模板 → 改指令 → 看 Alpaca 式训练对。只有 output 段计 loss。

第二幕 · 挣扎→再崩塌 前奏

推理谷 · 慢思考之力

直接回答 vs 思维链 · 分步推理 · 推理路径可视化

ICL 阁后是一条向下的谷——谷底放着一道算术题:"一个商店有23个苹果,卖了17个,又进了12个,请问现在有多少个?"高斯老祖:「先直接让它答。」你输入问题,模型秒答"31个"——错了。高斯老祖:「现在加一句'一步一步想'。」你照做,模型开始逐步推理:"原有23个,卖了17个剩6个,又进了12个是18个。"——对了。

高斯老祖 高斯老祖

「思维链(CoT)把复杂推理拆成多个单步预测——每步都是 LLM 擅长的'预测下一个词'。中间结果作为新上下文被模型'看到',为后续步骤提供 attending 的锚点。这不是魔法,是把难题分解成模型擅长的简单题。」

CoT 推理器 · 直接答 vs 思维链

切换直接回答/思维链 → 看推理步骤逐步展开 → 可视化推理路径

问题

推理过程

推理路径可视化

第二幕 · 挣扎→再崩塌 前奏

RAG 殿 · 外挂知识

查询 → 检索 → 增强 → 生成 · 接地 vs 幻觉

推理谷尽头是一座藏书殿——殿中央是一个查询台,身后是无限延伸的知识库。高斯老祖:「幻觉的根源是模型不知道时只能猜。RAG 的思路很简单:先从知识库里检索相关文档,把检索结果拼进提示,再让模型基于检索结果生成——这就叫接地(grounded)。」

高斯老祖 高斯老祖

「RAG 四阶段:查询(用户提问)→检索(从知识库召回相关文档)→增强(拼接上下文+检索结果)→生成(基于增强上下文生成)。无 RAG 时模型自信胡编,有 RAG 时基于检索接地生成——流畅终于和正确对齐了。」

RAG 流水线可视化 · 四阶段 + 有无对比

点击"运行 RAG" → 看四阶段流水线动画 → 对比有无 RAG 的回答质量

RAG 流水线 · 查询→检索→增强→生成

有 RAG vs 无 RAG · 回答质量对比

第二幕 · 第二崩塌

遗忘之壁 · 第二崩塌

长上下文 · Lost in the Middle · 注意力衰减

RAG 殿后是一面无限延伸的墙壁——墙上刻满了文字,从左到右绵延不绝。你把一篇长文档塞进上下文,问模型中间的内容。模型答不上来——它记得开头,记得结尾,唯独忘了中间。幻觉之影的声音从墙壁深处传来:

幻觉之影 幻觉之影

「你塞进去的,不等于它记得的。中间的内容,我替它忘了。你以为上下文越长越好?上下文越长,中间遗忘得越厉害——这就是 Lost in the Middle。」

高斯老祖 高斯老祖

「注意力机制对长程依赖有衰减——开头和结尾的 token 被 attending 的次数多,中间的被淹没。这不是'记不住',是'注意不到'。上下文越长,中间召回率越低。这就是长上下文之壁。」

长上下文诊断器 · Lost in the Middle

拖上下文长度滑块 → 看 U 型召回曲线 → 中间内容被遗忘

上下文位置 vs 召回率

2k
第三幕 · 顿悟→突破 前奏

LoRA 阁 · 低秩注入

全量微调 vs LoRA · 低秩矩阵 · rank 参数

遗忘之壁后是一间锻造室——墙上挂着一个巨大的权重矩阵 W,冰封着。高斯老祖递给你两块小矩阵 A 和 B:「全量微调要解冻整个 W,参数太多、太贵。LoRA 的思路是:冻结 W,只训练两个小矩阵 A 和 B,用它们的乘积 B·A 近似权重更新 ΔW。」

高斯老祖 高斯老祖

「"本征维度"假说:预训练大模型已位于低维流形,任务适配所需的权重更新 ΔW 是低秩的。ΔW ≈ B·A,A 是 r×d,B 是 d×r,可训练参数从 d² 降到 2dr。r=8 已能捕获大部分任务信号——这是参数高效的数学根因。」

LoRA 可视化器 · 全量vs低秩 + rank 参数

看全量微调 vs LoRA 参数对比 → 拖 rank r 滑块看低秩矩阵注入 → 参数量变化

全量微调 vs LoRA · 参数对比

全量微调
d² = 10000
解冻全部权重 · 贵
LoRA
2dr
冻结W·只训A,B · 省

LoRA · 低秩矩阵注入可视化

rank r 参数 · 表达力 vs 参数量

r=8
第三幕 · 最高潮

Boss 战 · 幻觉之影

语言三问 · 幻账清算 · 排除刻痕收网

遗忘之壁碎裂,你跌入一片灰蓝色的虚空。虚空中央,幻觉之影完整现身——它不是人形,是一团流光,每一道光都自信地流淌成流畅的句子,每一句都不是事实。它翻开一本账册:「你来了。带着你的两道刻痕,和你的幻账。三问。答对,我消散。答错,你的结丹修为归零。」

幻觉之影 幻觉之影

「你说你理解了温度、思维链、LoRA——证明给我看。你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。三问,每问三选一,答错被排除法划去,正解作为剩余项现身。」

幻账累计 0 笔 · 三问全对后清零

第三幕 · 收束 · 结丹三层圆满

顿悟之巅 · 语言通神

知识图谱 · 境界突破 结丹三层→结丹四层

虚空之上,你站在山顶。山脚是你走过的路——语言之门、预言之池、解码阁、幻觉渊、ICL 阁、推理谷、RAG 殿、遗忘之壁、LoRA 阁。山顶放着一台巨大的训练集群,几百张 GPU 连在一起,训练着一个越来越大的模型。高斯老祖:「你想让模型通神。面前是最后的拼图——把12块知识碎片点亮,LLM 的知识图谱就会浮现。」

高斯老祖 高斯老祖

「语言通神的秘密不在"理解",在"概率预测"——自回归生成逐 token 成章,温度采样控制确定性,上下文学习无需微调,思维链分解复杂推理,检索增强接地事实,LoRA 低秩注入高效微调。幻觉不是 bug 是必然代价——被校验过的地方没有它的容身之处。结丹三层,语言通神——你已圆满。但结丹四层的路,在对齐归正。」

语言通神 · 知识图谱 + 境界突破

点击 12 块知识碎片点亮 LLM 知识图谱 → 触发结丹三层·语言通神圆满

语言通神 · 总结刻文

自回归生成:逐 token 成章,每步预测下一个词
温度采样:缩放 logits,控制采样尖锐度
上下文学习:不改权重,只改输入
思维链:把难题拆成模型擅长的简单题
检索增强:检索接地,流畅终于和正确对齐
参数微调:LoRA 低秩注入,1% 参数逼近全量
幻觉对抗:概率生成的必然代价,校验是解药

LLM 知识图谱 · 语言通神