SICI · 蕴灵宗 · 第十五章 · 结丹收官

多模态大模型 · 结丹五层

你以为多模态就是给大模型加双眼睛。可在模态之壁前,真正的战场在模态之间——像素活在连续高维空间,token 活在离散序列空间,它们的维度不同、结构不同、信息密度不同。模态鸿沟在裂缝里立赌:你以为对齐就是拼接,我赌你拼不出真正懂图的话。

模态鸿沟低语:「你觉得编码后拼起来就行?随便猜。你说它们怎么对齐的?」
序章

万象之门

对齐之赌 · 核心挑战四选 · 多模态全景

万象之门的门楣上刻着八个字:万物可感,万象须归。门内是一面巨壁——壁的左侧浮着一幅图:一只猫蹲在月光下的屋顶;壁的右侧浮着一句话:"一只猫蹲在月光下的屋顶。"它们说的是同一件事,可壁面横着一道裂缝,深不见底。高斯老祖站在裂缝边,手里只有一块黑板,上面写着:对齐不是拼接。

蒸馏之鼎,大模型知识蒸馏到小模型
高斯老祖 高斯老祖

「左边是像素,右边是 token。你站在裂缝上——告诉我,多模态学习最核心的挑战是什么?先猜,猜错了也没关系,模态鸿沟会记账。」

模态鸿沟 模态鸿沟

「又来了一个想对齐万物的。打个赌——你觉得多模态最难的是什么?你每猜错一次,裂缝深一分,我都记下来。」

对齐之赌 · 多模态核心挑战预测挑战器

反直觉下注(四选一,可连错)→ 挑战展开 → 多模态全景图拼合

模态鸿沟逼你下注:多模态学习最核心的挑战是什么?逐个点击。
第一幕 · 自信→崩塌 前奏

模态之异 · 视觉与语言

连续像素 vs 离散 token · 表征空间差异 · 维度鸿沟

裂缝尽头是一片双面镜——左镜映着一只猫的像素矩阵,224×224×3 共 15 万个连续浮点;右镜映着同一句话的 token 序列,"一只猫蹲在月光下的屋顶" 不过 11 个离散整数。高斯老祖递给你两枚透镜:「透过左镜看,世界是连续的;透过右镜看,世界是离散的。把它们放在一起,你猜会发生什么?」

高斯老祖 高斯老祖

「图像是连续的高维张量,每个像素都承载空间结构;文本是离散的符号序列,每个 token 承载语义结构。它们的维度不同、粒度不同、信息密度不同——这就是模态鸿沟的物理根源。直接拼接它们,就像把温度计的读数和一首诗的字数加在一起。」

模态鸿沟 模态鸿沟

「你肯定觉得编码一下就行。所有人都是这么想的——然后把 768 维视觉特征和 4096 维语言特征拼在一起,期待模型自己学会对话。」

模态差异对比器 · 像素空间 vs token 空间

切换视觉/语言模态看表征空间 → 拖拼接滑块看信息损失 → 点亮维度鸿沟热区

视觉模态 · 连续像素空间

语言模态 · 离散 token 序列

直接拼接 · 信息损失可视化

对齐度 0.50
第一幕 · 自信→崩塌 前奏

CLIP · 对比学习对齐

InfoNCE 损失 · 温度参数 τ · 零样本分类

双面镜碎裂,碎片重组为一片悬空深渊——渊底浮着无数成对光点,每个光点是一对图文。高斯老祖指着渊底:「CLIP 做的事,就是把这些光点排列——匹配的拉近,不匹配的推远。你亲手排一次。」

高斯老祖 高斯老祖

「对比学习跳过了标注,直接定义目标:匹配的图文对在嵌入空间应该相近,不匹配的应该相远。InfoNCE 损失用 softmax 把'拉近正样本、推远负样本'写成一个统一的交叉熵。温度 τ 控制分布的锐度——τ 太小训练不稳,太大对齐信号消失。」

模态鸿沟 模态鸿沟

「拉近?你以为拉近了就懂了?拉近的是距离,不是理解。先排给我看。」

CLIP 对比学习实验台 · 沙盘 + 温度 + 零样本

拖图文光点看 InfoNCE 损失 → 拖温度 τ 看分布锐度 → 零样本分类测试

对比学习沙盘 · 图文光点 + 实时损失

温度参数 τ · softmax 锐度

τ=0.07

零样本分类 · CLIP 的魔法

第一幕 · 第一崩塌

第一崩塌 · 模态鸿沟

直接拼接复现 · 鸿沟现身 · 投影层之伤

渊底裂开,你跌入一道深不见底的裂缝。裂缝中央是你的多模态训练台——你把视觉编码器的 768 维输出和语言模型的 4096 维隐藏状态直接拼接,喂进一个线性层。你问模型:"图里有几只猫?"模型回答:"今天的天气很好。"高斯老祖沉默了。裂缝里传来一个不带温度的声音:

模态鸿沟 模态鸿沟

「你只是把它们拼在一起,它们根本没在对话。768 维的视觉特征和 4096 维的语言特征活在两个世界里——你的线性层不过是在做有损压缩,把一个世界压扁塞进另一个。第一笔账,我记下了。」

高斯老祖 高斯老祖

「拼接不是对齐。你需要一个投影层——但它本身就是有损的。维度不等、粒度不等、信息密度不等,任何线性投影都是一种有损压缩。鸿沟不会消失,只会被不断跨越。」

模态鸿沟 · 拼接崩塌复现 + 投影层诊断

拖训练步数看拼接失败 → 展开投影层信息损失 → 鸿沟裂缝可视化

直接拼接崩塌复现 · 训练步数

step 1
第二幕 · 挣扎→再崩塌 前奏

视觉语言模型 · 从 CLIP 到 LLaVA

视觉编码器 + 投影层 + LLM · 视觉 token · 指令微调

裂缝之上是一座塔。塔分三层:底层是视觉编码器(CLIP ViT),把图像切成 patch 编码成视觉 token;中层是投影层,把视觉 token 映射到语言空间;顶层是大语言模型,把视觉 token 和文本 token 拼在一起推理。高斯老祖:「这就是 LLaVA 的架构——视觉编码器当眼睛,投影层当翻译,LLM 当大脑。」

高斯老祖 高斯老祖

「LLaVA 的关键不在编码器,在投影层——它把视觉特征翻译成 LLM 能懂的 token。训练分两阶段:第一阶段用图文对齐齐投影层,第二阶段用视觉指令数据微调整条链路。投影层越小,翻译越快但越粗糙;越大,翻译越细但越慢。」

多模态 LLM 架构器 · 三层塔 + 视觉 token + 指令微调

点击三层塔看数据流 → 拖 patch 大小看视觉 token 数 → 两阶段训练曲线

LLaVA 架构 · 视觉编码器 / 投影层 / LLM

视觉 token 化 · patch 大小旋钮

patch=32 → 49 tokens

两阶段训练 · 对齐 + 指令微调

第二幕 · 挣扎→再崩塌 前奏

扩散模型 · 从噪声到图像

前向加噪 · 反向去噪 · DDPM 去噪步数

塔后是一座熔炉。炉口不断吐出纯噪声——雪花般的乱码像素。高斯老祖递给你一个去噪器:「扩散模型做两件事:前向把图像一步步加噪变成纯噪声,反向从纯噪声一步步去噪还原成图像。你拖动步数,看噪声怎么退去。」

高斯老祖 高斯老祖

「前向过程是确定的——按调度逐步加高斯噪声,T 步后变纯噪声。反向过程是学习出来的——模型学会每一步预测噪声并减去它。去噪步数越多,生成质量越好但越慢;步数太少,噪声残留严重。DDIM 把 1000 步压到 50 步还能保持质量。」

扩散去噪可视化器 · 前向加噪 + 反向去噪 + 步数控

拖前向步数看图像变噪声 → 拖反向步数看噪声还原图像 → 质量评估

前向加噪 · 图像 → 纯噪声

t=0 (清晰)

反向去噪 · 纯噪声 → 图像

步数=1

生成质量 vs 去噪步数

第二幕 · 挣扎→再崩塌 前奏

跨模态对齐 · 嵌入空间统一

2D 嵌入分布 · 对齐前后变化 · 移动轨迹

熔炉后是一片星空——每颗星是一个嵌入点,玫红的是图像,金色的是文本。训练前,两类点各聚一堆,中间隔着深沟。高斯老祖:「对齐训练就是让匹配的图文点靠近。你点开始训练,看它们怎么移动。」

高斯老祖 高斯老祖

「对齐不是一次映射,是持续校准。每一轮训练,匹配的图文点靠近一点,不匹配的推远一点。你会看到玫红和金色的点逐渐交织——但永远不会完全重合。因为对齐是有损的,鸿沟只会被缩小,不会消失。」

嵌入空间可视化器 · 对齐前后 + 移动轨迹

点开始训练看嵌入点移动 → 切换对齐前/后 → 拖训练轮次看渐进

2D 嵌入空间 · 视觉(玫红) + 语言(金)

epoch 0
第二幕 · 第二崩塌

第二崩塌 · 多模态幻觉

幻觉复现 · 与纯文本幻觉之别 · 信息不对称

星空碎裂,你跌入一面镜子迷宫。镜子里映着同一张图——一个人站在海边。你问模型:"图里有几个人?"模型回答:"图里有两个人,一个大人牵着一个小孩。"但图里只有一个人。高斯老祖:「这不是普通的幻觉——这是多模态幻觉。模型不是在瞎编,它是在用语言的先验填补视觉的空白。」

模态鸿沟 模态鸿沟

「你以为对齐了就不会幻觉?你把图像翻译成了 token,但翻译是有损的——丢掉的细节,模型用语言的常识补上了。海边通常有人,人通常有小孩——它不是在骗你,它是在'合理猜测'。第二笔账,我记下了。」

高斯老祖 高斯老祖

「多模态幻觉与纯文本幻觉的区别:纯文本幻觉是模型编造它不知道的;多模态幻觉是模型'看到'了图里没有的东西。根源是信息不对称——视觉编码器丢了细节,语言模型用先验补全。对齐越粗糙,幻觉越严重。」

多模态幻觉诊断器 · 复现 + 对比 + 根因

拖对齐精度看幻觉频次 → 对比纯文本幻觉 → 展开信息不对称根因

幻觉复现 · 对齐精度滑块

对齐精度 80%
第三幕 · 顿悟→突破 前奏

语音与视频 · 超越图文

Whisper 语音 · 视频时间维度 · NeRF 3D 理解

镜子迷宫尽头是一片广场,悬浮着三道光门。第一道门里是声波——Whisper 把语音转成文字;第二道门里是视频帧序列——时间维度让对齐从空间扩展到时空;第三道门里是 3D 场景——NeRF 从 2D 图片重建三维世界。高斯老祖:「图文只是开始。语音是时间的,视频是时空的,3D 是空间的——每多一个维度,鸿沟就深一丈。」

高斯老祖 高斯老祖

「Whisper 用多任务训练把语音识别、翻译、语言识别统一。视频理解的关键是时间维度——不仅要对齐每帧的空间,还要对齐帧间的时间。NeRF 用神经网络学一个三维辐射场,从任意视角渲染——它把2D图片升维成3D世界。每一步都在跨越新的鸿沟。」

多模态扩展展示器 · 语音 + 视频 + 3D

切换三道光门看架构 → 拖时间轴看视频帧 → 切换视角看 NeRF

第三幕 · 最高潮

Boss 战 · 模态鸿沟

万象三问 · 鸿账清算 · 排除刻痕收网

广场尽头浓雾重新合拢,温度骤降——模态鸿沟凝聚成形。它不是人形,是一道横亘像素空间与 token 空间之间的裂缝,裂缝里映着无数错位的图文。它翻开一本账册:「你来了。带着你的两道刻痕,和你的鸿账。三问。答对,我弥合。答错,你的结丹修为归零。」

模态鸿沟 模态鸿沟

「你说对齐就是映射——它不是。我住在你'以为对齐就是映射'的地方。你每以为对齐做完了,我就深了一丈。证明给我看:你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。」

鸿账累计 0 笔 · 三问全对后清零

第三幕 · 收束 · 结丹收官

顿悟 · 万象归一

知识图谱点亮 · 多模态方法论 · 境界突破 结丹→元婴

裂缝弥合,你站在山顶。山脚是你走过的路——模态之异、CLIP 对齐、模态鸿沟、视觉语言模型、扩散模型、嵌入统一、多模态幻觉、语音视频。山顶放着一面万象镜,镜中映着所有模态交织成的知识图谱。高斯老祖:「你想理解万物。面前有三道认知:对齐不是映射、生成是对噪声的雕刻、幻觉是信息不对称的代价。」

高斯老祖 高斯老祖

「多模态学习的全部,是让不同模态在共享语义空间里持续校准。对齐是有损的投影,生成是噪声的雕刻,幻觉是投影损失的代价。没有完美的对齐,只有不断的校准。结丹五层,万象归一——你已圆满。但元婴之路的第一块基石,不在对齐,在多智能体。」

万象归一 · 三道认知 + 知识图谱 + 境界突破

点亮三道认知 → 点亮多模态知识图谱 → 境界突破动画(结丹→元婴)

三道认知 · 各三选一