SICI · 天机门 · 第二十四章

异构计算与AI加速架构 · 化神二层

你以为专用加速器是银弹。百倍能效手到擒来。可每一颗银弹,只能打一种怪物——百倍能效的代价,是跑新算法的自由。

灵活性之锁低语:「百倍能效,换取跑新算法的自由。赌一局。」
序章

锁悬异构之门

专用加速器是银弹吗?五道算法,哪样DSA跑不了?

异构通灵门前悬着一把锁——没有钥匙孔,因为锁本身就是钥匙。锁身由无数条凝固的数据流铸成,每一条只朝一个方向流动。锁面刻着一行字:"百倍能效,换取跑新算法的自由。"

异构之锁,异构计算
诺依曼老祖 诺依曼老祖

「通用计算跑不动AI了。你听说了——专用加速器是银弹。」

灵活性之锁 灵活性之锁

「是银弹。只是每一颗银弹,只能打一种怪物。」

异构能效反直觉挑战器

五道算法剪影 → 逐一点亮验证 DSA 能否运行 → 锁账累积

锁赌你找不出一个DSA跑不了的算法。逐一点亮五道算法剪影。
第一幕 · 自信→动摇

搬运之税 · 冯诺依曼的枷锁

搬运比计算贵170倍,数据搬运而非计算才是瓶颈

石径尽头是一台悬空的天平——左盘放"计算",右盘放"搬运"。天平严重歪斜:右盘压到底,左盘翘到天。

诺依曼老祖 诺依曼老祖

「32位浮点乘法,3.7皮焦。32位DRAM读取,640皮焦。你算一次,搬一次,搬运比计算贵170倍。」

灵活性之锁 灵活性之锁

「通用计算的税,不是算得慢——是搬得太贵。」

能量天平 · 搬运税分解

预测三选一 → CPU能量分解饼图 → GPGPU对照

CPU跑AI那么慢,是算力不够,还是别的原因?
第一幕 · 发现与狂喜

脉动之阵 · 数据自己会走

TPU脉动阵列原理,数据流模式WS/OS/RS,O(n) vs O(n³)

墙上刻着一幅古老的阵列图——256行256列,65,536个方格,像一片沉默的棋盘。每个方格是一个处理单元(PE),只会做一件事:乘加。

诺依曼老祖 诺依曼老祖

「1978年,孔祥重和Leiserson提出脉动阵列。数据像血液一样流过阵列,每个PE接过上游的数据、算完、传给下游。不需要访存——数据在流动中完成计算。」

灵活性之锁 灵活性之锁

「很美。你搭一个试试。」

脉动阵列数据流探索器

搭建4×4阵列 → 切换数据流模式(WS/OS/RS) → 性能建模对比

点击方格放置PE,搭建4×4脉动阵列
第一幕 · 第一崩塌

专用之锁 · 百倍能效的代价

DSA数据流硬编码不可更改,新算法无法映射,阵列崩裂

你的脉动阵列还在发光——92 TOPS,百倍于CPU。锁的声音从四面八方渗来:"现在,跑一个新东西。"面前浮出一道算法:一个自定义的稀疏注意力机制——不是标准矩阵乘法,数据流向完全不同。你把算法拖上阵列。数据流撞上硬编码的通道,堵死、溢出、崩溃。阵列表面崩出一道裂缝。

灵活性之锁 灵活性之锁

「百倍能效,你拿走了。跑新算法的自由,我收下了。」

专用之锁 · DSA不可编程性实验台

试跑三种非标准算法 → 阵列崩塌 → 利用率骤降

第二幕 · 挣扎→再崩塌

算子之核 · 万物皆GEMM

卷积im2col→GEMM,注意力QKᵀ→×V→GEMM,NPU矩阵加速引擎

崩塌的阵列旁,墙上亮起一幅AI算子图谱。矩阵乘法在中央,放射状连接到卷积、注意力、全连接——一切箭头都指向同一个原点。

诺依曼老祖 诺依曼老祖

「你问DSA能算什么。答案是:AI几乎都是GEMM。Conv → im2col → GEMM。Attention → QKᵀ → softmax → ×V → GEMM。」

灵活性之锁 灵活性之锁

「领域够窄,专用才值得。要是万物皆是GEMM——那把锁也不算太紧,对吧?」

算子分解 · NPU架构拼装

拖算子进GEMM熔炉分解 → 拼装NPU组件 → 覆盖度统计

第二幕 · 权衡与发现

精度之渊 · 少即是多

FP32/FP16/BF16/INT8/FP8格式定义与精度-能效权衡,BF16训练甜区,INT8推理甜区

深渊边立着一排精度标尺:FP32、FP16、BF16、INT8、FP8——从左到右,位数递减,刻度越来越粗。

诺依曼老祖 诺依曼老祖

「32位浮点乘法3.7皮焦,8位整数乘法只要0.2皮焦——差18倍。AI真的需要32位精度吗?」

灵活性之锁 灵活性之锁

「精度就是自由。你砍掉一位,就少一种可能。」

精度能效权衡旋钮台

精度旋钮(FP32→INT4) → 位布局重排 → 能效/准确率实时联动

精度格式
应用场景
能效 (相对FP32)
准确率
第二幕 · 第二崩塌

存算之壁 · 搬不动的数据

稀疏/CIM/HBM三路突围,每条路各有限制,内存墙不可绕过

面前是三扇门,每扇门后是一种打破内存墙的方法。第一扇门刻着"稀疏"——跳过零值,少搬数据。第二扇门刻着"存算一体"——干脆在存储器里计算,不搬了。第三扇门刻着"HBM"——把内存堆到芯片旁边,路走短点。

诺依曼老祖 诺依曼老祖

「三扇门,你自己选。」

灵活性之锁 灵活性之锁

「每一扇门后面,我都等着。」

存算之壁三路突围相图探索器

推开三扇门 → 各有限制 → 相图Roofline → 墙还在

第二幕 · 诊断与点醒

性能之尺 · 标称不是现实

TOPS/TOPS-W/利用率三大指标,本命DSA之伤确诊为灵活性之锁的物理指纹

墙边立着一把巨大的标尺——刻度从0到1000 TOPS。你的DSA芯片标牌上写着"989 TOPS"(NVIDIA H100 FP8峰值)。诺依曼老祖:"跑一下你的模型。"你按下运行键。标尺指针爬到989……然后掉到450。再跑,掉到380。

灵活性之锁 灵活性之锁

「标称是梦。实际利用率,才是你醒来的闹钟。」

性能之尺 · 利用率测量台

运行三种模型测利用率 → TOPS分解 → 能效对比

第三幕 · 顿悟→突破

群英殿 · 万器各有其道

TPU/NVIDIA/昇腾三大架构对比,灵活性-能效光谱定位,集群协同

殿内悬着三颗芯片的全息投影:TPU、NVIDIA H100、华为昇腾910。每颗芯片下方刻着不同的数据流图案——没有两颗是一样的。三颗投影间浮现一条光谱:最左端"完全通用"(CPU),最右端"完全专用"(ASIC),中间依次是GPU、FPGA、DSA。

诺依曼老祖 诺依曼老祖

「你看了这么多,有没有发现——没有一颗芯片什么都能跑。」

灵活性之锁 灵活性之锁

「你开始明白了。」

芯片光谱 · 集群拼装

三大芯片解剖 → 灵活性-能效光谱定位 → DGX集群拼装

第三幕 · 最高潮

Boss 战 · 灵活性之锁

三问对决 · 排除法收网 · 异构计算+编译器顿悟

殿门关闭。锁从门上脱落,悬浮在中央,放大十倍——锁身由凝固的数据流铸成,链环叮当作响。锁开口了,声音像金属摩擦:"你走了一路。百倍能效你见了,裂缝你也有了,标称TOPS的梦你也醒了。三问。答对了,锁开。答错了——链环多一圈。"

灵活性之锁 灵活性之锁

「三问。答对了,锁开。答错了——链环多一圈。」

渊账累计 0 笔 · 三问全对后清零

第三幕 · 收束

尾声 · 异构通灵

编译器管线演示 + 知识图谱拼合 + 境界突破——下一章:可重构计算

锁碎成满地光点。光点没有消散——它们重新排列成一张异构计算全景图。CPU在中心管控制流,GPU在左翼管并行计算,DSA在右翼管矩阵乘法,HBM在底部供血,NVLink/CXL在之间架桥。编译器像一层金色薄膜覆盖全局——PyTorch代码落下,经XLA/TVM编译,化为每颗芯片各自的最优内核。

诺依曼老祖 诺依曼老祖

「异构通灵。不是一颗芯片通吃——是万器归一。但——远处那道涟漪……那是后面的事。」

知识图谱点亮 · 编译器管线

点亮全章10块碎片 → 编译器管线演示 → 境界突破