异构通灵
你以为专用加速器是银弹。百倍能效手到擒来。可每一颗银弹,只能打一种怪物——百倍能效的代价,是跑新算法的自由。
锁悬异构之门
异构通灵门前悬着一把锁——没有钥匙孔,因为锁本身就是钥匙。锁身由无数条凝固的数据流铸成,每一条只朝一个方向流动。锁面刻着一行字:"百倍能效,换取跑新算法的自由。"
「通用计算跑不动AI了。你听说了——专用加速器是银弹。」
「是银弹。只是每一颗银弹,只能打一种怪物。」
异构能效反直觉挑战器
五道算法剪影 → 逐一点亮验证 DSA 能否运行 → 锁账累积
搬运之税 · 冯诺依曼的枷锁
石径尽头是一台悬空的天平——左盘放"计算",右盘放"搬运"。天平严重歪斜:右盘压到底,左盘翘到天。
「32位浮点乘法,3.7皮焦。32位DRAM读取,640皮焦。你算一次,搬一次,搬运比计算贵170倍。」
「通用计算的税,不是算得慢——是搬得太贵。」
能量天平 · 搬运税分解
预测三选一 → CPU能量分解饼图 → GPGPU对照
脉动之阵 · 数据自己会走
墙上刻着一幅古老的阵列图——256行256列,65,536个方格,像一片沉默的棋盘。每个方格是一个处理单元(PE),只会做一件事:乘加。
「1978年,孔祥重和Leiserson提出脉动阵列。数据像血液一样流过阵列,每个PE接过上游的数据、算完、传给下游。不需要访存——数据在流动中完成计算。」
「很美。你搭一个试试。」
脉动阵列数据流探索器
搭建4×4阵列 → 切换数据流模式(WS/OS/RS) → 性能建模对比
专用之锁 · 百倍能效的代价
你的脉动阵列还在发光——92 TOPS,百倍于CPU。锁的声音从四面八方渗来:"现在,跑一个新东西。"面前浮出一道算法:一个自定义的稀疏注意力机制——不是标准矩阵乘法,数据流向完全不同。你把算法拖上阵列。数据流撞上硬编码的通道,堵死、溢出、崩溃。阵列表面崩出一道裂缝。
「百倍能效,你拿走了。跑新算法的自由,我收下了。」
专用之锁 · DSA不可编程性实验台
试跑三种非标准算法 → 阵列崩塌 → 利用率骤降
算子之核 · 万物皆GEMM
崩塌的阵列旁,墙上亮起一幅AI算子图谱。矩阵乘法在中央,放射状连接到卷积、注意力、全连接——一切箭头都指向同一个原点。
「你问DSA能算什么。答案是:AI几乎都是GEMM。Conv → im2col → GEMM。Attention → QKᵀ → softmax → ×V → GEMM。」
「领域够窄,专用才值得。要是万物皆是GEMM——那把锁也不算太紧,对吧?」
算子分解 · NPU架构拼装
拖算子进GEMM熔炉分解 → 拼装NPU组件 → 覆盖度统计
精度之渊 · 少即是多
深渊边立着一排精度标尺:FP32、FP16、BF16、INT8、FP8——从左到右,位数递减,刻度越来越粗。
「32位浮点乘法3.7皮焦,8位整数乘法只要0.2皮焦——差18倍。AI真的需要32位精度吗?」
「精度就是自由。你砍掉一位,就少一种可能。」
精度能效权衡旋钮台
精度旋钮(FP32→INT4) → 位布局重排 → 能效/准确率实时联动
存算之壁 · 搬不动的数据
面前是三扇门,每扇门后是一种打破内存墙的方法。第一扇门刻着"稀疏"——跳过零值,少搬数据。第二扇门刻着"存算一体"——干脆在存储器里计算,不搬了。第三扇门刻着"HBM"——把内存堆到芯片旁边,路走短点。
「三扇门,你自己选。」
「每一扇门后面,我都等着。」
存算之壁三路突围相图探索器
推开三扇门 → 各有限制 → 相图Roofline → 墙还在
性能之尺 · 标称不是现实
墙边立着一把巨大的标尺——刻度从0到1000 TOPS。你的DSA芯片标牌上写着"989 TOPS"(NVIDIA H100 FP8峰值)。诺依曼老祖:"跑一下你的模型。"你按下运行键。标尺指针爬到989……然后掉到450。再跑,掉到380。
「标称是梦。实际利用率,才是你醒来的闹钟。」
性能之尺 · 利用率测量台
运行三种模型测利用率 → TOPS分解 → 能效对比
群英殿 · 万器各有其道
殿内悬着三颗芯片的全息投影:TPU、NVIDIA H100、华为昇腾910。每颗芯片下方刻着不同的数据流图案——没有两颗是一样的。三颗投影间浮现一条光谱:最左端"完全通用"(CPU),最右端"完全专用"(ASIC),中间依次是GPU、FPGA、DSA。
「你看了这么多,有没有发现——没有一颗芯片什么都能跑。」
「你开始明白了。」
芯片光谱 · 集群拼装
三大芯片解剖 → 灵活性-能效光谱定位 → DGX集群拼装
Boss 战 · 灵活性之锁
殿门关闭。锁从门上脱落,悬浮在中央,放大十倍——锁身由凝固的数据流铸成,链环叮当作响。锁开口了,声音像金属摩擦:"你走了一路。百倍能效你见了,裂缝你也有了,标称TOPS的梦你也醒了。三问。答对了,锁开。答错了——链环多一圈。"
「三问。答对了,锁开。答错了——链环多一圈。」
渊账累计 0 笔 · 三问全对后清零
尾声 · 异构通灵
锁碎成满地光点。光点没有消散——它们重新排列成一张异构计算全景图。CPU在中心管控制流,GPU在左翼管并行计算,DSA在右翼管矩阵乘法,HBM在底部供血,NVLink/CXL在之间架桥。编译器像一层金色薄膜覆盖全局——PyTorch代码落下,经XLA/TVM编译,化为每颗芯片各自的最优内核。
「异构通灵。不是一颗芯片通吃——是万器归一。但——远处那道涟漪……那是后面的事。」
知识图谱点亮 · 编译器管线
点亮全章10块碎片 → 编译器管线演示 → 境界突破