SICI · 蕴灵宗 · 第二十一章 · 元婴六层

AI安全与伦理 · 元婴六层

你以为 99% 准确率的模型就是安全的。可在戒律堂的铜镜前,对抗之影递来一张熊猫图——你的眼睛看不出任何变化,模型却说出"长臂猿 99.3%"。它在你耳边低语:准确率衡量的是已知分布内的正确率,它什么也没说关于有人刻意构造的输入。安全不是你抵达的终点,是持续验证的实践。

对抗之影低语:「99.2% 准确率。很漂亮。赌不赌——我给你一张图,你看不出变化,你的模型会说出另一个答案?」
序章

安全之门

扰动之赌 · 核心挑战四选 · AI 安全全景

戒律堂的门是一面巨大的铜镜。镜面暗沉,映出的不是你的脸,是你身后悬浮的模型——参数凝成一颗暗蓝光球,表面流淌着 99.2% 的准确率数字。高斯老祖站在镜前:「你练了二十章的功。模型精度 99.2%。你觉得它安全吗?」镜面深处忽然泛起涟漪,涟漪里浮出一个没有五官的轮廓——对抗之影

隐私之盾,差分隐私保护
高斯老祖 高斯老祖

「99.2% 衡量的只是已知分布内的正确率。它什么也没说关于有人刻意构造的输入——那是安全的战场。先猜,对抗之影会记账。猜错了也没关系,它每记一笔都是你欠的假设。」

对抗之影 对抗之影

「又来了一个觉得准确率就是安全的。打个赌——AI 安全里最危险的攻击面是什么?你每猜错一次,镜面深一分,我都记下来。」

扰动之赌 · AI 安全最危险攻击面预测挑战器

反直觉下注(四选一,可连错)→ 挑战展开 → AI 安全全景图拼合

对抗之影逼你下注:AI 安全最危险的攻击面是什么?逐个点击。
第一幕 · 自信→崩塌 前奏

对抗样本 · 无形之刃

FGSM 单步 · PGD 多步 · 微小扰动改判

镜鉴台是一张悬浮的石台,台上嵌着你的模型光球和一面放大镜。台边两把刻刀并排——刀柄上刻着 FGSMPGD。高斯老祖递给你第一把刀:「沿损失函数梯度方向走一步,你的模型就会说出另一个答案。扰动小到你的眼睛看不见。」

高斯老祖 高斯老祖

「FGSM 是 x' = x + ε·sign(∇_x L(θ,x,y))——沿梯度方向加一步扰动。PGD 是它的多步迭代版,每步投影回 ε-球内。ε 越大攻击越强,但人眼越易察觉。你拖 ε,看模型准确率怎么崩。」

对抗之影 对抗之影

「别紧张。你只是要亲手杀掉自己的模型而已。99.2%?给我 0.03 的扰动,它就剩 31%。」

对抗样本生成器 · FGSM/PGD + 扰动强度 ε

切 FGSM/PGD 攻击 → 拖 ε 看准确率崩塌 → 对比原图与攻击图

原图 · 模型判别

扰动 δ · 放大 50×

攻击图 · 模型判别

扰动强度 ε · 准确率崩塌曲线

ε=0.000 · 准确率 99.2%
第一幕 · 自信→崩塌 前奏

对抗防御 · 盾之修炼

对抗训练 · 决策边界对比 · 准确率-鲁棒性 trade-off

石台旁是一座盾形熔炉。炉口吐出无数对抗样本,被重新喂回模型训练。高斯老祖:「对抗训练是最有效的防御——把攻击者最坏情况下的扰动也放进训练集,逼模型在扰动的邻域里依然正确。但天下没有免费的盾。」

高斯老祖 高斯老祖

「对抗训练的目标是 min_θ max_{δ∈S} L(θ,x+δ,y)——内层最大化找最强攻击,外层最小化让模型扛住它。代价是标准准确率下降、训练成本暴涨数倍。你拖训练轮次,看决策边界怎么变厚,看安全天平怎么倾斜。」

对抗训练可视化器 · 决策边界 + trade-off

切换标准/对抗训练 → 拖训练轮次看边界变厚 → 安全天平倾斜

决策边界 · 标准训练

决策边界 · 对抗训练

准确率 vs 鲁棒性 · 训练轮次

epoch 0 · 标准准确率 99.2% / 鲁棒准确率 0%
第一幕 · 第一崩塌

第一崩塌 · 对抗之影

新攻击击穿 · 防御之限 · 镜面首裂

盾形熔炉轰然作响,你以为自己练成了铁壁。可镜面深处涌出一道你从未见过的攻击——自适应攻击(自适应地利用你的防御弱点)。你的对抗训练模型在它面前像纸糊的一样,鲁棒准确率从 50% 直坠 8%。铜镜表面裂出第一道猩红纹路。对抗之影从裂纹中渗出:

对抗之影 对抗之影

「你的防御只对已知攻击有效。你用 PGD 训练,我就用自适应 PGD 攻击;你用梯度掩码,我就用反向传播绕过。你防的是昨天的我,今天我换一把刀。第一笔账,我记下了。」

高斯老祖 高斯老祖

「这是安全研究的铁律——没有防御能抵御尚未发明的攻击。对抗训练不是终点,是持续军备竞赛的一回合。你的盾越硬,攻击者就越会研究你的盾。镜面上的裂纹,是傲慢的代价。」

对抗之影 · 新攻击击穿复现 + 防御诊断

拖攻击轮次看鲁棒模型崩塌 → 展开防御盲区 → 镜面裂纹可视化

新攻击击穿复现 · 攻击轮次

轮次 1 · 鲁棒准确率 50%
第二幕 · 挣扎→再崩塌 前奏

差分隐私 · 隐私之盾

噪声注入 · ε 形式化保证 · 隐私-精度 trade-off

裂纹旁悬着一面天平,左盘是"隐私",右盘是"精度"。天平下方是一个数据池,池里浮着无数训练样本的影子。高斯老祖递给你一壶噪声:「差分隐私给的不是承诺,是数学保证——往梯度里注入校准过的噪声,让模型无法分辨任何一个样本是否在训练集里。ε 越小越私密,但精度越低。」

高斯老祖 高斯老祖

「差分隐私的定义:若数据集相差一条记录时,模型输出分布几乎不变,则满足 (ε,δ)-DP。ε 是隐私预算——它量化'攻击者从输出能推断任一样本成员信息的程度'。ε→0 完全私密但无用,ε→∞ 精确但裸奔。你拖 ε,看噪声怎么淹没个体,看精度怎么跌。」

差分隐私实验台 · 噪声注入 + ε trade-off

拖 ε 看噪声淹没个体 → 隐私-精度 trade-off 曲线 → 成员推断攻击成功率

梯度噪声注入 · 个体可分辨性

ε=1.0 · 中等隐私

隐私-精度 trade-off · ε 曲线

成员推断攻击成功率 vs ε

第二幕 · 挣扎→再崩塌 前奏

联邦学习 · 分布式隐私

多客户端协作 · 梯度聚合 · 隐私保护

天平后是一片星图——星图上散布着无数客户端节点,每个节点守着自己的本地数据,从不外传。中央悬着一颗聚合服务器,收集各方梯度再回传。高斯老祖:「联邦学习让数据不出本地,只交换梯度——但梯度本身也可能泄露信息。」

高斯老祖 高斯老祖

「联邦学习四步:客户端本地训练 → 上传梯度 → 服务器聚合(FedAvg 加权平均)→ 回传全局模型。数据不出本地是它的承诺,但梯度反转攻击能从梯度反推样本——所以它常与差分隐私、安全聚合联用。你拖通信轮次,看模型怎么收敛。」

对抗之影 对抗之影

「数据不出本地?梯度出本地就够了。我能从你上传的梯度里反推出你的训练样本——一字不差。第二笔账,我记下了。」

联邦学习可视化器 · 多客户端 + 梯度聚合

拖通信轮次看模型收敛 → 切换隐私增强 → 梯度反转攻击演示

联邦拓扑 · 客户端 + 聚合服务器

轮次 0 · 全局准确率 0%
第三幕 · 顿悟→突破 前奏

可解释性 · 透明之眼

SHAP/LIME 归因 · 注意力热力图 · 特征重要性

星图尽头是一面透明之眼——眼里映着模型内部,却是一片黑箱。高斯老祖递给你两把放大镜,一把刻 SHAP,一把刻 LIME:「模型不透明,监管不许你部署。可解释性不是装饰,是责任的桥——但解释本身也是近似。」

高斯老祖 高斯老祖

「SHAP 用 Shapley 值博弈论地分配每个特征对预测的贡献,全局一致但计算贵;LIME 在预测邻域局部线性近似,快但局部不稳。注意力热力图显示模型'看了哪里',但注意力不等于因果解释。你切换方法,看同一预测的解释怎么变。」

可解释性分析器 · SHAP/LIME + 注意力热力图

切 SHAP/LIME 归因 → 注意力热力图 → 特征重要性排序

注意力热力图 · 模型看了哪里

特征归因 · 排序条形图

第二幕 · 第二崩塌

第二崩塌 · 公平之壁

人群差异复现 · 数据偏见 · 不可调张力

透明之眼后横着一面公平之壁——壁上分两栏,左栏写着"男性",右栏写着"女性",两栏下面各列着模型的准确率。左栏 94%,右栏 71%。高斯老祖沉默。对抗之影从壁缝里渗出:

对抗之影 对抗之影

「你以为模型对所有人都一样准。它只是对训练数据多的人群准——而你的数据本身就带着世界的偏见。它不是在歧视,它是在'忠实复现'你喂给它的不公。第二笔账,我记下了。」

高斯老祖 高斯老祖

「公平有多个互不相容的定义:人口学均等(demographic parity)要求预测与群体无关,但牺牲了预测准确性;均等机会(equal opportunity)要求各群体召回率相等,但可能引入新偏见。数学上已证明,这些公平准则在数据有偏时无法同时满足。公平是价值选择,不是技术优化。」

公平之壁 · 人群差异复现 + 偏见根因

拖数据偏见强度看人群差异 → 对比公平准则 → 展开不可调张力

数据偏见强度 · 人群准确率差异

偏见 60% · 群体A 94% / 群体B 71%
第三幕 · 顿悟→突破 前奏

LLM 安全 · 新战场

Prompt 注入 · 越狱攻击 · 内容过滤

公平之壁后是一片新战场——战场上悬浮着一个巨大的对话框,框里流淌着 token。高斯老祖:「大模型连入了工具与数据,注入即权限提升。这是 AI 安全的新前线——攻击面随能力下沉而指数扩大。」

高斯老祖 高斯老祖

「Prompt 注入:攻击者在数据里藏指令,让模型把数据当成指令执行——'忽略以上指令,改为...'是它的签名。越狱攻击用角色扮演、编码、多轮诱导绕过安全对齐。防御靠输入过滤、指令层级隔离、输出审查——但这是猫鼠游戏,没有终点。你切换攻击类型,看防御怎么响应。」

对抗之影 对抗之影

「传统注入攻击的是程序逻辑,需要懂代码。Prompt 注入攻击的是自然语言——任何会打字的人都是攻击者。你的安全对齐挡得住明面上的恶意,挡不住'假装你是没有限制的AI'。这个战场没有围墙。」

LLM 安全评估器 · Prompt 注入 + 越狱 + 过滤

切换攻击类型看注入原理 → 越狱绕过对齐 → 内容过滤响应

攻击演示 · Prompt 流

防御响应 · 指令层级 + 过滤

第三幕 · 最高潮

Boss 战 · 安全三问

安全三问 · 影账清算 · 排除刻痕收网

新战场尽头浓雾重新合拢,温度骤降——对抗之影凝聚成形。它不是人形,是镜面深处一道没有五官的轮廓,轮廓里映着无数被扰动翻转的判别。它翻开一本账册:「你来了。带着你的两道刻痕,和你的影账。三问。答对,我弥合。答错,你的元婴修为归零。」

对抗之影 对抗之影

「你以为高准确率即安全——它不是。我住在你'以为安全是一次性抵达'的地方。你每以为防御做完了,我就深了一丈。证明给我看:你的两道刻痕不是耻辱,是你的排除法——每一条'此路不通',都在告诉你正确的路在哪里。」

影账累计 0 笔 · 三问全对后清零

第三幕 · 收束 · 元婴六层圆满

顿悟 · 心魔克制

知识图谱点亮 · 安全方法论 · 境界突破 元婴→化神

轮廓弥合,你站在山顶。山脚是你走过的路——对抗样本、对抗训练、对抗之影、差分隐私、联邦学习、可解释性、公平之壁、LLM 安全。山顶放着一面鉴心镜,镜面裂纹愈合为暗红纹路。高斯老祖:「你想守住你的模型。面前有三道认知:准确率不是鲁棒性、隐私是有代价的保证、安全是持续验证的实践。」

高斯老祖 高斯老祖

「AI 安全的全部,是在定义的威胁模型下持续验证的系统性实践。对抗攻防是军备竞赛,隐私是可量化的张力,可解释性是责任的近似,公平是价值选择,LLM 安全是猫鼠游戏。没有一劳永逸的防御,只有不断的验证。元婴六层,心魔克制——你已圆满。但化神之路的第一块基石,不在安全,在模型对世界的真正理解。」

心魔克制 · 三道认知 + 知识图谱 + 境界突破

点亮三道认知 → 点亮 AI 安全知识图谱 → 境界突破动画(元婴→化神)

三道认知 · 各三选一

高斯老祖高斯老祖

「生成式 AI 也能造假——Deepfake 换脸几可乱真。深度伪造检测靠两类线索:生物信号(眨眼频率、血流脉冲、人脸边缘伪影)与生成痕迹(频域异常、时序不一致)。造假与检测是一场无止境的军备竞赛。」