可解释性与安全前沿
可解释性与安全前沿
AI 安全与对齐 已介绍安全分层、红队、治理和上线评审;评估与评测 已介绍 benchmark、LLM-as-Judge 和持续校准。本页聚焦模型内部研究:如何定位模型使用的表征和回路,如何控制内部激活,以及如何建立可监控的安全证据。
机制可解释性的问题边界
机制可解释性(Mechanistic Interpretability)试图回答:
- 模型内部哪些神经元、特征和回路参与了一个行为;
- 不同层如何组合表示、检索和计算;
- 改变某个内部组件是否会因果地改变输出;
- 解释是否可以迁移到新输入和新模型。
“能描述一个激活”不等于“解释了模型”。较强证据需要干预实验:激活、抑制、替换或重组某个组件后,目标行为按预测变化,同时无关行为保持稳定。
Causal Tracing 与知识定位
Locating and Editing Factual Associations in GPT 使用因果追踪分析信息在 Transformer 层间的传播,并研究如何通过局部参数更新编辑事实关联。
因果追踪的基本思路是比较正常运行、损坏输入和恢复干预之间的中间表示变化。它可以提出“哪一层、哪一位置、哪一类表示参与了事实生成”的假设,但不能仅凭相关激活证明模型拥有单一、可分离的知识单元。
Superposition 与 Sparse Autoencoder
神经网络可能在有限维度中叠加表示大量特征,这就是 superposition 研究关注的现象。单个神经元的激活往往对应多个语义或计算特征,直接给神经元命名容易过度解释。
Sparse Autoencoders Find Highly Interpretable Features in Language Models 及相关工作使用稀疏自编码器,把模型激活分解为更稀疏、可读的特征。稀疏特征有助于分析:
- 某类概念是否被激活;
- 特征在不同上下文中如何复用;
- 有害行为是否对应可监测方向;
- 干预某个特征是否改变目标行为。
SAE 的边界包括字典大小、稀疏率、重构误差、特征稳定性和特征命名偏差。可视化特征不能代替因果验证。
Activation Steering 与 Representation Engineering
Representation Engineering: A Top-Down Approach to AI Transparency 研究从内部表征方向理解和控制模型行为。工程上可以通过识别某类状态的激活差异,尝试在推理时对激活施加方向性干预。
这类方法可能用于:
- 控制语气、风格或拒答倾向;
- 研究模型的知识和价值表征;
- 快速验证某个内部方向与行为的因果关系。
风险也很明显:激活方向可能与多个行为纠缠,控制一个目标可能损害诚实性、能力或其他安全属性。线上使用前必须做回归评测和越权测试。
过程监督
训练侧的过程奖励与验证器设计见 RLVR 与 GRPO。本页只保留监督视角:最终答案正确不代表每一步可审计;高风险任务要保留中间检查、工具结果和证据,不能只展示最终文本。
可扩展监督把「弱评审如何盯住强模型」当成独立问题,见下一节。参数编辑见 外部记忆与模型编辑。
Scalable Oversight
当模型能力超过人工逐步检查的能力时,监督本身成为研究问题。可扩展监督(Scalable Oversight)问的是:弱监督者如何可靠地评估更强模型。过程监督是其中一条;邻近路线还包括:
- Debate:让两个模型互相质疑,由较弱评审者根据辩论判断(AI Safety via Debate);
- Recursive Reward Modeling:用模型辅助人类给更复杂行为打分,再训练下一层评审;
- 弱到强监督:用弱标签训练强模型,并测量标签噪声下的能力外推。
可扩展监督的难点包括:
- 评审模型会继承或放大被评模型的盲点;
- 复杂任务的正确性可能无法分解为局部步骤;
- 模型可能生成让评审者满意但不真实的解释;
- 监督成本和延迟可能超过任务本身。
产品适用边界:有自动验证器时优先 RLVR 与过程奖励;没有验证器时 Oversight 只能降低风险,不能当作上线证明。接到 AI 安全与对齐 的红队与上线清单。
监控性与安全证据
一个安全机制是否可用,不只看拒答率,还要回答:
| 问题 | 需要的证据 |
|---|---|
| 能否识别危险意图? | 多语言、隐晦表达和多轮对抗测试 |
| 能否解释触发原因? | 规则、激活或轨迹级证据 |
| 是否误伤正常任务? | 有用性和误拒答回归 |
| 是否能被绕过? | 红队、组合提示和工具环境测试 |
| 是否可持续监控? | 漂移、版本和线上抽检 |
| 事故后能否复盘? | 完整输入、输出、工具和策略日志 |
内部可解释性方法可以提升诊断能力,但不应被当作安全证明。安全结论必须结合行为评测、系统护栏、权限控制和事故响应。
论文证据的局限
- 解释往往只覆盖单一模型、层和任务;
- 特征名称来自研究者解释,存在主观性;
- 干预效果可能只在短上下文和固定提示词下成立;
- 高维表征的线性方向不一定对应稳定语义;
- 训练后模型更新、量化和蒸馏可能改变内部结构;
- 安全行为的可解释不等于行为在所有分布外输入上可靠。
给 AI 产品经理的结论
可解释性最有价值的产品用途是定位故障、设计监控、支持人工复核和验证安全干预。不要把一张神经元激活图当作因果解释,也不要用单项拒答率替代完整安全证据。研究方法进入生产前,应先明确干预范围、回归指标、误伤成本和回滚策略。
来源说明
本文为原创整理,引用日期:2026-09-04。基础安全和评测方法参见 AI 安全与对齐 与 评估与评测。主要来源包括 ROME、Sparse Autoencoders、Representation Engineering、Let's Verify Step by Step 与 AI Safety via Debate。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用