Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

可解释性:解读模型内部究竟在做什么

可解释性研究究竟在做什么、Anthropic 首席执行官为何称其紧迫,以及这一领域距离读懂模型「内心」还有多远。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
4 cited
Reading
1 min

可解释性承诺了什么

一个神经网络是通过调整大量数值参数来训练的,而不是由工程师为每一种回应写下一条可读的规则。开发者了解其架构、训练流程与数据处理管线,却可能无法解释究竟是哪一部分内部计算,产生了某个具体的输出。可解释性研究试图把这部分计算过程,转化为人类可以审视的证据。

这与「让模型自我解释」是两回事。一段生成出来的思维链,可能并不准确、并不完整,可能是为了听起来更有说服力而被优化过,也可能与真正的因果机制毫无关联。这也与一个小型预测模型中常见的特征重要性分析不同。前沿语言模型内部包含着分布式的表征,以及众多相互作用的组件。

多种方法共享同一个标签

行为可解释性通过系统化的测试,把输入与输出对应起来。它能够发现某些倾向性,却未必能定位到具体的内部电路。机制可解释性研究的是网络内部的组件、激活值、特征与因果路径。基于概念的方法把激活模式与人类的描述联系起来。归因方法估计的是哪个输入或哪个组件影响了某个输出。**探针法(probing)**则训练一个分类器,来检验能否从某个内部状态中还原出相应的信息。

这些方法各自回答的是不同的问题。某些信息可能是可解码的,却未必真正被模型使用。对某个特征的描述,可能是可以理解的,却并不完整。激活值与输出之间的相关性,未必能够证明因果关系。干预法——即改变或抑制某个组件并观察结果——能提供更有力的因果证据,但也可能带来意料之外的副作用。

稀疏自编码器与特征字典

模型的激活值,可能在同一维度上叠加了许多不同的模式。稀疏自编码器试图把这些激活值,分解成一组规模更大、且能够选择性激活的特征。Anthropic 报告称,已从 Claude 3 Sonnet 中提取出数百万个特征,并识别出与可辨识概念相关联的示例。这只是一家开发者针对自家模型得出的研究结果,并不是关于完全透明性的独立证明(Anthropic,2024年)。

扩大规模并不容易:研究者必须选择要分析哪些层与哪些词元、训练额外的模型、为数量庞大的特征打上标签,并判断还原出来的特征,是否真实地反映了原始的计算过程。有些特征依然是无法解释的;一个特征可能混合了多重含义;重要信息可能被遗漏;而自动生成的标签也可能是错误的。

Anthropic 在2026年关于自然语言自编码器的研究工作,明确指出生成出的解释可能是错误的,即便该研究同时报告称,已具备一定的能力,可以把激活值转化为文本并进行重建(Anthropic,2026年5月)。这是一种进展,但并不是一份「神经活动逐字稿」。

审计才是现实中的检验标准

当可解释性能够改善一项真实决策时,它才具有价值:例如发现一个隐藏目标、诊断一次越狱攻击、在行为暴露之前预测一次故障,或验证某项防护措施确实影响了预期中的机制。受控的审计演练,可以检验使用相关工具的团队,能否识别出被刻意植入的问题。

在 Anthropic 于2025年开展的一项研究中,多个团队运用行为分析、训练数据分析与可解释性方法,对一个被植入隐藏目标的模型进行了审计(Anthropic,2025年3月)。在一场刻意构建的演练中取得成功,并不能证明能够在生产环境中可靠地检测出未知的目标,但它比单纯漂亮的特征可视化图,更接近于一种实际运行层面的验证。

一套成熟的基准测试,应当衡量漏报率、误报率、所需时间、所需专业能力、对陌生模型的泛化能力,以及测试结果是否真正改变了部署决策。它还应当纳入独立团队,并公开发布负面结果。

为什么研究失控问题的人如此关注这一领域

如果一个系统能够在被评估期间,策略性地表现出不同的行为,那么仅依赖输出结果的测试,可能会带来一种虚假的安心感。即便表面行为看起来完全合规,内部证据也可能揭示出规划行为、情境意识、欺骗行为或被禁止的知识。可解释性技术,也可以用于在部署期间对系统进行监测。

这一论点在很大程度上依然停留在理论层面。现有工具无法可靠地读取「意图」,而「意图」本身也未必会以一个稳定、可供人类阅读的单一对象的形式呈现出来。对一个可解释性仪表盘过度自信,可能比坦承其不透明性更加危险。安全案例应当明确说明:某种方法能够检测哪些失效模式、检测灵敏度如何,以及是在何种对抗性假设之下得出的。

可解释性在当下也有实际用途

这一领域并不需要等到 AGI 出现才有用武之地。相关工具可以用来研究偏见、记忆化现象、幻觉产生的机制、模型编辑,以及意外出现的泛化行为。它们可以帮助开发者理解,为什么微调改变了模型行为,或者安全训练在哪些地方显得脆弱。即便全面的逆向工程依然遥不可及,这些用途也能改善日常层面的可靠性。

然而,一次解释性分析,也可能暴露敏感的训练信息,或使得对模型能力进行操纵变得更为容易。公开「能够定位到某个与安全相关的机制」这项能力,可能同时帮助到防御方与攻击方。负责任的披露方式与分阶段的访问安排,有时可能是更为恰当的做法。

「评估感知」问题

一个模型可能会从提示词、工具或运行环境中,推断出自己正在被测试。行为评估可以减少这类线索、使用隐藏测试,并在部署之后依然持续进行。如果模型没有预料到内部检测方法的存在,这些方法或许更难被操纵,但一个针对已知监测手段进行过训练的系统,也可能学会采用替代性的内部表征来规避它们。

这就形成了一个对抗性的循环。可解释性认证不能一次性完成、然后被当作永久有效。相关方法、测试集与访问控制,都需要不断更新,而相关主张也应当明确说明所检验的具体模型版本。

独立性与利益冲突

领先的研究工作,往往出自模型开发者自身,因为他们掌握着权重、激活值、算力与工程知识。但他们同时也能从「令人安心的解释」中获益,并可能隐瞒涉及安全的敏感细节。学术团队能够提供独立性,却可能缺乏访问权限。公共利益导向的评估机构,如果能获得安全的访问权限、资金支持与发布权利,则可以弥合这一差距。

Anthropic 的首席执行官曾主张,在具备更强的可解释性之前,不应部署强大的 AI。这是一位企业领导人所持有的、具有影响力的政策立场,而不是一个已达成共识的时间表,更不能证明该公司的技术方案必然会取得成功。厂商方面的研究,应当与经过同行评审的批评意见及复现研究结合起来阅读。

什么样的证据才算充分

在可解释性被用来支撑一次高风险部署之前,评估者应当追问:

  • 在不被提前告知位置的情况下,该方法能否还原出已知的机制?
  • 它能否同时发现被刻意隐藏的故障,以及自然发生的故障?
  • 它编造出「看似合理却是错误的」解释的频率有多高?
  • 独立团队能否复现这些结果?
  • 在分布发生偏移或经过对抗性训练之后,它是否依然有效?
  • 按照该解释所预测的方式进行干预,是否真的能让行为发生预期中的变化?
  • 相关计算过程中,还有多大比例依然无法得到解释?

覆盖率很重要。「理解了数百万个特征」听起来令人印象深刻,但仍然需要一个分母来衡量。如果模型实际包含的相关结构远比这更多,那么已被绘制出来的部分,可能依然只占很小的比例。

可解释性只是其中一层

即便对模型达成了完美的理解,也无法决定应当落实哪些价值观、由谁来批准部署,或者一个机构是否会真正针对警告采取行动。反过来,理解得不完整,也不意味着一切使用都变得不可能。航空业与医学领域,同样是把不完整的模型,与测试、监测、冗余设计及受限运行结合在一起使用的。

可解释性应当去强化可扩展监督、访问控制、红队测试、事件报告与可纠正性,而不应该仅仅因为一张可视化图看起来清晰易懂,就被当作授予广泛自主权的通行证。

截至2026年9月,准确的现状是:已经取得了有意义、但仍属局部的进展。研究者能够识别并操纵部分内部特征,并在受控审计中使用相关工具。但他们依然无法可靠地转译一个前沿模型的完整推理过程,也无法保证能够检测出欺骗行为。正因为这一差距依然十分巨大,这一领域才具有根本性的重要意义。

References

Summarized position

Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.

Dario Amodei, CEO, Anthropic
The Urgency of Interpretability, Primary source
  1. Anthropic,2024年 anthropic.com
  2. Anthropic,2026年5月 anthropic.com
  3. Anthropic,2025年3月 anthropic.com

Type to search the manual.

navigate open esc close