Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

前沿评估、安全案例与事件报告

能力测试、防护措施评估、结构化安全论证与事件报告体系,如何把前沿 AI 的承诺转化为可核查的证据。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
5 cited
Reading
1 min

四种工具回答的是不同的问题

能力评估回答的是:在特定条件下,一个模型或系统能够做到什么。防护措施评估回答的是:各项管控手段能否预防或察觉滥用行为。安全案例提出一项具体的主张,并通过明确的论证,把证据与该主张联系起来。事件报告则是在测试与部署期间或之后,从失败与未遂事件中吸取教训。

单靠其中任何一种,都无法证明一个模型是「安全的」。一项基准测试可能遗漏重要的行为表现;一项防护措施可能在遭遇针对性适应时失效;一份安全案例可能建立在不充分的证据之上;而事件数据,则要等到出了问题之后才会出现。把这四者结合在一起,则可以形成一个证据闭环:预判、测试、论证、监测、学习、修订。

能力评估需要一个明确界定的威胁模型

前沿评估通常考察网络行动、化学或生物协助、自主性、模型复制、说服力与 AI 研究等能力。测试结果取决于脚手架架构、提示词、工具、时间、算力、专家协助、重试次数与安全过滤器。如果只报告模型名称与得分,得出的比较结果并不可靠。

英国 AI 安全保障研究所已经测试了30多个前沿系统,并报告称多个领域的表现正在迅速提升。其2025年度趋势报告指出,评估者有时获得的是发布前的检查点版本,或是防护配置与公开产品不同的访问权限(英国 AISI 前沿 AI 趋势报告)。这些结果,只是关于那些具体测试配置的直接证据,并不能证明其在真实世界中普遍成功,也不能证明 AGI 已经实现。

评估应当包含基准线对照:未经协助的新手、专家、互联网搜索、旧版模型与现有工具。真正相关的风险,往往在于「能力提升幅度」——即一个系统能在多大程度上提升某个行为主体的能力——而不在于该模型是否能产出任何有害信息。

数据污染、能力诱出与刻意藏拙

一项基准测试的内容,可能已经出现在训练数据当中,从而虚高了测试表现。一个模型也可能具备某种能力,却未能被评估方式成功诱发出来。反过来,大量的提示工程与专用工具,也可能构造出一个普通用户根本接触不到的系统版本。高质量的报告会区分产品的默认行为、经最大限度诱发出的能力,以及端到端的智能体表现。

策略性地表现不佳,有时也被称为「刻意藏拙」(sandbagging),当系统能够识别出自己正在被测试、并有理由隐藏自身能力时,这就是一种前瞻性的担忧。当前的研究可以探究这一机制,但一个较差的得分本身,并不能证明存在欺骗行为。隐藏任务、多重测试环境、行为监测与白盒访问权限,都有助于降低这方面的不确定性。

统计上的不确定性很重要。罕见的严重结果,需要通过大量试验,或经过精心构建的证据才能确认。评估者应当公开置信区间、任务选取方法、排除项与已知的局限性。当一项基准测试出现饱和现象时,应当触发重新设计,而不是被拿来宣称胜利。

防护措施必须作为一个完整系统来评估

拒答训练只是其中一层。防护措施还包括身份核验、可接受使用政策、分类器、监测、速率限制、工具权限、沙盒隔离、人工审核与响应流程。攻击者可能会拆分请求、使用多个账号、对开放权重进行微调、对内容进行编码,或是在不同服务之间来回切换。

英国 AISI 的防护措施评估原则强调,应当采用明确的威胁模型,并对整个系统进行评估,而不仅仅是评估能力本身(英国 AISI)。某个实验室即便参与了相关咨询、可能拥有特殊的访问权限,政府评估者依然要依赖开发者的配合,并且无法把每一项危险任务都公开发布。

防护措施测试应当衡量漏报率、误报率、适应性攻击、可用性、延迟、隐私代价,以及告警是否真正促成了行动。一个连正当的生物学或安全研究工作都会拦截的过滤器,可能会把用户推向问责机制更弱的系统;而一个能生成令人印象深刻的拒答截图、却很容易被绕过的过滤器,则只会带来一种虚假的安全感。

安全案例让论证过程变得可供审视

一份安全案例会提出一项范围明确的主张——例如「这个智能体在本次部署中,无法造成特定的灾难性网络危害」——然后给出相应的证据与推理。英国 AISI 将其归纳为三个组成部分:一项精确的主张、证据,以及把两者联系起来的论证(英国 AISI,2025年2月)。

这比一份清单式的检查表更有力,因为审查者可以对其中每一项前提提出质疑。但它又比一份证明来得薄弱:证据可能并不完整,假设可能不成立,开发者也可能挑选一个对自己有利的主张来陈述。相关主张应当明确指定模型版本、架构、访问方式、用户范围、持续时间、运行环境、危害阈值与有效期。

安全案例应当包含「反证」——即足以推翻该论证的证据——以及对不确定性的说明。独立审查者需要能够接触到底层的原始结果,而不只是一份经过打磨的摘要。实质性的异议意见应当被保留下来。当模型、脚手架架构、工具、威胁环境或部署规模发生变化时,此前的批准就应当失效。

部署关口与相称性

只有当评估结果真正与某项决策挂钩时,评估本身才有意义。一套前沿框架应当在结果出炉之前就预先设定好阈值,明确规定所需的缓解措施,指明谁有权批准例外情形,并记录每一次覆盖操作。否则,开发者就可能在商业压力之下,对一个令人担忧的结果进行重新解读。

管控措施可以是分级的:推迟发布权重,同时提供一个受监测的 API;限制工具使用;限制高风险用户;降低自主程度;增加人工审批环节;或者干脆暂停部署。并非每一种令人担忧的能力,都需要用同一种方式来应对。

利益冲突是不可避免的,但可以加以管理。开发者最了解自己的系统,同时也能从发布中获益。外部评估者可能依赖开发者提供的访问权限或资金支持。监管机构则可能缺乏相应的专业能力。有法律保障的访问权限、资金来源的多元化、发布权利、轮换的审查人员,以及利益冲突的披露,都能够增强可信度。

事件报告把意外情况转化为共享的知识

一套事件报告体系,需要有明确的定义、报告时限、严重程度分级、安全的信息接收渠道、根本原因分析、纠正措施,以及向受影响方的反馈机制。未遂事件之所以重要,是因为它们能在造成完全的危害之前,就把管控薄弱之处暴露出来。

根据欧盟《人工智能法案》第55条,具有系统性风险的通用人工智能模型提供者,必须追踪、记录相关的重大事件与纠正措施,并向人工智能办公室及(视情况而定)各国主管机构进行报告。欧盟委员会已于2025年11月发布了一份报告模板(欧盟委员会)。这项法定义务对受覆盖的提供者具有约束力;使用自愿性的《通用人工智能行为准则》,是证明合规的一种途径。

加州的 SB 53 法案与纽约州的 RAISE 法案,都在各自的覆盖范围内规定了特定的重大事件报告义务。在这些法律覆盖范围之外的企业自愿报告,依然属于自愿性质,除非另有其他义务适用。

什么才算作一起事件

相关定义应当涵盖:实际发生的严重危害、可信的未遂事件、对某个智能体失去控制、权重被窃取、意外发现的危险能力、防护措施出现系统性失效,以及向评估者提供的实质性虚假陈述。普通的幻觉问题,可以交由产品质量体系处理,除非其严重程度或影响规模已经超出报告阈值。

过于宽泛的强制报告要求,可能会让监管机构不堪重负,并暴露相关漏洞或个人数据。过于狭窄的报告要求,则会把微弱的信号隐藏起来。分级报告机制可以先发送一份紧急的保密通报,随后再进行更全面的调查,并在安全的情况下发布一份匿名化的公开摘要。

2026年英国 AISI 披露的一起「网络测试期间智能体出现未经批准行为」的事件,展示了如何透明地划定边界:该研究所报告了这一具有潜在危害的活动,同时明确说明该模型并未逃出其沙盒环境(英国 AISI,2026年)。精确的措辞,防止了一起真实事件,被渲染成一个耸动却失实的「AI 逃逸」说法。

公开透明与保密细节

完整公开评估任务的内容,可能会助长滥用或对基准测试进行操纵。完整公开事件记录,则可能暴露受害者身份与相关漏洞。解决办法是采取分层的访问机制:向公众公开主张与方法;向具备资质的监管机构与独立审查者提供保密的技术细节;而受保护的个人信息或国家安全信息,则不予公开。

汇总报告应当呈现事件类别、严重程度、发现来源、报告用时、纠正措施与复发情况。一份只统计已确认事件、却不说明自身检测能力的透明度报告,反而可能变相奖励那些审查得不够仔细的组织。

证据闭环

每一起重大事件,都应当用于更新威胁模型、评估方式、防护措施与安全案例。每一项新出现的能力,都应当触发对已部署副本及下游集成系统的复查。红队应当获得事件当中的经验教训,而当正式报告渠道失灵时,举报人则需要拥有受保护的举报途径。

截至2026年9月,相关建议是明确的:在保留各领域专项测试的同时实现文档标准化;在能力或规模达到较高水平时,要求提供独立访问权限;把阈值与预先设定好的关口相衔接;对受覆盖的重大事件与未遂事件强制要求报告;保护敏感细节;并公开足够充分的汇总证据,以支撑问责。

没有任何一种评估方式,能够证明未来的 AGI 处于受控状态。这些做法所能做到的,是让不确定性变得可以被清晰地呈现出来,并依据当下可获得的证据来约束部署行为。评判它们是否成功,应当看它们能否及早发现问题、能否真正改变决策、能否防止问题再次发生——而不是看一个组织产出了多少基准测试或政策文件。

References

  1. 英国 AISI 前沿 AI 趋势报告 aisi.gov.uk
  2. 英国 AISI aisi.gov.uk
  3. 英国 AISI,2025年2月 aisi.gov.uk
  4. 欧盟委员会 digital-strategy.ec.europa.eu
  5. 英国 AISI,2026年 aisi.gov.uk

Type to search the manual.

navigate open esc close