Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

人为设计的疫情与生物武器风险

AI 生物能力提升研究显示了什么、没有显示什么,以及信息防护措施如何与现实中的生物防御相衔接,包括 Anthropic 启用 ASL-3 的决定。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
4 cited
Reading
1 min

这项风险并不需要 AGI 才会出现

先进 AI 可能通过帮助心怀恶意的行为者检索文献、比较各种方案、排查实验室操作中的问题,或操作专业的生物工具,来增加生物安全风险。一个模型并不需要拥有意识、超级智能或完全的自主性,就足以产生实质影响。它只需要,在一个本就危险的工作流程中,减少其中一个或多个瓶颈环节。

这一机制既有说服力、也很重要,但其当前的严重程度仍不明确。2026年版《国际人工智能安全报告》的结论是,相关能力已经有所提升,一些较新的研究发现,在代理性任务上存在具有实质意义的协助效果,而更早的研究则发现效果很小,或在统计上并不显著。报告同时强调,现实中的物质层面障碍依然存在,评估方面也存在重大缺口(2026年《国际人工智能安全报告》)。因此,准确的立场,既不是「AI 已经能够制造一场疫情」,也不是「模型只是在重复网络上那些无害的事实」。

研究者所说的「能力提升」究竟是什么意思

一项能力提升研究,比较的是「有 AI 协助」与某个基准情形(例如仅能访问互联网)之间的表现差异。其结果取决于谁参与其中、他们尝试完成的是什么任务、使用了哪个模型及哪些防护措施、表现是如何评分的,以及这项任务究竟是一份纸面计划、一次代理性的物资获取演练,还是真实的实验室操作。

信息,只是一次生物攻击链条中的一环。行为者可能还需要选定病原体、获取材料、掌握只可意会的实验室技能、进行质量控制、扩大生产规模、避免自我伤害与被发现,并实现散播。AI 可能在某一个环节上提供了实质性的帮助,而整个行动依然超出该行为者的能力范围。反过来,在正确的瓶颈环节上提供的一点点帮助,可能比在一项无关紧要的测试上取得的大幅得分提升,更具实际意义。

安全的研究会避免产出可直接操作的指令,而是采用专家评审、受控环境与代理性任务。即便如此,外部效度依然很难保证。参与者可能与真实的威胁行为者并不相似。短期研究无法捕捉长达数月的排错过程。模型的快速迭代,也可能让一项审慎得出的结果,在发表后不久就变得过时。

证据在早期的零效应结果之后发生了变化

兰德公司(RAND)在2024年的一项红队研究发现,在专家对生物攻击计划的评分上,使用语言模型协助的团队与仅使用互联网的团队之间,并不存在具有统计学意义的差异。兰德的结论是,作为辅助工具,攻击规划已经超出了受测模型的能力边界,但同时也提醒,该研究并未测量究竟超出了多少(兰德报告)。这是针对那些特定模型、参与者与规划任务而言具有实际意义的证据,而不是一项关于所有未来系统的永久性结论。

之后出现的证据更加令人担忧,但依然并不完整。2026年版《国际人工智能安全报告》描述了一项较新的真实世界能力提升研究:相较于仅能访问互联网的情形,未设防护措施的通用 AI,在生物武器物资获取的代理性任务上,提供了实质性的协助。报告还提到了一些关于模型协助科研工作与实验室设备操作的研究。这些结果更新了此前的判断:如今再说当前系统「并未」明显降低现实层面的障碍,已经不再准确。但整体风险究竟上升了多少、哪些物质层面的瓶颈依然存在,依然难以量化。

开发者自身的评估,能够增添一些证据,但存在利益冲突,并且往往会隐去敏感细节。它们应当被标注为企业自我报告,并与政府和独立研究结合起来加以解读。

Anthropic 启用 ASL-3 意味着什么

Anthropic 于2025年宣布为 Claude Opus 4 系列模型启用 ASL-3 级别的防护措施,原因是该公司无法排除该模型在某些化学、生物、放射性或核相关工作流程中提供了具有实质意义的能力提升。该公司明确表示,此举属于预防性质,并称尚未确凿地证实该模型已经跨过了相关的能力阈值(Anthropic ASL-3 公告)。

重要的是不要把几个不同的概念混为一谈。一个「AI 安全等级」,是一整套安全与部署方面的防护措施。一个「能力阈值」,则是能够触发更强防护措施的证据。Anthropic 的政策同时也区分了非新型的化学/生物制造、新型武器开发,以及对更为复杂项目的能力提升。「ASL-3」并不是一项通用的科学评级,也不意味着该模型能够自主制造出每一类 CBRN 武器。

Anthropic 的这份政策依然在持续变化;其公开存档显示,截至2026年8月,已是3.4版(Anthropic RSP)。读者在讨论某个具体模型决策时,应当使用与之对应的版本与日期,而不应照搬某个更早期框架中的表述。

防护措施需要多层设计

模型与部署层面的管控,包括训练系统拒绝提供危险协助、输入输出分类器、对可疑的多步骤模式进行监测、速率限制、账户核验,以及为经过审查的研究者提供受控的访问权限。这些措施能够减少随意性的滥用,但也可能被越狱攻击、任务拆解、转而使用防护较弱的模型,或从开放权重中移除防护措施等手段所绕过。

以评估结果作为发布关口,把测试结果与实际决策联系了起来。开发者可以在训练期间进行测试、委托外部评估、限制工具访问权限,并在证据超出既定阈值时推迟发布。相关报告应当说明其中残留的不确定性,而不只是说明某个阈值是否在形式上被跨越。

核酸合成筛查,针对的是从数字信息到实体材料之间的这一环节。供应商可以依据风险标准,对客户及其订购的序列进行筛查,同时兼顾适当的隐私保护、申诉机制与国际协调。仅靠筛查本身并不足够:设备、病原体、实验室与供应链在全球各地各不相同。

公共卫生韧性,无论疫情爆发是自然发生、意外发生,还是蓄意为之,都能够降低相应的危害。监测体系、快速诊断、室内空气质量改善、防护装备、疫苗技术平台、医疗物资储备,以及可信的信息沟通,共同构成了一套广泛的防御体系。如果安全政策只聚焦于模型的拒答机制,就会忽视这个更大的体系。关于这种韧性在家庭层面的对应做法——呼吸防护、空气过滤与隔离规划——参见个人生物安全基础

实验室治理与生物安全,依然处于核心位置。培训、机构审查、访问管控、事件报告与安全文化,能够同时应对恶意与意外这两类风险路径。AI 同样可以通过协助检测、药物发现与生物研究,来强化防御能力;相关管控措施,应当在可能的情况下,尽量保留住合法的研究工作。

如何在不夸大其词的前提下进行推理

应当把以下四种说法区分开来。第一,当前的模型能够提供大量的生物学信息;这一点已被观察到。第二,一些评估结果表明,在特定的代理性任务上存在实际的能力提升;这是带有局限性的新兴证据。第三,心怀恶意的行为者,可能把未来的 AI 与工具、材料结合起来,引发一场灾难性的疫情爆发;这是一条具有说服力的风险路径。第四,一场由 AI 导致的疫情即将来临;现有证据并不能支持这一预测。

这种区分,对于维系公众信任而言至关重要。夸大其词可能助长宿命论情绪,或反倒起到了为相关能力打广告的效果;而轻率否定,则可能拖延防御措施的建设。相关报告应当说明所测试的系统、防护措施、基准情形、参与者、评估终点、不确定性,以及资金来源。任何可能助长危害的操作性细节,都不应当被公开发表。

现实层面的结论

AI 助力的生物风险,是最为具体的严重危害担忧之一,因为有益的科学协助与危险的协助之间存在重叠。相关证据已经超越了早期「不存在显著能力提升」的结论,但它并不能证明,模型已经消除了发动一次大规模攻击所需跨越的、要求严苛的物理与组织层面障碍。

理性的应对方式,应当是分层且具有适应性的:持续开展独立的能力提升研究、把模型能力与可强制执行的防护措施相挂钩、保障生物供应链的安全,并加强公共卫生体系。无论 AI 未来发展的时间线如何,这些举措都始终具有价值——它们也避免了把某一家公司的安全等级,误当作对整体生物风险状况的定论。

References

Summarized position

Anthropic activated ASL-3 safety and security measures for Claude Opus 4 as a precaution against CBRN weapons uplift risk.

Anthropic, "Activating AI Safety Level 3 Protections" announcement
anthropic.com, Primary source
Summarized position

Christopher Mouton, Caleb Lucas, and Ella Guest found no statistically significant difference in the viability of biological-attack plans produced with the tested LLMs versus an internet-only baseline; the study did not test laboratory execution.

Christopher Mouton, Caleb Lucas, and Ella Guest, Authors, "The Operational Risks of AI in Large-Scale Biological Attacks: Results of a Red-Team Study"
RAND Corporation, Research/report
  1. 2026年《国际人工智能安全报告》 internationalaisafetyreport.org
  2. Anthropic RSP anthropic.com

Type to search the manual.

navigate open esc close