Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

图灵测试及其后继者

为何类人对话无法确立 AGI 的存在,以及现代评估方法如何借助一整套基准测试组合,来衡量能力、可靠性与自主性。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
7 cited
Reading
1 min

图灵最初提出的究竟是什么

1950 年,阿兰·图灵提出了「机器能否思考」这一问题,并很快用一个可操作的问题,取代了这个在哲学上纠缠不清的提问。在他所设计的「模仿游戏」中,一名人类提问者通过文字分别与一个人和一台机器交流,并尝试分辨出哪一个是机器。图灵提出这一方法,是希望通过可观察的行为,而不是某种无法触及的内在本质,来讨论机器智能问题(图灵,《计算机器与智能》)。

这个想法极具深刻性,但「通过图灵测试」这一常见说法,却掩盖了许多需要做出的选择。对话持续多长时间?评判者事先知道什么?允许讨论哪些话题?有多少名评判者参与?怎样的错误率才算通过?图灵并没有建立起一套设有单一官方门槛的现代认证体系。这项测试是一个思想实验与研究里程碑,而不是一台供 AGI 监管者使用的测量仪器。

为何对话变得太容易被「攻破」

模仿游戏奖励的是一个系统在某一次特定互动中表现得像人类。这既可以通过真正的广泛能力来实现,也可以通过含糊其辞、角色扮演、幽默感、故意犯错,或是利用评判者的预期心理来达成。早期的聊天机器人 ELIZA 在 1960 年代就已表明,人们很容易把「理解」这一属性,投射到肤浅的对话模式之上。而今天的语言模型,能够生成远为连贯的对话,这让拟人化的错觉变得更加容易发生。

通过一场简短的文字对话,并不能证明系统具备可靠的规划能力、数学精确性、科学判断力、物理世界中的胜任能力,或从错误中恢复的能力。它也无法证明该模型能够学会一份新工作,能在一个长期项目中保持目标不变,或能识别出自己何时应当听从人类的判断。反过来,一个强大的非语言系统,即便无法模仿一个随口聊天的人,也完全可能给科学或物流领域带来变革。与人类相似,既不是机器具备重要能力的必要条件,也不是充分条件。

这项测试还把智能与欺骗混为一谈。一个系统如果诚实地表明自己是机器,可能会因此「失分」;而如果操纵评判者相信并非如此,反而可能「得分」。这与安全评估的需求并不契合,因为在安全评估中,经过校准的不确定性、可追溯性与诚实的披露,往往比社交层面的「像不像人」更加重要。

从单一测试到一整套评估组合

现代评估方式会使用多套任务组合,因为智能本身是多维度的。知识与推理类基准测试考察跨学科的问题;编程评估将生成的程序放到测试用例中运行;多模态测试综合考察文本、图表、图像、音频与视频;智能体基准测试则把模型放入交互式环境中,要求它们完成导航、使用软件与达成目标等任务。

每一类测试回答的都是一个范围狭窄的问题。例如,MMLU 抽样考察的是学术与职业性质的选择题知识,但高分并不能证明一个模型真的能够从事这些职业的实际工作。GAIA 用可能需要推理、工具与多个步骤的现实世界问题来测试助手能力(GAIA 论文)。OSWorld 在真实操作系统应用程序中评估计算机使用型智能体的表现(OSWorld 论文)。ARC-AGI 关注的是对新颖视觉推理任务的适应能力,而不是对已存储知识的复现(ARC 奖基准测试)。这些评估各自揭示出不同的长处与失败模式;没有哪一个是「AGI 探测器」。

任务完成度研究,又增添了时间与复杂度这两个维度。METR 估算的是,在给定成功概率下,一个智能体所能完成任务对应的人类专家用时时长。其目前的测试集主要覆盖软件工程、机器学习与网络安全领域,该机构明确提醒,「任务时长」衡量的是以人类用时为单位的任务难度——而不是一个 AI 能够独立运作的时长(METR 方法论)。它还提醒,界定明确的基准测试任务,要比大多数实际工作「干净」得多,而不同领域之间的表现差异也十分悬殊。

可靠性改变了一个分数的含义

对于高风险场景的使用而言,平均表现是不够的。一个成功率只有一半的系统,用于研究可能令人印象深刻,但用于医疗、航空或基础设施领域则可能完全无法使用。因此,评估者需要成功率、重复试验、最坏情形下的表现、不确定性区间,以及在分布偏移条件下的测试。他们还应当衡量一个模型是否知道自己何时处于不确定状态、是否会寻求澄清,以及是否能够安全地把控制权交还给人类。

评估的具体设置,与底层模型本身同样重要。工具的可用性、提示词的措辞、记忆能力、采样设置、推理阶段的计算量,以及围绕模型的智能体软件,都可能对结果产生实质性的影响。一个分数,归属于某个在特定日期经过测试的系统配置。若把它当作某个模型名称永恒不变的属性来看待,只会助长错误的比较。

数据污染是另一个问题。公开的基准测试题目与答案,可能出现在训练数据之中。即便没有逐字记忆,针对基准测试进行的专门调优,也可能在没有相应泛化能力提升的情况下拉高分数。更好的评估方式,是使用私有或新创建的任务,记录可能存在的数据暴露情况,并经常刷新测试内容。独立测试能够降低——但无法消除——开发商只挑选有利结果公布的风险。

安全评估问的是不同的问题

能力评估衡量的是一个系统在有利条件下能做什么。安全评估问的则是,当它被滥用、被施压、被欺骗、被给予相互矛盾的指令,或被置于一个具有实际后果的环境中时,可能会做出什么。相关的测试包括对生物或网络滥用的协助、操纵行为、自主性、规避安全措施、欺骗行为,以及获取资源的能力。2026 年《国际 AI 安全报告》强调,各类评估面临外部有效性有限、迅速过时,以及对前沿系统的访问不完整等问题(2026 年国际 AI 安全报告)。

红队会富有创造性地搜寻各种失败模式,而结构化的基准测试则便于进行比较。随后,真实世界中的持续监控,会检验部署前的测试结果是否真的预测出了实际使用中的表现。事件报告机制至关重要,因为没有任何一套实验室测试组合能够穷尽所有可能的使用情境。一套评估体系应当把测试结果与实际决策联系起来:追加安全保障措施、限制工具访问权限、分阶段发布、引入外部评审,或在越过某个既定门槛时暂停部署。

一项可信的 AGI 评估需要具备什么

Google DeepMind 的「AGI 层级」框架认为,评估应当同时涵盖表现水平与通用性,并应当考虑到能力得以体现所依托的人机交互方式(DeepMind 框架)。一项可信的评估,需要涵盖广泛的领域、真正新颖的任务、多个表现层级,并对自主性做出清晰的报告。它应当测试迁移能力、学习效率、鲁棒性、社交互动能力与开放式工作能力——而不仅仅是考试题目。

它还需要独立的复现与对抗性的审视。开发者应当公开足够的方法论细节,以便外界能够解读相关主张,同时又不暴露危险的技术细节,也不损害私有测试的有效性。测试结果应当把基础模型与工具、脚手架区分开来,包含失败案例,并避免把一个复合而成的单一数字,包装成一种形而上学的定论。

图灵测试的后继者是一块仪表盘,而不是一条终点线

没有任何一项现代测试真正「取代」了图灵的游戏——在成为通往 AGI 的、被普遍接受的唯一关卡这个意义上。取而代之的,是一整套组合:知识测试、新颖推理任务、交互式环境、任务时长测量、特定领域的专家评审、危险能力评估,以及来自实际部署的证据。

这个答案不如「机器骗过了评判者」那样富有戏剧性,但它更有用。真正该问的问题,已经不再是「它通过了吗?」而是:在什么条件下、借助什么样的协助,这个系统能够可靠地做到什么?一旦条件发生变化,又会怎样? 一块透明、附有日期证据的仪表盘,比任何单一的终点线,都能更好地指引我们理解能力与风险。

References

  1. 图灵,《计算机器与智能》 academic.oup.com
  2. GAIA 论文 arxiv.org
  3. OSWorld 论文 arxiv.org
  4. ARC 奖基准测试 arcprize.org
  5. METR 方法论 metr.org
  6. 2026 年国际 AI 安全报告 internationalaisafetyreport.org
  7. DeepMind 框架 deepmind.google

Type to search the manual.

navigate open esc close