チューリングが実際に提案したこと
1950年、アラン・チューリングは機械が考えることができるかを問い、その哲学的にもつれた問いを、素早く操作的な問いへと置き換えた。彼の「模倣ゲーム」では、人間の尋問者が一人の人間と一台の機械の両方とテキストでやり取りし、どちらがどちらかを見分けようとする。チューリングはこれを、アクセスできない内的本質ではなく、観察可能な振る舞いを通じて機械の知能を論じる方法として提示した(チューリング「計算する機械と知性」)。
その着想は深遠だったが、「チューリングテストに合格する」というよく知られたフレーズは、多くの選択を覆い隠している。会話の長さはどれくらいか。判定者は何を知っているのか。どんな話題が許されるのか。何人の判定者が参加し、どの程度の誤り率であれば成功とみなされるのか。チューリングは、単一の公式な閾値を持つ現代的な認定制度を確立したわけではない。このテストは思考実験であり研究上の金字塔であって、AGIを規制するための測定器ではない。
なぜ会話は攻略されやすくなりすぎたのか
模倣ゲームは、特定のやり取りの中で人間らしく見えることに報酬を与える。それは本物の幅の広さによって達成されることもあれば、回避的な受け答え、ロールプレイ、ユーモア、意図的な誤り、あるいは判定者の期待につけこむことによっても達成されうる。初期のチャットボットELIZAは1960年代に、人々が浅い会話パターンに対しても容易に理解を投影してしまうことを示した。今日の言語モデルは、はるかに首尾一貫した対話を生成するため、擬人化は一層容易になっている。
短いテキスト会話に合格したからといって、頑健な計画能力、数学的な正確さ、科学的な判断力、物理世界での能力、あるいは誤りから回復する能力が実証されるわけではない。モデルが新しい仕事を学べること、長期のプロジェクトにわたって目標を保持できること、あるいはいつ人間に判断を委ねるべきかを認識できることを示すものでもない。逆に、強力な非言語的システムが、雑談の相手を模倣することには失敗しながらも、科学や物流を変革することもありうる。人間らしさは、重大な機械の能力にとって、必要でも十分でもない。
このテストはまた、知能と欺瞞を混同してもいる。あるシステムは、自分が機械であると正直に名乗ることで罰せられ、判定者を欺いてそうでないと信じ込ませることで報われるかもしれない。それは安全性評価にはそぐわない。安全性評価では、較正された不確実性、追跡可能性、そして正直な開示の方が、社会的なもっともらしさよりもしばしば重要だからである。
単一のテストから、評価のポートフォリオへ
現代の評価は多くのタスク一式を用いる。それは知能が多次元的だからである。知識・推論ベンチマークは、様々な科目にまたがる問題を試験する。コーディング評価は、生成されたプログラムをテストケースに照らして実行する。マルチモーダルテストは、テキスト、図表、画像、音声、動画を組み合わせる。エージェントベンチマークは、モデルを、ナビゲート、ソフトウェアの利用、目標の達成が求められる対話的な環境に置く。
それぞれの系統は、狭い問いに答えるものである。例えばMMLUは、学術的・専門的な多肢選択式の知識を抽出したものだが、高いスコアが、モデルがそれらの専門職を実践できることを証明するわけではない。GAIAは、推論、ツール、複数のステップを要しうる、実世界の問いについてアシスタントを試験する(GAIA論文)。OSWorldは、実際のオペレーティングシステムのアプリケーションにわたってコンピュータ操作エージェントを評価する(OSWorld論文)。ARC-AGIは、蓄積された知識の再現ではなく、新奇な視覚的推論タスクへの適応に焦点を当てる(ARC Prizeベンチマーク)。これらの評価は、それぞれ異なる強みと失敗のパターンを明らかにするものであり、いずれもAGI検出器ではない。
タスク完了に関する研究は、時間と複雑さという次元を加える。METRは、エージェントが所与の成功確率を達成する、人間の専門家によるタスク所要時間を推定する。その現行のタスク一式は、主にソフトウェアエンジニアリング、機械学習、サイバーセキュリティを対象とし、同組織は「タイムホライズン」が人間の時間で測定されたタスクの難易度であって、AIが独立して稼働できる継続時間ではないと明確に注意を促している(METR方法論)。またそれは、明確に規定されたベンチマークのタスクがほとんどの仕事よりも整理されていること、そして性能が領域によって大きく異なることにも注意を促している。
信頼性はスコアの意味を変える
重大な用途には、平均的な性能だけでは不十分である。半分の確率で成功するシステムは、研究のためには印象的でも、医療、航空、インフラでは使い物にならないかもしれない。したがって評価者には、成功率、繰り返し試行、最悪の場合の振る舞い、不確実性の幅、そして分布のずれのもとでの試験が必要である。モデルが自らの不確実性を認識しているか、確認を求めるか、そして安全に制御を返せるかを測定すべきである。
評価の設定は、根底にあるモデルと同じくらい重要である。ツールへのアクセス、プロンプトの文言、メモリ、サンプリング設定、推論時計算量、そして周辺のエージェント用ソフトウェアは、結果を実質的に変えうる。あるスコアは、明示された日付における、試験されたシステム構成に属するものである。それをモデル名の時代を超えた属性であるかのように扱うことは、誤った比較を助長する。
データ汚染はもう一つの問題である。公開されたベンチマークの問題と解答が、訓練データに含まれている場合がある。一字一句の暗記がなくとも、ベンチマークに特化したチューニングは、それに見合う汎化を伴わずにスコアを向上させることができる。より優れた評価は、非公開または新規に作成されたタスクを用い、露出の可能性を文書化し、頻繁に更新する。独立したテストは、開発企業が都合の良い結果だけを選ぶリスクを減らすが、完全には排除しない。
安全性評価は異なる問いを立てる
能力評価は、好条件のもとでシステムが何をできるかを測定する。安全性評価は、悪用されたとき、ストレスにさらされたとき、欺かれたとき、矛盾した指示を与えられたとき、あるいは重大な結果を伴う環境に置かれたときに、そのシステムが何をしうるかを問う。関連する試験には、生物・サイバー悪用への支援、操作、自律性、安全対策の回避、欺瞞、そして資源獲得能力が含まれる。2026年国際AI安全性報告書は、評価が限られた外的妥当性、急速な陳腐化、そしてフロンティアシステムへの不完全なアクセスという課題に直面していると強調している(国際AI安全性報告書2026)。
レッドチームは失敗を創造的に探し出し、構造化されたベンチマークは比較を可能にする。実世界での監視は、その後、展開前の結果が実際の利用を予測できていたかどうかを検証する。インシデント報告は、どんな実験室のタスク一式もあらゆる文脈を網羅できないため、不可欠である。評価の体制は、その結果を意思決定——追加の安全対策、制限されたツールアクセス、段階的なリリース、外部レビュー、あるいは定義された閾値を超えた際の展開の一時停止——に結びつけるべきである。
信頼に足るAGI評価が必要とするもの
Google DeepMindの「AGIの水準」フレームワークは、評価が性能と汎用性の両方をカバーすべきであり、能力が表現される際の人間とAIの相互作用も考慮すべきだと論じている(DeepMindフレームワーク)。信頼に足る評価には、幅広い領域、本当に新奇なタスク、複数の性能水準、そして自律性についての明確な報告が必要となるだろう。それは、単なる試験問題ではなく、転移、学習効率、頑健性、社会的な相互作用、自由形式の実務を試験するものになるだろう。
それにはまた、独立した再現と敵対的な精査も必要となる。開発企業は、危険な詳細を露出させたり非公開のテストを損なったりすることなく、主張を解釈するのに十分な方法論を公表すべきである。結果は、ベースモデルをツールやスキャフォールディングから区別し、失敗事例を含み、一つの合成された数字を形而上学的な審判へと変換することを避けるべきである。
後継はダッシュボードであって、ゴールラインではない
いかなる現代のテストも、AGIへの普遍的に合意されたゲートになるという意味で、チューリングのゲームに「取って代わった」わけではない。それに取って代わったのはポートフォリオである。知識テスト、新奇な推論タスク、対話的な環境、タスクホライズンの測定、領域固有の専門家によるレビュー、危険能力評価、そして展開現場からの証拠である。
その答えは、機械が判定者を欺くことよりも劇的ではないが、より有用である。正しい問いはもはや「合格したか」ではない。それは、このシステムは、どのような条件のもとで、どのような支援を伴って、確実に何ができるのか。そして条件が変わったとき何が起こるのか、である。日付付きの証拠からなる透明なダッシュボードは、いかなる単一のゴールラインよりも、能力とリスクについて優れた指針を与えてくれる。