最も重要な結果は「幅」そのものである
高い能力を持つAI、あるいは人間レベルのAIについての予測は、数年から数十年に及ぶ幅を持ち、現在の手法ではそもそもそれを生み出せないと疑う研究者もいる。この意見の相違は、共有された科学モデルの周りにあるわずかな誤差の範囲ではない。予測者たちは、何がAGIとみなされるのか、どのような技術的なステップが残されているのか、計算資源やデータといった投入資源がどれだけ速く増加しうるのか、そして進歩がなめらかに続くのかどうかについて、意見が一致していない。したがって、いかなる到来時期も、「AGIカウントダウン」としてではなく、明示された定義のもとでの日付付きの予測として提示されるべきである。
デミス・ハサビス氏の例は、正確な帰属がなぜ重要なのかを示す好例である。2025年3月のCNBCのインタビューで、Google DeepMindの最高経営責任者は、人間レベルのAIは5年から10年で到来しうると述べた。彼は、AGIの意味のある証拠が「1年以内」に到来するとは述べていない(CNBCインタビュー)。正確に引用された予測であってさえ、疑問は残る。どのタスクにおいて人間レベルなのか、どれほどの信頼性を伴うのか、どれほどの自律性を伴うのか。この発言は、一人の専門家の判断を記録したものであって、測定された確率ではない。
混同すべきではない4種類の予測
研究所トップの発言は目に見えやすく、フロンティアシステムへの直接的な接触に基づいているが、中立的な測定ではない。経営者たちは実験についての貴重な非公開情報を持つ一方で、資本、人材、顧客、そして政治的な注目を奪い合う組織を率いてもいる。彼らの発言は、企業固有の定義を用いていることがあり、完全な予測モデルを開示することはめったにない。
研究者調査は多くの意見を集約し、専門家の意見の分布を明らかにする。2024年に発表された「2023年AI進捗に関する専門家調査」は2778人の研究者を集め、機械があらゆる可能なタスクで人間を上回るまでの見積もりに広い幅があると報告した。著者らはまた、意見の大きな相違と、質問の言い回しへの感度も強調している(Grace et al., 2024)。調査は、ある時点における信念を記述する。それらの信念を検証するものでも、回答者が同じ定義を共有していることを保証するものでもない。
予測プラットフォーム(Metaculusなど)は、予測を継続的に集約する。その中央値は調査よりも速く更新されうるが、結果は正確な決着基準と参加者集団に左右される。「弱い汎用AI」「変革的AI」「AGI」は、それぞれ異なる問いである。市場やコミュニティの中央値は、サイト全体の締め切りへと変えてしまうのではなく、取得日、質問の文言、範囲、決着条件とともに提示されるべきである。
モデルに基づく予測は、計算資源、ベンチマーク性能、アルゴリズムの効率、あるいはエージェントが完了できるタスクの長さの傾向を外挿する。これらは前提を可視化するという点で価値があるが、ベンチマークが飽和したり、資源制約が効いてきたり、新しいパラダイムが傾向を変えたりすると、外挿は失敗しうる。曲線とは過去の測定についての証拠であり、その延長は条件付きの予測である。
現在の能力の傾向が実際に示していること
急速な向上を示す本物の証拠は存在する。スタンフォードAIインデックスは、推論コストの低下と、要求水準の高いベンチマークでのスコア上昇を記録する一方、困難な評価は依然として未解決であり、責任あるAIの標準化された評価にはむらがあることも示している(スタンフォードAIインデックス2025)。METRは、フロンティアエージェントが所与の成功確率で完了できるソフトウェア関連タスクの、人間の専門家による所要時間が急速に伸びていると報告している(METRタイムホライズン)。これらは、選ばれたシステムとテストについての観測結果であり、迫りくるAGIの到来日を直接観測したものではない。
METRの指標は特に誤って伝えられやすい。数時間という50%のタイムホライズンとは、METRのタスク一式において、当てはめられたモデルが、人間の専門家がそれだけの時間を要するタスクを完了させる確率を50%と予測していることを意味する。それは、AIがその時間数だけ自律的に稼働することを意味するのではない。これらのタスクは主にソフトウェアエンジニアリング、機械学習、サイバーセキュリティに関するものであり、通常よりも自己完結的で客観的に採点可能であり、16時間を超える見積もりは現在のところ信頼できないとされており、そして実際の仕事ははるかに雑然としている。METRの研究者たちは、誤差の幅がおよそ2倍の範囲に及ぶことがあり、領域間の差は桁違いになりうると警告している(METR限界に関する注記)。
これらの結果は、より狭い結論を裏づける。すなわち、ある種のデジタルタスクの完了能力は急速に向上している、ということだ。それ自体は、あるシステムがいつ信頼できる科学者、経営者、介護者、政治的意思決定者、あるいは人間の労働の一般的な代替者になるのかを確定するものではない。
なぜ理にかなった予測でも意見が分かれるのか
早期の到来を見込む予測者は、しばしばスケーリングの持続性、より優れた推論時計算量、合成データ、ツール利用、AI支援の研究といった要素を強調する。これらの傾向が互いに強め合うのであれば、進歩は加速するかもしれない。彼らはまた、経済的に変革的なシステムが人間の知能のあらゆる特徴を再現する必要はなく、幅広いデジタル上の能力だけで十分かもしれない、とも主張する。
より遠い到来時期を見込む予測者は、信頼性、現実世界への接地、継続学習、因果的理解、ロボット工学、そしてベンチマークと自由形式の実務との間のギャップを強調する。彼らはまた、エネルギー、チップ、データセンターの建設、高品質なデータ、評価、そして組織がシステムを安全に展開する能力といった、実務上の制約も指摘する。中には、現行の大規模モデル手法を超えたアーキテクチャ上の進歩を見込む者もいる。これらの立場のいずれも、自信や年功だけで決着をつけることはできない。
定義もまた、見かけ上の意見の相違を生むもう一つの原因である。リモートでのコンピュータ作業の多くを自動化できるシステムは、身体を伴うタスクでは失敗しながらも、経済的には変革的でありうる。幅広い試験問題群で平均的な人間を上回るスコアを取るモデルでも、独立して稼働するには依然として信頼性が低すぎるかもしれない。ある予測者はどちらのシステムもAGIと呼ぶかもしれないし、別の予測者は、現実世界における頑健で人間と同等の学習能力にこそ、その言葉を取っておくかもしれない。
責任ある到来時期トラッカーを維持する方法
有用なトラッカーは、原文の言い回し、発言者、日付、出典、定義、予測の範囲を保存しておくべきである。個人的な見積もりと組織的なコミットメントを区別し、後の改訂を記録し、古い予測をひそかに置き換えるべきではない。集約された予測は、中央値だけでなく不確実性の幅も示すべきである。そのページはまた、潜在的なインセンティブと、その予測が公開情報と非公開情報のどちらに依拠しているかも開示すべきである。
読者は次の5つの問いを当てはめることができる。
- 何が予測されているのか。 AGIか、人間レベルのAIか、タスクの自動化か、それとも超知能か。
- どのような確率と日付が付随しているか。 「かもしれない」は中央値の予測ではない。
- その見積もりを支える証拠は何か。 スケーリングか、調査か、非公開の実験か、それとも直感か。
- 何が予測者の考えを変えるだろうか。 反証の可能性のない予測は評価が難しい。
- それは採点されたことがあるか。 過去の予測は、その期限を過ぎた後も見える状態に残しておくべきである。
実務的な結論
計画は、一つの日付を選ぶことに依存すべきではない。目下の害と機会は、AGIが2028年に到来しようと、2040年に到来しようと、あるいは永遠に到来しなくとも、対応に値する。政府と組織は、シナリオの幅を活用できる。急速な能力向上に備え、より緩やかな進歩のもとでも有用であり続ける政策を構築し、より強力な安全対策を発動させる測定可能な引き金を定義するのである。
この不確実性そのものが、行動の指針となる。それは、マーケティング上のラベルではなく能力を監視すること、評価とレジリエンスに投資すること、そして定期的なスケジュールで予測を見直すことを裏づける。到来時期のページが信頼を勝ち得るのは、動く中央値を運命へのカウントダウン時計であるかのように見せることによってではなく、その日付がどれほど証明できていないかを示すことによってである。