本ページが存在する理由
本マニュアルの大部分は、楽観論者が正しかった場合に何が起こるかを扱っているため、AGIリスクを真剣に受け止める方向に傾いている。その姿勢は、懐疑派を「彼らはスケーリングを理解していないだけだ」という藁人形に単純化して片づけてしまいやすくする。それは、この分野の基盤的なツールの一部を築いた研究者たちが抱く、実質的な立場に対する不当な扱いである。本ページは、負けるように仕組まれたバージョンではなく、彼らの実際の主張を、どちらが正しいかを審判することなく紹介する。意見の幅が通常どのように報じられているかについてはAGIに関する主張の見極め方とAGI到来時期の予測を参照してほしい。
ヤン・ルカン:世界モデルもなければ、計画もない
ヤン・ルカンは、FAIR研究所の設立を含む12年間の在籍を経て、2025年11月にMetaを去り、2026年3月までにはパリを拠点とするスタートアップAMI Labsの共同創業者兼執行会長となっていた。同社は、彼が「世界モデル」と呼ぶものを構築するために、報じられている限り欧州のスタートアップとして史上最大となる10億3000万ドルのシード資金を調達した(TechCrunch)。これは重要である。ルカンの懐疑論は、単なる留保として和らぐのではなく、自らのキャリアを賭ける会社へと硬化したのだ。
ルカンの異議はアーキテクチャ上の議論であり、Transformerには計画ができないと証明する定理ではない。標準的な自己回帰モデルは、明示的で持続的な世界モデルや独立したプランナーを持たずにトークンを予測する。モデルの各パスは固定された計算グラフを使うが、より大きなシステムは追加のトークンを生成、評価、修正することで推論時の計算量を増やせる。それによって結果は改善し得るが、現実に根差した長期計画能力が立証されるわけではない。
ルカンが代わりに提案するのは、もっともらしい未来状態を予測する構成可能な世界モデルと、複数の抽象度で行動を探索するアクターの組み合わせである(ルカンのポジションペーパー、Metaの研究概要)。これは彼が提案する研究の方向性であり、現在の言語モデルに何が永遠に不可能かについての確立した結論ではない。堅牢な自律知能には、テキストだけでなく、動画、空間、感覚運動の経験から学ぶアーキテクチャが必要だという賭けである。
アンドリュー・ン:証拠の基準を引き上げる
DeepLearning.AIの創業者であり、AI Fundのマネージング・ジェネラル・パートナー、スタンフォード大学客員教授でもあるアンドリュー・ンは、「AGIは、正確な意味を持つ用語というより、誇大宣伝の用語になってしまった」と主張し、トラックの運転から博士論文の執筆まで、人間ができるあらゆる知的タスクをこなせるシステムまで、業界はまだ数十年かかると論じている(PYMNTS)。彼の具体的な貢献は方法論的なものである。すなわち、審査員が複数日にわたる実際の業務試験——精選されたデモではなく実際のタスク——を設計し、熟練した人間と同程度の水準で機能して初めて合格とする、「チューリング・AGIテスト」の提案である。その狙いは、判断基準をリーダーボードのスコアから持続的な実務性能へと移し、彼が見るところのバブル的な誇大宣伝の危険性を鎮めることにある。
ゲアリー・マーカス:ハルシネーション、推論の崩壊、そして前提が積み重なることの算術
NYUの心理学・神経科学名誉教授であり、Geometric IntelligenceとRobust.AIの創業者でもあるゲアリー・マーカスは、複数の方面から論陣を張ってきた。信頼性については、LLMは「文字通り真偽の違いを知らない」とし、完璧なデータと無制限の計算資源が与えられてもハルシネーションを起こすという形式的な証明を引用する——それは、GPT-5(2025年8月)がハルシネーション問題を解決できず、OpenAIのo3が前身のモデルよりも多くハルシネーションを起こしたことで裏づけられた、と彼は言う(Marcus on AI)。推論については、「8枚の円盤のハノイの塔さえプレイできないシステムで物理学を解決することはできない」と述べ、Appleの発見——LLMの「推論」モデルは、複雑さがある閾値を超えると、緩やかに劣化するのではなく崩壊する——を引用している。
彼の最も広く議論を呼んだ介入は方法論的なものである。「AI 2027」という予測シナリオを「科学を装ったフィクション」として切り捨てるものだ——物語の手法を借用しながら、その結果があたかも予測であるかのように引用や脚注を提示している、というのである。マーカスはこのシナリオを、およそ8つの連続した「信仰の飛躍」的な節目に分解し、それぞれの暗黙の個別確率を掛け合わせることで、その全連鎖が予定通りに実現する複合確率がゼロに近いことを示す(Substack)——これは、予測分野自身の実績によっても裏づけられる。2024年に「解決済み」と宣言されたハルシネーション、2017年までに「至る所に」現れるはずだった無人運転車、といった具合だ。注目すべきは、マーカスは「AGIは不可能だ」と主張しているのではないということである。彼によれば、「AGIは不可能だと考える者」は、それが目前だと考える者と同じくらい間違っている——そして彼は今、実現しうる到来時期を2027年ではなく2100年に置いている。その立場そのものが、懐疑派の陣営が単一の立場ではなく幅を持つことの証拠である——これは到来時期の予測のページが、この分野全体について指摘している点でもある。
ティム・デットマーズ:計算は物理的である
アレン人工知能研究所の研究者であるティム・デットマーズは、モデルのアーキテクチャに依存しない議論を展開する——それは物理学についてのものである。GPUの1ドルあたりの性能は2018年頃に頭打ちになったと彼は主張し、それ以降の目に見える向上のほとんどは、本物の計算資源の増加というよりも、より低精度の数値演算——同じ算術をより安く行うこと——によるものだという。彼は、メモリ、I/O、電力の壁に突き当たるまで、「あと1年、多くて2年」ほどしかスケーリングの余地は残っていないと見積もる。その壁を越えると、能力の向上が線形にとどまる一方で、エネルギーとコストは指数関数的に増加する(timdettmers.com)。彼は「AGI」を、ベンチマークのスコアではなく、物理的なタスクにおいて経済的に意味のある能力を要するものと位置づけ、その論理を極限まで押し広げる。超知能であっても、自らの推論スタックを改善するにあたって同じ物理的制約に直面するだろう、というのである。上記の議論とは異なり、この議論はLLMについて具体的に正しいかどうかには依存しない——これは、あらゆるデジタル知能が動作する基盤についての主張である。
その他の顔ぶれ
より短い顔ぶれが、この主張を補強する。Robust.AIのCTOでありMITロボット工学名誉教授でもあるロドニー・ブルックスは、AI論者の間では珍しい規律として、日付付きで反証可能な予測のスコアカードを毎年公表しており、数十年にわたるロボット工学の経験から、狭いベンチマークでの進歩が汎用的な能力と繰り返し取り違えられていると論じる。ARC-AGIベンチマークの考案者フランソワ・ショレは、暗記への抵抗力を持つよう設計されたタスクでモデルがほぼゼロに近いスコアしか取れないこと——新しいARC-AGI-3では、2026年時点の最良のモデルでも人間の100%に対し1%未満のスコアだった——を、知能とはスケールではなく技能獲得の効率であることの証拠として挙げる。アリゾナ州立大学のスバラオ・カンバンパティは、プロンプトの与え方にかかわらずLLMは計画も自己検証もできないと論じ、今では思考の連鎖のトークンがそもそも本物の推論を表しているのかどうかにまで疑問を呈している。サンタフェ研究所のメラニー・ミッチェルは、LLMの成功は因果的推論ではなく、訓練分布に対するパターンマッチングを反映していると論じる。ワシントン大学の言語学者であり「Stochastic Parrots」の共著者であるエミリー・ベンダーは、流暢な出力とは根ざした理解を伴わない形式にすぎないと論じる。単語の並びを予測するよう訓練されたモデルは、伝達意図にアクセスする手段を持たない、というのである。
予測の方法論そのものが標的になっている
個々の研究者を超えて、懐疑派はAGIの到来時期がどのように作られるのかそのものに直接照準を合わせる。専門家調査の方法論には、よく文書化された「動く地平線」効果が見られる——回答者は、いつ尋ねられても、AGIをおおよそ15年から25年先に置く——これに選択効果と言い回しへの感度が重なる。2026年3月のRAND報告書は、調査、予測市場、計算資源からの外挿という各手法にわたって、こうした問題を体系的に整理している(RAND)。
METR自身の「タイムホライズン」指標——加速の証拠として最も頻繁に引用される能力曲線であり、到来時期の予測のページでも論じられているもの——は、METR自身を含む精査の対象にもなってきた。2026年1月の通知は、固定傾きのロジスティック回帰に35%の補正が適用されていること、タスク難易度の見積もりのおよそ3分の1が測定ではなく推定によるものであること、そしてMETR自身が、あるモデルの真のタイムホライズンが、報告している信頼区間の中に実際に収まっているかどうか「分からない」と述べていることを開示した(METR)。その数日前に発表された独立の批評はさらに踏み込んだ。タスクは非現実的なまでに整理されており、公開された解答がデータを汚染した可能性があり、人間のベースライン時間は、小規模で金銭的インセンティブを与えられたサンプルから得られたものであり、タスクに「本来かかるべき」時間を水増ししていた可能性が高い——これにより、AIの見かけ上の加速は、部分的には比較そのものの産物になっている、というのである(Transformer News)。いずれにせよ、この分野の到来時期に関する推論の大部分は、その著者自身が完全には保証できない、ノイズの多い一本の曲線フィットに再び値付けされているのである。
これは、より古い問題とも重なる。ベンチマークに対するグッドハートの法則の適用である。あるベンチマークが最適化の標的になると、研究所は、それが測ろうとしている構成概念そのものではなく、リーダーボードに向けてファインチューニングを行うようになる——MMLUは、2020年にはGPT-3が43点、人間のベースラインが90点だったのが、2024年半ばまでにはトップモデルが極めて僅差に密集し、その差はプロンプトの書式の違いによるノイズの範囲内に収まってしまった。ベンチマークの漏出による汚染は、スコアの上昇を本物の向上として読むことを一層難しくする。「ベンチマークを打ち負かす」ことと「AGIに到達する」ことがなぜ異なる主張なのかについては、AGIに関する主張の見極め方と能力のはしごを参照してほしい。
本ページが主張していないこと
これらのいずれも、AGIが不可能だという主張には至らず、上に挙げた研究者の誰一人としてそのような主張はしていない——マーカスは、両極端がともに間違っていると明言している。ここで確立されているのは、本物の実質である。スケールによって明らかに解消するわけではないアーキテクチャ上の限界、いかなるロードマップにも無頓着な物理的な計算資源の上限、そしてMETR自身が認めているように、誰もが引用する曲線を完全には保証できない予測装置、である。それが「まだ数十年先」を意味するのか、それとも「本ページが示唆するよりも近い」ことを意味するのかは、まさに本マニュアルが読者に代わって決着をつけることを控えている点である。本マニュアルがしないのは、懐疑派の主張を戯画にすることだけである。