しばしば混同される2つの意味
AIの能力が「創発的」であるといわれるとき、そこには少なくとも2つの意味がある。広い意味では、モデルが、明示的でタスク特化型の訓練目標ではなかった有用な振る舞いを示すことを指す。主にトークン予測のために訓練された言語モデルが、翻訳をしたり、コードを書いたり、法律を要約したり、いくつかの算数の問題を解いたりすることがある。こうした能力が生じるのは、訓練データと訓練目標が、再利用可能な内部パターンに報酬を与えているためである。
より強い意味では、創発とは、スケールが増加するにつれて能力が突発的に現れることを指す。小さいモデルでは失敗するが、大きいモデルでは突然成功するようになる、というものだ。広く議論を呼んだ2022年の論文は、複数のモデルファミリーとタスクにわたって、こうした飛躍の例を報告した(Wei et al., 2022)。この区別は重要である。計画されていなかった能力が存在すること自体はよく確立されているが、測定されたある能力が本当に不連続な変化を遂げたのかどうかは、指標、データ、サンプリングの仕方に左右される。
どちらの意味も、意識、意図、あるいは魔法を含意するものではない。複雑なシステムは、設計者があらゆる用途向けにモジュールを書かなくても、汎用的な表現を獲得することができる。科学的な問いは、訓練とシステム設計によって振る舞いがどう変化するのか、そしてそれをどれだけ予測できるのか、である。
一部の飛躍が測定上の産物である理由
あるモデルの算数の正答率が、20%、30%、40%と徐々に上昇していくとしよう。正答率が35%を超えたときにのみ1点を与えるベンチマークでは、結果はゼロ、ゼロ、そして1、と表示される——これは採点方式が生み出した不連続性である。同じ効果は、完全一致方式の採点がほぼ正解に近い答えに何の得点も与えない場合や、あるタスクが複数の部分技能を要求し、そのうちどれか一つでも欠けていれば失敗と判定される場合にも起こる。
シェーファー、ミランダ、コエジョは、報告済みの事例を再分析し、連続的で非線形、あるいは誤差に敏感な指標で測定すると、多くの突発的な変化がなめらかになることを示した(「大規模言語モデルの創発的能力は蜃気楼か?」)。これは、本物の不連続性が決して起こらないことを証明するものではない。それが示しているのは、指標の効果、サンプリングの粗さ、モデルファミリー間の違いを排除しない限り、ベンチマークのグラフだけでは不連続性の存在を証明できない、ということである。
またスケールだけが変化する変数というわけでもない。より大きなモデルは、異なるデータ、訓練レシピ、トークナイザー、指示チューニング、ツール、推論予算を使っている場合がある。名の知られた製品どうしを比較することは、システムレベルのエンジニアリング上の改善を、純粋なパラメータの閾値と取り違えてしまうおそれがある。研究者がそのメカニズムを特定するには、制御されたスケーリング系列、密なチェックポイント、そして複数の指標が必要である。
それでも予測が本当に難しいこと
なめらかな基盤的向上であっても、重大な閾値を生み出すことがある。成功率が40%から60%へと移行するサイバーエージェントは、展開が経済的に見合うようになる転換点を越えるかもしれない。個々には弱い部分技能どうしを結びつけるモデルの能力が、あるワークフローを可能にすることもある。外部のシステムは小さな向上を増幅しうる。ツールは行動の手段を提供し、メモリは文脈を拡張し、繰り返しのサンプリングは成功する答えを見つけ出す。
開発企業もまた、あらゆる可能なタスクを網羅的に試験することはできない。モデルは幅広いデータで訓練され、何百万人ものユーザーに展開され、評価者が想像もしなかった応用法や失敗を発見していく。したがって、ある能力は、たとえそれが徐々に発達したものであっても、研究所にとっては驚きとなりうる。この驚きは、数学的に鋭い相転移というよりも、限られた測定範囲を反映しているのかもしれないが、それでも実務上は重要である。
2026年国際AI安全性報告書は、フロンティア評価が限られた外的妥当性しか持たない場合があり、システムやスキャフォールドが変化するにつれて急速に陳腐化しうると強調している(国際AI安全性報告書2026)。これは実務上の不確実性についての主張であって、懸念されているあらゆる振る舞いが自然発生的に現れるという証拠ではない。
能力は性向ではない
モデルは、意図的にプロンプトを与えられればある行動を取ることができても、自発的にその行動を取りやすいとは限らない。安全性の分析は、能力——システムが何かをできるかどうか——と、性向——関連する状況下でそれをする傾向があるかどうか——を区別すべきである。ロールプレイの中で欺瞞的な計画を生成できるモデルだからといって、それが展開時に欺瞞を追求することが示されたわけではない。逆に、測定された性向が低いことは、適切な引き金を作り出せなかった評価を反映しているだけかもしれない。
同じ区別は、状況認識、安全対策の回避、自己保存、戦略的な振る舞いにも当てはまる。これらは活発な研究テーマであり、脅威モデルの構成要素になりうるものである。翻訳や算数ができるようになったからというだけの理由で、これらも必ず現れる運命にあると言うのは不正確である。証拠は、試験されたモデル、プロンプト、環境、頻度、そして代替的な説明を明示すべきである。
擬人化された言葉づかいは、混乱を助長する。モデルは、訓練データに似た言葉が含まれているから、あるいはそのやり取りがあるペルソナに報酬を与えるから、生き延びたいという主張を生成することがある。そうしたテキストは調査に値する振る舞いではあるが、安定した内的目標への直接的なアクセスではない。動機についての主張には、一回の会話からの引用よりも強い証拠が必要である。
創発がなお安全性に関わる理由
妥当な安全性の教訓は、「何でも突然起こりうる」ということではない。それは、幅広い訓練が、設計者が明示的に列挙する以上の振る舞いを生み出すということ、そして現在の評価はそれを不完全にしかカバーしていないということである。これは、段階的なテスト、監視、多層防御を正当化する。同時に、あるベンチマークで見られなかったからといって、あらゆるスキャフォールドやプロンプトのもとでも見られないと想定することへの警告でもある。
評価は訓練の最中から始め、チェックポイントを使って最終的な実行の前に傾向を測定すべきである。チームは、サイバー、生物学的支援、説得、自律性、モデル制御に関するリスクについて評価一式を維持しつつ、予期しない振る舞いを見つけるための自由形式のレッドチーミングを加えることができる。非公開のテストは汚染を減らし、外部評価者は組織的な死角を減らす。展開後のインシデント報告は、実験室でのタスクでは見落とされる失敗を捉える。
閾値に基づく方針は、創発について哲学的な合意を必要とせず、実証された能力に対応すべきである。あるシステムが重大な害への障壁を実質的に下げられるのであれば、その曲線がなめらかであったか突発的であったかにかかわらず、関連する安全対策を適用すべきである。証拠が弱い場合、報告は仮説的な振る舞いをひそかに観測済みのものとして扱うのではなく、不確実性を明示すべきである。
予測可能性には層がある
モデルの性質の中には、他よりも予測しやすいものがある。あるデータ分布全体での集計された損失は、しばしばなめらかなスケーリング則に従ってきた。安定したベンチマークでの性能は、限られた範囲内であれば予測可能かもしれない。混沌とした環境での成功は、モデル化がより難しいツール、信頼性、相互作用に左右される。社会的な影響は、普及、インセンティブ、制度、敵対者といった要素を加えるため、さらに予測が難しくなる。
この階層構造は、よくある推論の誤りを防いでくれる。予測可能な訓練損失があるからといって、下流のあらゆる能力が予測可能になるわけではない。しかし驚くべき下流の振る舞いがあるからといって、スケーリング則が無効になるわけでもない。研究者は、稀な失敗や特定のタスクについては不確実なままでも、平均値を予測することができる。
解釈可能性は、振る舞いとして明確に現れる前に表現やメカニズムを明らかにすることで、いずれ予測を改善するかもしれない。しかし今日のところ、解釈可能性の手法は、モデルが「知っている」ことや行うであろうことの完全な読み取りではなく、部分的な証拠を提供するにとどまる。振る舞いに基づく評価と、実世界での管理は依然として必要である。
創発の主張をどう読むか
比較の対象の間で何が変わったのかを問おう。パラメータ、計算資源、データ、訓練目標、ツール、それともプロンプトなのか。指標が連続的かどうか、中間的なチェックポイントが存在するかどうか、そして不確実性の幅が重なっているかどうかを確認しよう。そのタスクが訓練データに含まれていたかどうか、独立した研究者がその結果を再現したかどうかを確認しよう。何より重要なのは、「著者にとって予想外だった」ことと「科学的に不連続だった」ことを区別することである。
創発的能力は、慎重に使えば有用な概念である。幅広く訓練されたモデルは、エンジニアが一つひとつ指定したわけではない能力を確かに獲得する。一部の能力は、システムが実用上の閾値を越えて初めて目に見えるようになる。しかし、有名な「崖」の多くは、部分的には、振る舞いをどう採点するかの産物である。正確な結論は、創発が幻想であるというものでも、スケールがどんな能力でも予測不可能に呼び出すというものでもない。それは、能力の発達はまだ部分的にしか理解されておらず、測定の選択が重要であり、安全性の方針は緩やかな変化にも驚くべき変化にも頑健であるべきだ、というものである。