04 回避策
実際に存在する出口
技術的・制度的な統制は、第02章で扱った深刻なシナリオが起こりやすくなるか起こりにくくなるかを左右する。家庭レベルの備えは、それらの代わりにはならない。
技術的な安全レバー
- 解釈可能性研究。 モデルの内部表現や計算過程を検査することは、行動評価、アクセス制御、展開後のモニタリングを補完する一つの手段である。
- 拡張可能な監督。 ディベート、再帰的な報酬モデリング、弱から強への汎化といった手法は、能力の劣る監督者がより高い能力を持つシステムを監督する助けとなることを目指している。
- 是正可能性の研究。 システムが正当な是正、修正、停止に対して受容的であり続けられるかを研究する分野であり、規模に対して頑健な解決策はまだ実証されていない。
- 計算資源のガバナンス。 法域ごとの輸出管理、インフラのモニタリング、そして能力の不完全な代理指標として用いられる閾値であり、AGIや安全性そのものの定義ではない。
Anthropicの最高経営責任者は、2025年に発表したこのテーマに関するエッセイの中で、これらのうち最初の項目について論を展開した。
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
制度的なレバー
国際的な協調が重要なのは、一方的な統制が、安全性へのインセンティブと 競争上の立場の両方を変えうるからである。政策の状況はもはや完全に任意 ではない。EU AI法は対象となる提供者に拘束力のある義務を課す一方、各 ラボの安全枠組みやサミットでの合意は依然として大部分が任意にとどまっ ている。最先端モデルに関する拘束力のある世界的な軍備管理条約は、現時 点では存在しない。
国際的な取り組みの初期の出発点となったのは、第1回世界AI安全サミットで28か国とEUが支持した、拘束力のない宣言である。
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- 無制限な公開の前に、危険な能力についてリスクに見合った事前評価を行う。
- 規制当局と開発者が、重大な失敗やニアミスから学べるようなインシデント報告の仕組み。
- 統制、認識、因果関係、そして被害を防ぐ能力を考慮した責任ルール。
個々の技術者にできること
読者は、有権者、労働者、研究者、顧客、投資家、そして市民団体の一員として、 政策に影響を与えることができる。実践的な選択肢としては、解釈可能性研究 やアライメント研究に貢献または資金提供すること、実運用でAIシステムを 展開しているのであれば自分の組織内で安全な実務を推進すること、上記の 報告・評価の仕組みを規制上の摩擦としてではなく支援すること、そして説得 力のある主張の背後にある出典と証拠を、自動化された操作あるいは本物の 合意のどちらかだと決めつける前に確認することが挙げられる。