04 Voies de sortie
Les voies de sortie qui existent réellement
Les contrôles techniques et institutionnels déterminent si les scénarios graves du chapitre 02 deviennent plus ou moins probables ; la préparation domestique ne peut pas s'y substituer.
Leviers techniques de sécurité
- Recherche en interprétabilité. Inspecter les représentations internes et le calcul interne des modèles, en complément des évaluations comportementales, des contrôles d'accès et de la surveillance du déploiement.
- Supervision évolutive. Des techniques — débat, modélisation récursive de la récompense, généralisation du faible vers le fort — destinées à aider des superviseurs moins capables à superviser des systèmes plus capables.
- Recherche en corrigibilité. Étudier comment les systèmes pourraient rester réceptifs à une correction, une modification et un arrêt légitimes ; aucune solution robuste à l'échelle n'a été démontrée.
- Gouvernance du calcul. Des contrôles à l'exportation propres à chaque juridiction, une surveillance de l'infrastructure et des seuils utilisés comme indicateurs imparfaits de la capacité — non comme une définition de l'AGI ou de la sécurité.
Le directeur général d'Anthropic a défendu le premier de ces points dans son essai de 2025 sur le sujet :
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
Leviers institutionnels
La coordination internationale compte, car des contrôles unilatéraux peuvent modifier à la fois les incitations à la sécurité et la position concurrentielle. Le paysage réglementaire n'est plus entièrement volontaire : la loi européenne sur l'IA impose des obligations contraignantes aux fournisseurs relevant de son champ d'application, tandis que les cadres de sécurité des laboratoires et les engagements pris lors des sommets demeurent largement volontaires. Aucun traité contraignant de contrôle des armements à l'échelle mondiale portant sur les modèles de pointe n'existe actuellement.
Un premier point de départ international a été la déclaration non contraignante approuvée par 28 pays et l'UE lors du premier sommet mondial sur la sécurité de l'IA :
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- Une évaluation préalable au déploiement, proportionnée au risque, des capacités dangereuses avant une diffusion sans restriction.
- Un signalement des incidents permettant aux régulateurs et aux développeurs de tirer les leçons des défaillances graves et des incidents évités de justesse.
- Des règles de responsabilité qui tiennent compte du contrôle, de la connaissance, de la causalité et de la capacité à prévenir le préjudice.
Ce qu'un technologue peut faire à titre individuel
Les lecteurs peuvent influencer la politique en tant qu'électeurs, travailleurs, chercheurs, clients, investisseurs et membres d'organisations civiques. Parmi les options concrètes : contribuer à la recherche en interprétabilité et en alignement, ou la financer ; promouvoir des pratiques de sécurité au sein de votre propre organisation si vous déployez des systèmes d'IA en production ; soutenir l'infrastructure de signalement et d'évaluation décrite ci-dessus plutôt que de la considérer comme une contrainte réglementaire ; et vérifier la source et les preuves derrière des affirmations persuasives plutôt que de présumer soit une manipulation automatisée, soit un consensus authentique.