Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI O informe de sobrevivência humana
PT

04 Vias de escape

As vias de escape que realmente existem

Controles técnicos e institucionais determinam se os cenários graves do capítulo 02 se tornam mais ou menos prováveis; a preparação doméstica não pode substituí-los.

Written by
Dwight Ringdahl
Sources
2 cited

Alavancas técnicas de segurança

  • Pesquisa em interpretabilidade. Inspecionar as representações internas do modelo e sua computação interna como um complemento às avaliações comportamentais, aos controles de acesso e ao monitoramento da implantação.
  • Supervisão escalável. Técnicas — debate, modelagem recursiva de recompensa, generalização de fraco para forte — destinadas a ajudar supervisores menos capazes a fiscalizar sistemas mais capazes.
  • Pesquisa em corrigibilidade. Estudar como os sistemas poderiam permanecer receptivos a correção, modificação e desligamento legítimos; nenhuma solução robusta em escala foi demonstrada até agora.
  • Governança de computação. Controles de exportação específicos por jurisdição, monitoramento de infraestrutura e limiares usados como indicadores imperfeitos de capacidade — não como uma definição de AGI ou de segurança.

O diretor-executivo da Anthropic defendeu a primeira dessas alavancas em seu ensaio de 2025 sobre o tema:

Summarized position

Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.

Dario Amodei, CEO, Anthropic
The Urgency of Interpretability, Primary source

Alavancas institucionais

O problema da coordenação

A coordenação internacional importa porque controles unilaterais podem alterar tanto os incentivos à segurança quanto a posição competitiva. O panorama regulatório já não é inteiramente voluntário: o AI Act da União Europeia impõe deveres vinculantes aos provedores dentro de seu escopo, enquanto os marcos de segurança dos laboratórios e os compromissos assumidos em cúpulas permanecem majoritariamente voluntários. Atualmente não existe nenhum tratado global vinculante de controle de armamentos para modelos de fronteira.

Um ponto de partida internacional inicial foi a declaração não vinculante endossada por 28 países e pela União Europeia na primeira cúpula global de segurança da IA:

Summarized position

28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.

28 nations and the European Union, The Bletchley Declaration, AI Safety Summit
GOV.UK, Signed statement
  • Avaliação pré-implantação proporcional ao risco para capacidades perigosas antes do lançamento irrestrito.
  • Relato de incidentes que permite que reguladores e desenvolvedores aprendam com falhas graves e quase-acidentes.
  • Regras de responsabilização que levem em conta o controle, o conhecimento, a causalidade e a capacidade de prevenir danos.

O que um profissional de tecnologia individual pode fazer

Os leitores podem influenciar as políticas públicas como eleitores, trabalhadores, pesquisadores, clientes, investidores e membros de organizações civis. Opções práticas incluem contribuir para, ou financiar, pesquisas em interpretabilidade e alinhamento; promover práticas de segurança dentro da própria organização, caso você implante sistemas de IA em produção; apoiar a infraestrutura de relato e avaliação descrita acima em vez de tratá-la como um entrave regulatório; e verificar a fonte e as evidências por trás de afirmações persuasivas, em vez de presumir manipulação automatizada ou consenso genuíno.

Pesquisa Política pública Organizacional

Type to search the manual.

navigate open esc close