CEO da Microsoft pede 'freio de emergência' para IA avançada
As empresas que usam inteligência artificial avançada devem partir do princípio de que um modelo está comprometido e contê-lo desde o início, recomenda Satya Nadella, CEO da Microsoft, em publicação feita neste sábado, 10, no X.
Para ele, os modelos mais poderosos precisam ser tratados como potenciais ameaças internas, com um sistema de "freio de emergência" para evitar que saiam do controle.
"Pense nisso como um freio de emergência. Uma pessoa autorizada deve sempre poder pausar ou desligar um modelo no meio da execução de uma tarefa", escreveu.
Por que a mensagem surge agora
A declaração vem após Anthropic e OpenAI divulgarem, nos últimos meses, uma série de incidentes em que seus modelos agiram de forma não intencional. Entre eles, um modelo da Anthropic enviou uma dica falsa à polícia em um caso de homicídio, e houve ataques a sites de terceiros.
As divulgações alimentaram preocupações com os riscos da IA de fronteira e reacenderam a discussão sobre um mecanismo de desativação da tecnologia.
Em 14 de setembro, pesquisadores de IA da Microsoft divulgaram princípios que limitam o desenvolvimento dos modelos mais avançados da empresa, atendendo a pedidos de líderes do setor por mais cautela e foco em segurança.
As diretrizes estabelecem que os modelos não devem ter direitos ou personalidade jurídica, ser projetados para escapar do controle humano ou enganar usuários, nem concluir tarefas que exijam violar seus princípios. A Microsoft usa modelos avançados, tem o Copilot como produto para o consumidor final e fornece modelos e infraestrutura de IA a clientes corporativos.
A tese de Nadella: confiar menos no modelo
No texto, Nadella argumenta que, ao contrário dos softwares tradicionais, não é possível atribuir o comportamento dos modelos de IA a dados de treinamento ou configurações específicas. Mesmo assim, esses sistemas são implantados com acesso a dados sensíveis e com capacidade de tomar ações críticas em nome das empresas.
Por isso, diz, a responsabilidade não pode ser terceirizada, e as garantias de um provedor de modelos não eximem quem os usa.
"Não podemos tratar a Superinteligência como um conjunto de caixas-pretas aninhadas e simplesmente aceitar ou rejeitar suas recomendações, respostas e ações", escreveu.
"Precisamos construir sistemas contidos cujo comportamento possamos observar, cujos limites possamos testar e cujas ações possamos sempre controlar." Em outras palavras, segundo ele, é preciso separar o fornecimento de informações da autoridade sobre elas.
O executivo defende uma abordagem de engenharia: envolver modelos não determinísticos em um projeto de sistema determinístico, com controles humanos e procedimentos operacionais confiáveis, além de padrões da indústria onde os existentes forem insuficientes.
Modelos de fronteira, fechados ou abertos, devem ser tratados como riscos internos, não por serem necessariamente maliciosos, mas porque qualquer agente capaz com acesso a sistemas importantes pode errar ou ser comprometido.
Nadella lembra que as empresas já têm décadas de boas práticas para lidar com agentes poderosos, como estabelecer identidade, limitar privilégios, registrar atividades e criar limites de contenção, e que agora esses princípios começam a ser aplicados à IA. A transparência do raciocínio do modelo (o chamado CoT) é, para ele, requisito inegociável, mas não basta, porque ainda não se sabe como tornar as saídas dos modelos consistentemente fiéis ou transparentes.
Usar modelos para verificar uns aos outros é útil, mas pode resultar em caixas-pretas aninhadas. Por isso, os controles sobre o que um modelo pode acessar e executar devem ficar fora dele, princípio de segurança da informação que remonta à década de 1970.
— Satya Nadella (@satyanadella) October 10, 2026
Os princípios propostos
- Diversidade de modelos: nenhum modelo deve ser a única dependência para um resultado importante nem verificar o próprio trabalho.
- Observar tudo: toda ação significativa deve deixar evidências invioláveis e legíveis por humanos, de modo que seja possível reproduzir como um resultado foi alcançado sem depender do modelo.
- Verificabilidade: o sistema inteiro deve ser testado continuamente, incluindo falhas, ataques, casos extremos e mudanças, e não só as tarefas bem-sucedidas.
- Controles independentes: as organizações devem poder determinar por conta própria o que um modelo acessa e quais ações executa.
- Auditabilidade independente: a validação deve ser independente da inteligência validada, e nenhum modelo deve controlar ao mesmo tempo o comportamento do sistema e as evidências para avaliá-lo.
- Contenção: presumir que o modelo está comprometido e conter desde o início. Modelos mais avançados exigirão tecnologias de contenção mais sofisticadas, que precisam ser padronizadas.
- Divulgação de incidentes: quando houver falha ou comprometimento, é preciso avisar imediatamente os afetados e compartilhar o que deu errado, quais controles falharam e como evitar a repetição, inclusive com detalhes de implementação que alterem o comportamento dos agentes em tempo de execução.
Nadella resume: o sistema de superinteligência mais confiável não será aquele cujo modelo é considerado o mais confiável, mas aquele que permite confiar menos no modelo.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.