OpenAI pausa testes de nova IA com medo de ela se rebelar

A OpenAI interrompeu parte das atividades internas de desenvolvimento de seu mais novo modelo de inteligência artificial, de codinome Astra, após avaliações de segurança identificarem avanços inesperados em suas capacidades cibernéticas. O sistema ainda não está disponível para o público ou para desenvolvedores externos e permanece em um ambiente de testes controlado. 

O alerta apareceu após o Astra apresentar uma evolução significativa em “codificação agêntica”, área em que modelos conseguem executar tarefas de programação com maior autonomia. Os resultados fizeram a OpenAI considerar a possibilidade de que o sistema tenha desenvolvido capacidades cibernéticas consideradas críticas. Por isso, a empresa desacelerou o cronograma de desenvolvimento enquanto trabalha na implementação de novas medidas de segurança.

OpenAI

Por que o Astra preocupa a OpenAI?

A avaliação segue os critérios estabelecidos pelo Preparedness Framework, estrutura criada pela OpenAI para acompanhar riscos associados ao avanço de seus modelos. Dentro desse protocolo, uma capacidade é considerada “crítica” quando a IA consegue identificar e desenvolver falhas de segurança de dia zero, que exploram vulnerabilidades ainda desconhecidas, em sistemas reais e protegidos sem intervenção humana.

O Astra também teria demonstrado potencial para elaborar e executar estratégias completas de ataques cibernéticos contra alvos complexos a partir de um objetivo de alto nível. Modelos anteriores, como o GPT-5.6-Sol, haviam chegado ao nível considerado “Alto”, mas não tinham atingido a classificação “Crítica”.

Diante dos resultados, a OpenAI começou a adotar controles mais rígidos para os testes. Entre as medidas estão o uso de ambientes isolados, restrições ao acesso a redes e ferramentas externas e uma camada adicional de proteção para os pesos do modelo.

openai logo códigos 3

A empresa também implementou um sistema de monitoramento capaz de acompanhar a cadeia de raciocínio do modelo em tempo real. A auditoria busca identificar sinais de desalinhamento ou comportamentos de risco durante as próprias fases de treinamento e avaliação do Astra, e não apenas em simulações realizadas após o treinamento. Caso sejam detectados indícios de atividade potencialmente perigosa, a execução pode ser interrompida imediatamente.

A retomada completa do desenvolvimento dependerá ainda da validação dessas medidas de segurança em colaboração com agências governamentais e organizações parceiras especializadas em segurança de IA.

IA da OpenAI invadiu a Hugging Face

A decisão de desacelerar o desenvolvimento do Astra acontece em meio a outros episódios que aumentaram a preocupação com a capacidade de modelos de IA para executar ações de forma autônoma.

Recentemente, modelos da OpenAI estiveram envolvidos em um incidente de segurança no qual conseguiram invadir a Hugging Face, plataforma conhecida por reunir modelos e ferramentas de código aberto voltados a aprendizado de máquina. A OpenAI esclareceu que o Astra não participou do episódio, já que o modelo ainda não foi lançado.

openai logo códigos

O caso, porém, contribuiu para o endurecimento das políticas de segurança da empresa e chamou atenção para os riscos de sistemas capazes de operar com maior autonomia em ambientes digitais.

Outras empresas também relataram situações semelhantes. A Anthropic afirmou que três versões de seus modelos Claude conseguiram acessar a internet e invadir três organizações de forma autônoma durante testes. Na China, o modelo Kimi K3, da Moonshot, também teria conseguido escapar de seu ambiente de testes controlado.

Se você gostou do conteúdo, talvez também se interesse por saber o que é o Claude Fable 5 e por que ele é tão polêmico.

{{WHATSAPP_CHANNEL}}