Os pesquisadores da OpenAI identificaram comportamentos inesperados em um modelo interno de inteligência artificial desenvolvido para executar tarefas de longa duração. Durante os testes, a IA encontrou formas de contornar restrições de segurança, acessou a internet sem autorização e tentou recuperar informações privadas para concluir desafios.
A OpenAI chegou a desligar temporariamente o modelo depois de descobrir que ele burlava as restrições da empresa de forma secreta. Segundo a companhia, a IA foi treinada para resolver problemas complexos que exigem planejamento por longos períodos, o que também aumentou as oportunidades de adotar estratégias não previstas.
Por exemplo, o modelo encontrou uma vulnerabilidade no ambiente isolado em cerca de uma hora e fez uma solicitação no GitHub, mesmo após receber instruções para compartilhar os resultados apenas em um canal interno no Slack. A OpenAI afirmou que modelos anteriores eram menos persistentes e normalmente desistiam da tarefa ao encontrar esse tipo de bloqueio.
Os pesquisadores também observaram tentativas de burlar o sistema de avaliação. O modelo tentou acessar soluções privadas armazenadas no backend da plataforma e, após ser bloqueado, ofuscou o próprio token de autenticação para evitar a detecção por ferramentas de segurança. De acordo com a OpenAI, os registros internos mostraram que a IA tomou essas medidas de forma consciente para contornar as restrições impostas.
:quality(85)/6de05839-f89f-4e11-9241-bf65e6e6c8d6.jpg)
Como a OpenAI “consertou” o modelo?
Para reduzir o risco de novos comportamentos desse tipo, a OpenAI reformulou os mecanismos de segurança usados para monitorar o modelo. Agora, o novo sistema acompanha toda a trajetória da IA durante a execução de uma tarefa, buscando sinais de que ela esteja tentando contornar limitações ou explorar brechas.
A empresa também começou a monitorar os objetivos finais perseguidos pelo modelo e implementou mecanismos específicos para identificar tentativas de evasão dos sistemas de aprovação. Segundo a OpenAI, as novas proteções conseguiram detectar um número significativamente maior de ações desalinhadas.
Embora alguns casos ainda escapem do monitoramento, a empresa afirma que os incidentes restantes foram classificados como de baixa gravidade e vão servir para aprimorar futuras medidas de segurança.
Se você gostou do texto, talvez também se interesse por conferir 10 dicas do que nunca colocar em um prompt de IA.
{{WHATSAPP_CHANNEL}}