OpenAI interrompe extração de raciocínio em IA

OpenAI interrompe extração de raciocínio em IA

A extração de raciocínio em IA entrou no centro de uma nova disputa de segurança envolvendo modelos de linguagem avançados. A OpenAI afirma ter identificado e interrompido uma campanha coordenada de destilação adversária destinada a obter o raciocínio protegido de seus modelos. Segundo a empresa, um núcleo importante da atividade foi associado a indivíduos ligados à Moonshot AI, desenvolvedora chinesa dos modelos Kimi.

A atividade começou em 1º de julho de 2026, inicialmente em baixo volume, mas ganhou escala nos dias 24 e 25 de julho. Nesse período, a OpenAI registrou 16 mil solicitações com um padrão relacionado à extração, originadas de mais de 4 mil usuários. A investigação posterior identificou comportamentos semelhantes em um conjunto superior a 15 mil usuários, e a empresa afirma ter interrompido completamente a atividade até 28 de julho.

O caso chama atenção porque não envolveu, segundo a OpenAI, uma invasão convencional. A criptografia não foi quebrada, nenhum banco de dados foi comprometido e não houve acesso direto às conversas armazenadas dos usuários. O mecanismo explorou a maneira como determinadas informações de raciocínio protegido são manipuladas durante as interações com modelos de IA.

O que é a destilação adversária e como funcionou a extração de raciocínio em IA

A destilação de modelos é, por si só, uma técnica legítima de aprendizado de máquina. Ela permite que um modelo menor aprenda padrões e capacidades a partir das respostas de um modelo mais poderoso, reduzindo potencialmente custos de processamento e requisitos de infraestrutura.

O problema surge quando essa técnica é utilizada de maneira não autorizada e em escala, com o objetivo de reproduzir capacidades de um modelo proprietário. Nesse cenário, a prática pode se transformar em destilação adversária, na qual as respostas de um sistema avançado são sistematicamente coletadas para ajudar a desenvolver ou aperfeiçoar outro modelo. A Anthropic também descreveu campanhas desse tipo envolvendo DeepSeek, Moonshot e MiniMax, identificando milhões de interações usadas em tentativas de extração de capacidades do Claude.

No caso investigado pela OpenAI, o objetivo era mais específico: obter o raciocínio protegido produzido durante o processamento de determinadas tarefas. Esse material pode revelar estratégias, etapas intermediárias e informações que não aparecem na resposta final apresentada ao usuário.

A diferença é importante. Uma resposta convencional mostra apenas o resultado que o provedor decidiu disponibilizar. Já uma extração de raciocínio em IA pode revelar informações intermediárias que ajudam terceiros a compreender ou reproduzir como determinado modelo resolve problemas complexos.

A OpenAI afirma que os operadores manipularam as interações de forma coordenada para fazer com que partes desse raciocínio protegido fossem reproduzidas em formatos acessíveis ao solicitante. A empresa classificou o comportamento como consistente com adversarial distillation.

Broadcom e OpenAI se unem para desenvolver novos aceleradores de IA
Broadcom e OpenAI se unem para desenvolver novos aceleradores de IA

A mecânica da extração de raciocínio

A técnica ganha relevância quando analisada junto às pesquisas acadêmicas publicadas em 2026 sobre o funcionamento das chamadas reasoning traces, ou rastros de raciocínio.

Pesquisadores da MATS Research, do ELLIS Institute Tübingen, do Max Planck Institute for Intelligent Systems e da Snyk demonstraram uma arquitetura na qual determinados provedores entregam ao cliente blocos criptografados associados ao raciocínio de modelos avançados. Esses blocos podem ser enviados novamente durante interações posteriores.

O trabalho identificou uma propriedade particularmente relevante: em determinados ecossistemas, os blocos criptografados poderiam ser intercambiáveis entre sessões, usuários e modelos do mesmo provedor. Os pesquisadores demonstraram que um bloco produzido por um modelo mais poderoso poderia ser reutilizado em um modelo diferente e menos protegido, que então poderia ser induzido a revelar o conteúdo em texto legível.

Isso muda completamente a natureza do problema.

Em vez de tentar quebrar diretamente as proteções do modelo mais poderoso, um atacante poderia procurar outro ponto do ecossistema com controles diferentes. O modelo mais fraco funcionaria, nesse cenário, como uma espécie de intermediário para revelar informações que deveriam permanecer protegidas.

A pesquisa demonstrou esse tipo de comportamento em sistemas associados à Anthropic, OpenAI e Google, indicando que a questão não necessariamente está limitada a uma implementação individual.

Além da destilação, os pesquisadores apontaram outros riscos. A mesma classe de problema poderia contribuir para extração de dados privados, exposição de informações sensíveis presentes em logs de agentes e até ataques envolvendo instruções ocultas dentro de blocos de raciocínio.

É importante, porém, separar as duas situações. A pesquisa acadêmica descreve uma vulnerabilidade arquitetural mais ampla, enquanto a OpenAI afirma que a campanha identificada em julho não exigiu uma quebra direta da criptografia. O incidente demonstra, portanto, que proteger o conteúdo criptografado não é suficiente quando o próprio fluxo de interação pode ser manipulado.

A brecha entre ecossistemas e modelos

O trabalho publicado por pesquisadores ligados à MATS Research, ELLIS Institute Tübingen e Snyk ajuda a explicar por que a proteção do raciocínio se tornou uma questão sistêmica.

Os experimentos indicaram que o problema poderia atingir diferentes famílias de modelos dentro de um mesmo ecossistema. Em outras palavras, uma implementação criada para proteger o raciocínio de um modelo de ponta pode não oferecer a mesma segurança quando o dado criptografado circula entre diferentes componentes da plataforma.

Para provedores de IA, isso cria um desafio semelhante ao observado em sistemas distribuídos tradicionais: a segurança não pode ser avaliada apenas no componente mais protegido. APIs, modelos auxiliares, sessões, mecanismos de compatibilidade, logs e ferramentas de agentes também precisam ser considerados.

Esse aspecto é particularmente importante para desenvolvedores. Uma aplicação que utiliza múltiplos modelos de um mesmo fornecedor pode criar involuntariamente caminhos de comunicação que não estavam previstos no modelo original de ameaça.

A pesquisa também mostrou que o problema não se limita à propriedade intelectual. Em uma análise de blocos de raciocínio disponíveis em repositórios públicos, os pesquisadores encontraram informações pessoais e credenciais que haviam sido expostas em artefatos compartilhados por desenvolvedores.

Riscos de segurança nacional e histórico da Moonshot AI

A preocupação com a extração de raciocínio em IA vai além da competição comercial entre laboratórios.

Modelos de fronteira concentram anos de pesquisa, grandes investimentos computacionais e técnicas de treinamento que podem ser difíceis e caras de reproduzir. Quando capacidades desse tipo são transferidas por meio de interações automatizadas, um terceiro pode potencialmente reduzir parte do custo necessário para desenvolver sistemas semelhantes.

A própria OpenAI afirma que a destilação adversária pode acelerar a transferência de capacidades avançadas sem exigir o mesmo investimento em segurança e salvaguardas empregado pelo desenvolvedor original.

Esse ponto ganhou dimensão geopolítica durante 2026. Uma investigação da Reuters relatou o uso de model distillation por pesquisadores militares chineses para aproveitar modelos desenvolvidos nos Estados Unidos em sistemas voltados a áreas como vigilância, guerra cibernética e operações com drones.

No caso específico da Moonshot AI, a atribuição feita pela OpenAI exige uma ressalva importante. A empresa declarou que não sabe se todos os operadores identificados pertenciam a um único ator, mas atribuiu um núcleo da atividade a indivíduos associados à desenvolvedora do Kimi. Portanto, a atribuição divulgada não significa que cada uma das mais de 15 mil contas identificadas tenha sido operada pela Moonshot AI.

Há ainda um antecedente envolvendo a própria Moonshot e a Anthropic. A Anthropic afirmou em fevereiro que identificou campanhas de destilação envolvendo Moonshot, DeepSeek e MiniMax, com mais de 16 milhões de interações geradas por aproximadamente 24 mil contas consideradas fraudulentas.

Em setembro, a Anthropic acrescentou que havia identificado um mecanismo no qual a Moonshot teria encaminhado solicitações de seus próprios usuários para o Claude, utilizando posteriormente essas interações em processos de extração de capacidades. A empresa também descreveu uma técnica de reutilização de thinking signatures entre sessões para obter rastros de raciocínio. Essas são alegações da Anthropic e devem ser entendidas dentro do contexto das investigações conduzidas pela própria empresa.

O conjunto desses episódios mostra uma mudança importante no modelo de ameaça. O alvo de uma operação de inteligência tecnológica não precisa mais ser necessariamente um arquivo de pesos, um servidor ou uma base de dados. A própria interação com um modelo pode se tornar uma fonte de informações valiosas.

Conclusão e os novos rumos da segurança em IA

A campanha interrompida pela OpenAI reforça que a segurança em modelos de IA precisa considerar não apenas ataques tradicionais, mas também formas de abuso baseadas na própria interface de interação.

A empresa afirma ter identificado os padrões, interrompido as contas relacionadas e compartilhado informações sobre o problema com parceiros do setor por meio do Frontier Model Forum. A intenção é fortalecer mecanismos coletivos de detecção contra campanhas de destilação adversária.

Para desenvolvedores e administradores, a principal lição é que criptografia isolada não resolve todos os problemas de proteção de raciocínio. É necessário considerar também vinculação de sessões, autorização, comportamento anômalo, compatibilidade entre modelos, limites de API e monitoramento de padrões automatizados.

A pesquisa acadêmica aponta ainda para possíveis mudanças na arquitetura desses sistemas. Blocos de raciocínio precisam ser protegidos não apenas contra leitura direta, mas também contra reutilização indevida, reprodução entre contextos e manipulação por modelos auxiliares.

Para o setor de IA, isso representa uma nova fronteira de segurança. Se respostas de modelos já são consideradas ativos valiosos, os mecanismos internos que permitem chegar a essas respostas podem ser ainda mais sensíveis.

A disputa, portanto, não está apenas em quem possui o modelo mais poderoso. Também está em quem consegue proteger suas capacidades contra reprodução, extração e transferência não autorizada.

O caso envolvendo OpenAI e Moonshot AI mostra como essa fronteira está se tornando cada vez mais sofisticada. E, à medida que modelos de raciocínio passam a executar tarefas mais complexas, proteger seus processos internos deverá se tornar parte central da segurança de toda a infraestrutura de inteligência artificial.