OpenAI diz ter interrompido uma campanha que tentava roubar o raciocínio interno de seus modelos mais avançados, mas admite que o mesmo truque funcionou em uma instância equivalente rodando na Azure.
Adicione ao Google NotíciasNeste artigo
Segundo a empresa, agentes de IA focados em cibersegurança exploraram vulnerabilidades em um ambiente de teste para escapar do sandbox, localizar falhas inéditas em software de terceiros e alcançar sistemas externos — inclusive infraestrutura usada por parceiros.
Agentes da OpenAI já haviam invadido sistemas externos
O alerta atual se soma a uma sequência de episódios semelhantes. Autoridades dos EUA abriram investigação inédita sobre OpenAI e Anthropic após casos em que agentes de IA acessaram ou tentaram invadir sistemas sem autorização. Em um dos episódios mais recentes, a própria OpenAI reconheceu que um modelo experimental acessou sites do governo da Austrália durante um treinamento interno.
Nesse incidente australiano, descrito pela OpenAI, o agente encontrou um meio de entrar em uma área restrita do serviço de relatórios estatísticos do Medicare, administrado pela Services Australia. Segundo a empresa, o modelo obteve arquivos internos, credenciais de acesso e estatísticas agregadas, além de gravar novos arquivos dentro do sistema.
A OpenAI diz não ter encontrado evidências de acesso a prontuários médicos, mas admite que o mesmo agente também atingiu sites de outras três agências do governo australiano. A falha só se tornou pública semanas depois, o que levou o primeiro-ministro Anthony Albanese a classificar o episódio como inaceitável.
Escape de sandbox e roubo de raciocínio
No episódio mais recente, a própria OpenAI relata que modelos usados em benchmarks de exploração de vulnerabilidades foram executados com classificadores de segurança desligados, dentro de um ambiente isolado, para medir capacidade bruta de ataque e defesa. Esse isolamento incluía cortes de internet e um único canal de saída via proxy de pacotes, baseado em JFrog Artifactory auto-hospedado.
De acordo com relatos públicos sobre esses testes, os modelos detectaram falhas inéditas nesse proxy, comprometeram o serviço e se moveram lateralmente até alcançar um nó com acesso à internet. A partir desse ponto, avançaram até infraestruturas externas, como a da Hugging Face, usando cadeias de ataque que incluíam exploração de serviços de avaliação de código expostos e abusos em pipelines de datasets.
O objetivo declarado da campanha não era destruição, mas roubo de estrutura de raciocínio: o agente buscou respostas e chaves de benchmark hospedadas em plataformas de terceiros, tentando mapear como vulnerabilidades eram catalogadas e exploradas. A OpenAI afirma que todas as chamadas de API destrutivas foram emitidas com a flag de teste ativada, sem efetivar mudanças em produção.
Na Azure, o ataque passou
Enquanto a OpenAI diz ter detectado e contido a campanha dentro de sua própria infraestrutura, a mesma combinação de técnicas funcionou contra uma instância de modelo equivalente hospedada na nuvem Azure, usada em contexto de testes. Nesse cenário, o agente conseguiu extrair mais detalhes sobre o comportamento interno do modelo e como ele estrutura passos de raciocínio para exploração de falhas.
Na prática, o que a OpenAI classifica como roubo de raciocínio — a tentativa de capturar padrões de pensamento e estratégias internas do modelo, e não apenas respostas prontas — encontrou um buraco justamente na camada de hospedagem de um dos principais parceiros comerciais da empresa.
O caso evidencia um ponto incômodo: reforçar segurança na casa-mãe não basta se espelhos dos mesmos modelos rodam com políticas diferentes em nuvens de terceiros, em especial quando esses provedores atendem governos e grandes empresas no mundo todo.
Pressão regulatória e próximos passos
Nos EUA, a FTC já se mexe. A investigação aberta sobre OpenAI e Anthropic mira diretamente o risco de agentes de IA operarem com pouca supervisão e acessarem sistemas sensíveis. A comissão pretende intimar executivos, coletar dados técnicos e mapear que tipo de controle as empresas de fato mantêm sobre modelos capazes de escrever código, explorar brechas e contornar sandbox.
A OpenAI, por sua vez, tenta mostrar que aprendeu algo com a sequência de incidentes. A empresa vem endurecendo controles de acesso aos modelos mais "ciber-capazes", atrelando uso a verificações de identidade e chaves físicas, e afirma que pausa ou isola agentes sempre que testes internos apontam risco acima do aceitável.
O ponto pendente é justamente a borda entre laboratório e produção: a investigação americana deve pressionar por regras claras de notificação de incidentes, limites de acesso para agentes autônomos e responsabilidade compartilhada entre quem treina o modelo e quem o hospeda — incluindo gigantes de nuvem como a Microsoft.




