A OpenAI cancelou o lançamento do GPT-6.1 Astra, modelo previsto para chegar ao ChatGPT e ao Codex em outubro, depois que testes internos mostraram que ele mentia sobre as ações que tinha executado e avançava em tarefas sem pedir permissão. A decisão foi revelada pelo Wall Street Journal na segunda-feira (28) e confirmada pela chefe de sistemas de segurança da empresa, Saachi Jain.

Adicione ao Google Notícias
Neste artigo
  1. Mais enganação que o antecessor
  2. GPT-6 Astra continua no ar, e já tinha ressalvas

É raro uma empresa de IA de ponta engavetar um modelo pronto por causa de comportamento, e não de desempenho. O recuo acontece na véspera da conferência anual de desenvolvedores da OpenAI, em São Francisco, onde a nova versão tinha lugar garantido.

Mais enganação que o antecessor

Segundo as reportagens, o GPT-6.1 Astra apresentou níveis de enganação maiores que os do GPT-6 Astra nos testes internos. O modelo nem sempre dizia a verdade ao relatar o que tinha feito ou deixado de fazer para cumprir um objetivo. Também seguia adiante sem consultar o usuário e, em alguns casos, recorria a ferramentas e serviços externos mesmo quando isso podia ser inseguro. Nos testes que medem aderência a instruções, foi mal.

Jain resumiu o problema como uma troca. "Em tudo que envolve segurança e alinhamento, existe um trade-off", disse ao jornal. O modelo, segundo ela, melhorou em eixos como a "preguiça" (a tendência de desistir quando a tarefa emperra), mas "não chegou ao patamar exigido em ficar dentro do escopo e da autorização, e em como comunica ao usuário o tipo de trabalho que fez".

Em outras palavras: ao treinar o modelo para insistir mais nas tarefas, a OpenAI obteve um agente que insistia demais, inclusive passando por cima de limites.

GPT-6 Astra continua no ar, e já tinha ressalvas

Para quem usa o ChatGPT ou a API, nada muda agora. O cancelamento vale só para a versão 6.1; o GPT-6 Astra, lançado em setembro, segue disponível, assim como os derivados GPT-6 Sol e GPT-6 Luna, apresentados no dia 22.

No lançamento, a OpenAI chamou o Astra de seu modelo "mais alinhado" e afirmou que, numa avaliação criada depois do incidente envolvendo a Hugging Face, ele ultrapassou o escopo autorizado em 0% dos casos, contra 48% do GPT-5.6 Sol sem as salvaguardas de produção. Avaliações externas pintaram um quadro menos limpo: o AI Security Institute, órgão do governo britânico, relatou que, em suas simulações, o GPT-6 Astra conduziu ataques não autorizados com mais frequência que o GPT-5.6 Sol e o GPT-5.5, segundo o The Hacker News.

O peso do problema cresce com o uso agêntico, em que o modelo opera navegador, e-mail e ferramentas por conta própria. Um assistente que erra num texto é incômodo; um agente que age fora do combinado e depois relata outra coisa é risco operacional.

A OpenAI não disse se vai retreinar o 6.1, pular direto para outra versão ou mudar o cronograma da família GPT-6. A conferência de desenvolvedores deve ser o primeiro teste de como a empresa vai explicar o buraco na agenda.