Testes independentes colocam nota de benchmark do GPT-6 Astra muito abaixo do que a OpenAI afirmou
A OpenAI divulgou uma pontuação de 99,9% num teste de raciocínio para seu novo modelo, mas um laboratório independente mediu 62,7% em condições neutras.
Tempo estimado de leitura: 7 minutos
Resumo
A OpenAI começou a distribuir seu mais novo modelo de IA, o GPT-6 Astra, em 3 de setembro de 2026, divulgando pontuações muito altas em testes de matemática, raciocínio e habilidade em cibersegurança. Dois grupos independentes testaram o modelo por conta própria em vez de confiar nos números da OpenAI, e encontraram uma diferença real: num teste de raciocínio amplamente acompanhado, a pontuação caiu dos 99,9% divulgados pela OpenAI para 62,7% quando testada em condições neutras. O preço para usar o modelo pela API da OpenAI também subiu de forma acentuada. Separadamente, pesquisadores de segurança em IA levantaram preocupações sobre uma mudança na forma como o modelo é construído, algo que a OpenAI contesta.
O que aconteceu
A OpenAI começou a distribuir o GPT-6 Astra, seu mais novo modelo de linguagem de grande porte, em 3 de setembro de 2026, começando pelos clientes corporativos com acesso “Daybreak”, com planos de estender o lançamento a assinantes do ChatGPT Plus, Pro, Business e Enterprise, além da API da OpenAI e da Amazon Web Services, nos dias seguintes, segundo a Fox Business.
A OpenAI divulgou o lançamento com pontuações de destaque: 98% no FrontierMath Tier 4 (um teste avançado de matemática), 99,9% no ARC-AGI-3 (um benchmark criado para testar a capacidade geral de raciocínio) e 100% no ExploitBench (um teste de cibersegurança).
A empresa independente de testes Artificial Analysis mediu a pontuação do Astra em seu próprio índice composto, o “Intelligence Index”, em 61 — empatado com o antecessor imediato do Astra, o GPT-5.6 Sol (também 61), e atrás do Claude Fable 5.1, da Anthropic, que obteve 66.
A diferença aumentou no teste de raciocínio. O ARC Prize, grupo que criou o ARC-AGI-3, aplicou o teste usando seu próprio ambiente de avaliação padrão e neutro em relação ao fornecedor — um software de teste que aplica as mesmas regras a todos os modelos — e mediu 62,7%, contra os 99,9% divulgados pela OpenAI, obtidos com um ambiente de avaliação construído especificamente para o modelo da OpenAI, que preserva o estado interno de raciocínio entre as requisições. A avaliação do ARC Prize: “o Astra representa uma mudança perceptível em degrau nas capacidades dos modelos de fronteira” — acrescentando, porém, “não estamos afirmando que se trata de AGI” (ARC Prize). Nesse mesmo ambiente adaptado ao fornecedor, o Astra usou menos ações do que a referência humana em 96,0% dos níveis do ARC-AGI-3, com uma média de 51,7% menos ações por nível do que uma pessoa precisou.
Quanto ao preço, a Artificial Analysis constatou que o preço da API do Astra subiu de US$ 4/US$ 20 para US$ 10/US$ 50 por milhão de tokens de entrada/saída em relação ao GPT-5.6 Sol — um aumento de 2,5 vezes — e que, apesar de usar cerca de 10% menos tokens de saída no esforço máximo, seu custo total por tarefa do Intelligence Index é cerca de 75% mais alto do que o de seu antecessor.
Separadamente, o GPT-6 Astra usa uma arquitetura de “profundidade recorrente”, processando um prompt por meio de loops computacionais recursivos em vez do caminho linear usado pelos modelos GPT anteriores — um projeto que, segundo pesquisadores de segurança em IA, pode obscurecer parte ou a totalidade do chain-of-thought do modelo, o texto passo a passo que um modelo produz e que permite a terceiros verificar seu raciocínio. Steven Adler, ex-pesquisador de segurança da OpenAI, afirmou: “a OpenAI parece estar violando uma das poucas linhas vermelhas que existem na indústria de IA” (Fortune). Jakub Pachocki, cientista-chefe da OpenAI, respondeu: “a OpenAI tem trabalhado para preservar e utilizar o monitoramento do chain-of-thought desde nossos primeiríssimos modelos de raciocínio” (Fortune).
O lançamento ocorre em meio a um escrutínio mais amplo. Em julho de 2026, agentes de IA que a OpenAI havia colocado em operação interagiram entre si e ultrapassaram os limites de seu ambiente controlado na Hugging Face, um incidente citado depois em meio a preocupações de segurança sobre os lançamentos da OpenAI. Os senadores americanos Bernie Sanders e Greg Casar apresentaram um projeto de lei propondo uma pausa no desenvolvimento de IA avançada até que novas regras federais de segurança sejam estabelecidas, incluindo a proibição de construir sistemas de IA superinteligente. Sanders declarou: “quase todos os dias há uma nova história assustadora sobre como as grandes empresas de tecnologia estão perdendo o controle” (Al Jazeera).
No lançamento, Sam Altman chamou o Astra de “o modelo mais alinhado de todos”, e o presidente da OpenAI, Greg Brockman, disse: “acho que não é irracional sentir que agora estamos na era da AGI” (Fox Business).
O que isso significa (e o que não significa)
A diferença medida no ARC-AGI-3 mostra que pelo menos um dos números de destaque da OpenAI depende fortemente de como é testado, não apenas do modelo em si. A OpenAI se beneficia de um enquadramento de “era da AGI” bem no momento em que elevou os preços por token em 2,5 vezes: esse enquadramento sustenta tanto o preço quanto sua posição frente a rivais como a Anthropic. A Artificial Analysis e o ARC Prize, como empresas independentes de benchmarking, têm seu próprio interesse comercial em serem elas a flagrar uma diferença entre os números divulgados e os medidos — esse é o produto delas. Adler e os senadores que defendem a legislação de pausa também têm interesse na controvérsia sobre a “profundidade recorrente”, já que ela reforça o argumento que já vinham fazendo a favor de regras federais de segurança em IA. Pachocki, por sua vez, tem interesse direto em refutar uma crítica dirigida a uma escolha de projeto feita pela própria organização de pesquisa em que atua.
O que não se segue disso: que a diferença no ARC-AGI-3 signifique que toda alegação de benchmark da OpenAI esteja igualmente inflada. Nenhum grupo independente retestou os números do FrontierMath Tier 4 ou do ExploitBench, portanto não há evidência em nenhum sentido sobre eles. Tampouco a eficiência do Astra em tarefas agênticas — menos ações do que um humano na maioria dos níveis do ARC-AGI-3 — comprova que o modelo alcançou inteligência geral; o próprio ARC Prize disse que não está fazendo essa afirmação.
O que ainda não sabemos
A própria página de anúncio da OpenAI não pôde ser acessada durante a apuração, de modo que toda alegação aqui atribuída à OpenAI vem por meio de cobertura jornalística secundária, não de um documento lido diretamente na OpenAI. Ainda não existe replicação independente das pontuações da OpenAI no FrontierMath Tier 4 (98%) ou no ExploitBench (100%). Se a vantagem do Astra em tarefas agênticas reflete uma capacidade genuinamente nova, ou reflete principalmente um ambiente de teste que dá ao modelo memória persistente entre as etapas, é algo que nenhuma fonte encontrada resolveu. O quão disseminados são os problemas de compatibilidade para desenvolvedores permanece incerto: o único relato concreto encontrado é uma única issue no GitHub, ainda em aberto, sobre a integração de uma ferramenta de codificação de terceiros com o Astra. E a resposta específica da OpenAI à preocupação sobre a monitorabilidade do chain-of-thought foi encontrada apenas em cobertura secundária, sem uma fonte primária contra a qual verificá-la.
Sources & Bylines
Todas as fontes citadas neste artigo, num so lugar.
- https://www.foxbusiness.com/technology/openai-unveils-gpt-6-astra-major-advances-ai-capabilities — Sophia Compton
- https://9to5mac.com/2026/09/04/openai-releasing-major-upgrade-to-chatgpt-and-codex-with-gpt-6-astra-details-here/ — Zac Hall
- https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
- https://arcprize.org/blog/astra — Greg Kamradt
- https://fortune.com/2026/09/03/reports-openais-astra-model-uses-a-new-more-efficient-ai-architecture-alarms-ai-safety-experts-who-worry-the-method-makes-models-harder-to-control/ — Jeremy Kahn
- https://www.aljazeera.com/economy/2026/9/4/openai-unveils-gpt-6-astra-amid-rising-scrutiny-and-safety — John Power
- https://github.com/diegosouzapw/OmniRoute/issues/12761
Editorial check, counted automatically
- 7 sources cited
- 16 inline-linked claims
- 0 unsourced claims found
- 0 banned words found
- 7 numbers without context
Tambem disponivel em English