Chip Jalapeno da OpenAI supera GB200 da Nvidia em benchmarks fornecidos pela própria OpenAI
A SemiAnalysis acompanhou os testes no laboratório da OpenAI usando números fornecidos pela OpenAI, e chama a comparação com a Nvidia de "um tanto incompleta e injusta".
Tempo estimado de leitura: 5 minutos
O que aconteceu
A OpenAI publicou os primeiros resultados de benchmark do Jalapeno, um chip de inferência de IA desenvolvido em conjunto com a Broadcom, em 25 de agosto de 2026, em sincronia com a conferência de semicondutores Hot Chips, segundo o blog oficial da OpenAI.
No conjunto de benchmarks InferenceX, da SemiAnalysis, o Jalapeno entregou de 1,5x a 1,9x mais throughput por quilowatt e latência ponta a ponta de 1,7x a 3,6x menor do que os sistemas de rack GB200 e GB300 da Nvidia, informou a SemiAnalysis. A comparação coloca uma unidade Jalapeno de 700W contra peças da Nvidia especificadas entre 1.200W e 1.400W. A SemiAnalysis diz ter verificado as execuções pessoalmente no laboratório da OpenAI, com engenheiros da OpenAI presentes, e conferido os resultados cruzando-os com seu próprio simulador “chilisim”, que afirma ter precisão de até 5%, segundo o mesmo relatório.
Todos os números de benchmark citados nesse relatório foram fornecidos à SemiAnalysis pela própria OpenAI. A SemiAnalysis não rodou a suíte InferenceX completa por conta própria, e também não rodou seu próprio benchmark AgentX — sua métrica preferida como proxy para cargas de trabalho realistas em produção — no Jalapeno em nenhum momento, revela a SemiAnalysis. A publicação também classifica sua própria comparação com a Nvidia como “um tanto incompleta e injusta”, argumentando que o rival mais apropriado do Jalapeno é a próxima geração da plataforma Rubin, da Nvidia, que já está sendo entregue a clientes enquanto o Jalapeno ainda existe apenas como amostras de engenharia, segundo a SemiAnalysis.
As cargas de trabalho testadas foram de turno único, com apenas 8 mil tokens de contexto, sem cenários de contexto longo ou múltiplos turnos. A maior parte dos números de destaque veio de uma etapa inicial de silício “A0”; uma etapa “B0” separada e ainda menos testada teria, segundo a alegação, cerca de 25% mais desempenho por watt, observa a SemiAnalysis. Por chip, o Jalapeno é especificado em 13,4 PFLOPs de computação MXFP4 a aproximadamente 700W, contra 17,5 PFLOPs do Rubin a 900-1.150W; em nível de rack, os sistemas Jalapeno são especificados em 1,7 exaFLOPS de computação de 4 bits, com 27,5TB de memória HBM4 e largura de banda de memória próxima de 2PB/s, de acordo com a SemiAnalysis.
Richard Ho, chefe de hardware da OpenAI, afirmou: “O resultado final é que os números mostram um avanço de desempenho muito, muito significativo em relação ao estado da arte. O Jalapeno consegue atender mais trabalho de IA por unidade de energia, além de devolver respostas mais rapidamente”, disse Ho à TechCrunch.
O The Register, ao analisar as mesmas divulgações, observa que a comparação com a Nvidia usou sistemas de geração anterior (2024-2025) e excluiu a decodificação especulativa, uma técnica de otimização que melhora o desempenho de inferência real da Nvidia, e recomenda que os leitores “encarem todas essas alegações com um pé atrás”, escreve o The Register.
A OpenAI planeja implantar o Jalapeno em pequeno volume até o fim de 2026, com expansão relevante em 2027; uma segunda e uma terceira geração do chip já estão em desenvolvimento, segundo a OpenAI.
O que isso significa (e o que não significa)
Os resultados dão à OpenAI um dado público para sustentar uma narrativa de independência de hardware em relação à Nvidia, o que reforça seu discurso sobre custo de computação e despesas de capital diante de investidores e parceiros, como a própria OpenAI enquadra em seu anúncio. A Broadcom, co-projetista e fabricante do Jalapeno, se beneficia de ser posicionada como parceira comprovada em silício de IA de um laboratório de IA de ponta. A SemiAnalysis, ao receber acesso presencial exclusivo, se beneficia de ser vista como a voz independente de referência em benchmarking de hardware de IA, e sua suíte InferenceX ganha destaque com a cobertura — mesmo com a própria empresa sinalizando os limites da comparação, segundo a SemiAnalysis.
O que isso não significa é que o Jalapeno tenha demonstrado superar o hardware atual ou de próxima geração da Nvidia em condições independentes e controladas. Os números do benchmark vieram da OpenAI, não de uma suíte que a SemiAnalysis iniciou e rodou por conta própria. A linha de base da comparação, o GB200/GB300, não é a plataforma mais nova da Nvidia em produção — essa é a Rubin, que a própria SemiAnalysis diz ser o comparador mais justo, segundo a SemiAnalysis. A Nvidia é o alvo implícito da comparação e não há registro de que tenha respondido. A linha de base da Nvidia também excluiu a decodificação especulativa, uma otimização que provavelmente melhoraria seus números no mundo real, segundo o The Register.
O que ainda não sabemos
Ainda não existe nenhum benchmark rodado por uma parte independente do convite da OpenAI: a SemiAnalysis acompanhou testes no próprio laboratório da OpenAI, com cargas de trabalho selecionadas pela OpenAI, usando números fornecidos pela OpenAI, em vez de rodar um benchmark ponta a ponta sob seu próprio controle, segundo a SemiAnalysis. Os testes se limitaram a cargas de trabalho de turno único com 8 mil tokens de contexto, portanto não há dados publicados sobre latência ou throughput em contextos mais longos, em conversas de múltiplos turnos ou em diferentes tamanhos de lote. Nenhuma comparação de custo por token de inferência ou de custo total de propriedade foi publicada por nenhuma das fontes aqui revisadas, de modo que as alegações sobre a economia da implantação de IA seguem sem sustentação por dados de custo. O Jalapeno não está em produção: a maior parte dos números publicados usou amostras de engenharia iniciais “A0”, e a etapa “B0”, mais eficiente, é muito menos documentada. A SemiAnalysis não rodou seu próprio benchmark AgentX, sua métrica preferida como proxy para cargas de trabalho agênticas realistas, no Jalapeno, portanto não há dados sobre seu desempenho fora das condições mais restritas do InferenceX, segundo a SemiAnalysis. Também permanece incerto se terceiros externos, não convidados, conseguirão obter hardware Jalapeno ou reproduzir esses resultados de forma independente antes do início da produção em volume, em 2027.
Sources & Bylines
Todas as fontes citadas neste artigo, num so lugar.
- https://openai.com/index/jalapeno-first-results/
- https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
- https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/
- https://www.theregister.com/systems/2026/08/25/openais-upcoming-jalapeno-chip-looks-like-itll-be-an-inference-beast/5292052
Tambem disponivel em English