A OpenAI apresentou nesta terça-feira (25) os primeiros resultados medidos do Jalapeño, seu chip criado para executar modelos de inteligência artificial. Nos testes divulgados pela empresa, o componente fez mais trabalho por unidade de energia e entregou respostas em menos tempo que os sistemas comerciais escolhidos para a comparação.
O anúncio não coloca uma placa nova na prateleira nem troca imediatamente os equipamentos que sustentam o ChatGPT. O Jalapeño deve entrar na infraestrutura da OpenAI em volumes muito pequenos no fim de 2026, segundo Richard Ho, chefe de hardware da companhia, e ganhar uma implantação mais relevante ao longo de 2027.
A OpenAI atribui ao Jalapeño ganhos de 1,5 a 1,9 vez em trabalho por watt e latência até 3,6 vezes menor nos testes publicados. O TechCrunch confirma que a comparação usa o InferenceX e ressalta que a implantação relevante está prevista somente para 2027.
O teste sai do laboratório
O Jalapeño foi medido no InferenceX, conjunto público de testes mantido pela empresa de análise de semicondutores SemiAnalysis. A avaliação trata da inferência, etapa em que um modelo já treinado recebe um pedido e produz a resposta, justamente o trabalho repetido a cada conversa com um chatbot ou tarefa enviada a um agente de programação.
Segundo a OpenAI, o chip entregou de 1,5 a 1,9 vez mais trabalho de IA por watt no ponto de maior vazão, além de reduzir a demora de ponta a ponta entre 1,7 e 3,6 vezes. Em cargas muito interativas, nas quais cada fração de segundo pesa na sensação de velocidade, a empresa afirma ter obtido desempenho de 2,1 a 4,1 vezes maior.
Esses números apareceram em três modelos públicos de tamanhos e origens diferentes: GPT-OSS 120B, da própria OpenAI, DeepSeek R1 e Kimi K2.5 1T, da Moonshot AI. A variedade ajuda a mostrar que o projeto não funciona apenas com um modelo interno, mas ainda não equivale a uma verificação ampla em serviços reais ou a uma promessa de ganho igual para toda solicitação.
A SemiAnalysis diz ter sido convidada a conhecer o chip e executar sua suíte de testes, e publicou uma análise separada dos resultados. Mesmo assim, a configuração, os modelos e os pontos da curva usados na apresentação fazem parte de uma demonstração antecipada de um sistema que ainda não está em produção em grande volume.
Velocidade e vazão deixam de brigar
Servidores de IA costumam enfrentar uma escolha: responder muito rápido a poucas pessoas ou acumular mais solicitações para aproveitar melhor o hardware. O primeiro caminho reduz a espera individual, enquanto o segundo aumenta a quantidade total de respostas e tende a melhorar o custo por usuário.
A OpenAI afirma que o Jalapeño se aproxima dos dois objetivos com a mesma arquitetura. Em vez de depender apenas de força bruta, o projeto procura manter dados usados com frequência perto das unidades de cálculo, o que reduz o tempo e a energia gastos para transportar informações dentro do sistema.
Essa movimentação importa porque um modelo de linguagem passa por fases diferentes ao responder. Primeiro, o servidor processa o texto enviado pelo usuário, uma etapa mais pesada em cálculo; depois, gera a resposta palavra por palavra, operação que exige acesso rápido e contínuo à memória.
O chip também reserva localmente o chamado cache de chave e valor, memória temporária que guarda o contexto já processado durante a geração. Para quem usa o serviço, todo esse desenho só faz sentido se resultar em respostas que começam mais cedo, continuam sem engasgos e custam menos para serem produzidas em escala.
Um rack com 128 chips
O Jalapeño foi projetado para trabalhar como parte de um sistema, e não como uma peça isolada em um computador pessoal. Cada rack, o armário que reúne equipamentos de um centro de dados, leva 128 aceleradores e soma 1,7 exaflops de cálculo em precisão de 4 bits, formato usado para ganhar velocidade e economizar memória durante a execução de modelos.
De acordo com os dados apresentados por Ho na conferência Hot Chips, o conjunto reúne 27,5 TB de memória HBM4 e quase 2 petabytes por segundo de largura de banda. HBM4 é uma memória empilhada ao lado do processador para alimentar o chip rapidamente, enquanto a largura de banda indica quanto dado pode circular a cada segundo.
Cada componente oferece 216 GB dessa memória e 15,4 TB por segundo de largura de banda, segundo a apresentação acompanhada pelo Data Center Dynamics e pelo The Register. Um agrupamento maior pode conectar até 16 racks, totalizando 2.048 chips para dividir modelos e solicitações que não cabem em uma única máquina.
O processador tem potência térmica especificada em 700 watts, mas a OpenAI afirmou que o consumo sustentado ficou em até 550 watts nas cargas medidas. Potência térmica é a referência usada para dimensionar alimentação e refrigeração, não uma conta garantida de consumo constante em qualquer tarefa.
Essas dimensões deixam claro que o Jalapeño não é concorrente de uma placa de vídeo instalada na mesa do desenvolvedor. Ele disputa espaço com sistemas inteiros de aceleradores em centros de dados, onde energia, refrigeração, rede e memória pesam tanto quanto a velocidade máxima indicada na ficha.
A comparação tem prazo de validade
A principal referência usada pela OpenAI é a geração Blackwell, da Nvidia, disponível atualmente em servidores comerciais. A empresa diz ter superado sistemas GB200 NVL72 e GB300 NVL72 em diferentes pontos de desempenho e eficiência, mas os resultados publicados ainda não abrangem a próxima geração de concorrentes.
O TechCrunch observa que o cenário pode mudar até a implantação ampla do Jalapeño, pois a Nvidia avança com a plataforma Rubin e a AMD prepara novos aceleradores para 2027. A própria SemiAnalysis considera incompleta uma leitura que trate Blackwell como o único rival relevante, já que chips com memória HBM4 chegarão ao mercado enquanto a OpenAI amplia a produção.
Também não há teste independente de um serviço público usando o componente, nem preço que permita calcular quanto cada resposta realmente custará. As proporções de velocidade e eficiência devem ser lidas como resultados de laboratório divulgados pela OpenAI e reproduzidos em uma suíte externa, não como desempenho garantido para ChatGPT, Codex ou clientes da API.
A empresa tampouco prometeu abandonar a Nvidia. Ho disse ao Data Center Dynamics que a demanda por capacidade é grande demais para ser atendida por uma única opção, e citou o Jalapeño como parte de uma estratégia que continua incluindo aceleradores e infraestrutura de outros parceiros.
Broadcom transforma o projeto em silício
A OpenAI desenhou a arquitetura com foco em suas cargas, enquanto a Broadcom cuidou da implementação do chip e de tecnologias de rede. A Celestica participa das placas, da integração dos racks e dos sistemas necessários para colocar os aceleradores em operação nos centros de dados.
Quando anunciou o Jalapeño em junho, a OpenAI disse ter levado nove meses do desenho inicial até o tape-out, momento em que o projeto do circuito é concluído e enviado para fabricação. Modelos da própria companhia ajudaram em partes do desenho e da otimização, uma alegação que agora ganha um exemplo mais concreto na programação do hardware.
A análise da SemiAnalysis relata que uma versão interna do Codex ajudou a escrever kernels, pequenos programas que controlam diretamente como o chip executa operações. Esse uso não significa que a IA criou o processador sozinha: equipes humanas definiram a arquitetura, validaram os resultados e trabalharam com os parceiros responsáveis por transformar o desenho em equipamento físico.
O efeito chega ao código pela nuvem
Um acelerador mais eficiente não torna o notebook do programador mais rápido por conta própria. A mudança aparece do outro lado da conexão: agentes podem começar a responder antes, sustentar mais tarefas simultâneas e exigir menos energia do provedor para cada tentativa, caso os ganhos de laboratório sobrevivam à implantação.
Esse ponto é especialmente importante para ferramentas de programação, que enviam contextos longos, consultam arquivos, executam comandos e voltam ao modelo várias vezes antes de concluir uma tarefa. Uma pequena redução em cada etapa se acumula durante sessões extensas, enquanto maior capacidade no servidor abre espaço para mais usuários sem ampliar o parque de máquinas na mesma proporção.
A OpenAI associa a estratégia a respostas mais rápidas, menos tentativas e menor custo por trabalho concluído, mas ainda não anunciou redução de preço ou novo plano ligado ao chip. Também não há data para identificar quando uma conversa ou tarefa de código será processada pelo Jalapeño em vez de um acelerador de outro fornecedor.
O Jalapeño ficará escondido nos centros de dados, mas seu teste mira uma cena familiar: o agente recebe uma tarefa longa e devolve o código antes, sem exigir que o usuário troque o computador.
