IA

O chip Jalapeño da OpenAI executa inferencia com eficiencia 1,9 vez maior que o Nvidia Blackwell por watt

Adrian Kessler

A OpenAI construiu seu próprio chip. A empresa apresentou o Jalapeño na conferência Hot Chips em 25 de agosto, um design de silício desenvolvido em parceria com a Broadcom que processa requisições de inferência a 85.448 tokens por segundo por quilowatt. A arquitetura Blackwell da Nvidia, o padrão atual do mercado, atinge 44.960 na mesma métrica. A proporção é de 1,9 vezes.

A métrica é importante porque a inferência é como os sistemas de IA rodam em produção. O treinamento acontece uma vez; a inferência acontece toda vez que alguém envia uma consulta ao ChatGPT, usa uma API ou interage com qualquer aplicativo que execute um modelo de linguagem. O custo da inferência em escala é o principal motor da economia dos serviços de IA. Um chip que reduz o consumo de energia da inferência aproximadamente pela metade, se implementado amplamente, altera o custo por consulta da execução de modelos.

Em cargas de trabalho interativas, onde a latência de resposta é o fator limitante, a vantagem do Jalapeño se estende ainda mais. O relatório da SemiAnalysis sobre a apresentação na Hot Chips colocou a faixa entre 2,1 a 4,1 vezes melhor que a Blackwell nesses benchmarks. A dispersão reflete a variação entre tipos específicos de tarefas; o limite inferior é a comparação mais conservadora.

O chip lida apenas com inferência. Ele não executa as cargas de treinamento que produziram os modelos que o Jalapeño foi projetado para rodar. Essas ainda exigem hardware da Nvidia. A Broadcom fabricou o chip sob um acordo de design personalizado com a OpenAI, em vez de vendê-lo como um produto comercial. O arranjo dá à OpenAI uma camada de inferência construída sob medida, sem exigir que ela concorra no mercado de chips comerciais.

O cronograma de implantação da OpenAI é limitado. A implementação em pequena escala está prevista para antes do final de 2026; a implantação mais ampla é uma meta para 2027. O chip ainda está na fase de amostra de engenharia, o que significa que a versão de produção ainda não foi enviada em escala. Os benchmarks na Hot Chips representam o alvo projetado, não uma execução de produção verificada. A diferença entre o anúncio em conferência e a implantação operacional para silício personalizado é tipicamente medida em anos.

O anúncio se encaixa em uma mudança mais ampla entre grandes empresas de IA em direção ao silício personalizado. O Google opera suas próprias Unidades de Processamento Tensor (TPUs) em produção há uma década. A Amazon executa Trainium e Inferentia na AWS. O Meta opera seus próprios chips de inferência internamente. A entrada da OpenAI confirma que, na escala de centenas de milhões de usuários ativos, a economia de depender inteiramente de fornecedores externos de GPU se torna difícil o suficiente para justificar o custo de um programa de design personalizado.

Tags: , , , , ,

Discussão

Há 0 comentários.