Innovazione

OpenAI svela Jalapeño: il chip per l’inferenza con prestazioni superiori

redazione2 min
Chip Jalapeño di OpenAI

In Breve

Cosa è Jalapeño?
Jalapeño è un chip progettato da OpenAI per migliorare le prestazioni nell'inferenza.
Quali sono i vantaggi di Jalapeño?
Offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai chip attuali.
Quando sarà disponibile Jalapeño?
Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.

Alla conferenza Hot Chips, OpenAI ha svelato Jalapeño, un nuovo chip progettato per ottimizzare le prestazioni nell’inferenza. I primi risultati di benchmark, condotti con InferenceX di Semianalysis, evidenziano un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia.

Il confronto è stato effettuato utilizzando un sistema Nvidia Blackwell come riferimento, ma OpenAI ha avvertito che la concorrenza potrebbe evolvere prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in collaborazione con Broadcom e integra i modelli di OpenAI nel processo di progettazione, con l’obiettivo di creare una piattaforma multigenerazionale in grado di coordinare chip, memoria e modelli.

L’architettura del chip è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso rappresentano colli di bottiglia durante l’inferenza. Come spiegato nel comunicato aziendale, “We designed Jalapeño to minimize data movement and communication delays.” Questo approccio consente di allocare e mantenere localmente lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte. In questo modo, il sistema può attivare la combinazione adeguata di calcolo, memoria e rete per ciascuna fase di inferenza.

Richard Ho, responsabile hardware di OpenAI, ha commentato: “The bottom line is that the results show a very, very significant performance advance over state of the art. Jalapeño can serve more AI work per unit of power, while also returning responses more quickly. It’s very efficient to serve a lot of customers, but it can also be very low latency.”

OpenAI prevede un primo dispiegamento in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa attesa per il 2027. Questo sviluppo potrebbe segnare un’importante evoluzione nel campo dell’intelligenza artificiale, portando a una maggiore efficienza e capacità di risposta nel servizio ai clienti.

Prossimo articolo Immagine rappresentativa della notizia su Uber Uber multata per 825 milioni di euro: il caso degli autisti sospesi