OpenAI presenta Jalapeño: il chip che rivoluziona l’inferenza AI
In Breve
- Cosa è Jalapeño?
- Jalapeño è un chip progettato da OpenAI per migliorare l'efficienza nell'inferenza AI.
- Quali sono i vantaggi di Jalapeño?
- Offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai chip attuali.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
Alla recente conferenza Hot Chips, OpenAI ha svelato Jalapeño, un chip innovativo progettato per ottimizzare l’inferenza nell’intelligenza artificiale. I primi risultati di benchmark, condotti su InferenceX di Semianalysis, rivelano che Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia.
Il confronto effettuato da OpenAI ha preso come riferimento un sistema Nvidia Blackwell. Tuttavia, l’azienda ha avvertito che la concorrenza nel settore potrebbe evolversi rapidamente prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in stretta collaborazione con Broadcom, utilizzando modelli proprietari nel processo di progettazione, con l’obiettivo di creare una piattaforma multigenerazionale in grado di coordinare chip, memoria e modelli.
L’architettura di Jalapeño è stata concepita per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso costituiscono colli di bottiglia durante l’inferenza. Come spiegato nel comunicato aziendale, “Abbiamo progettato Jalapeño per minimizzare il movimento dei dati e i ritardi di comunicazione.” Ciò significa che lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, può essere allocato e mantenuto localmente, mentre il sistema attiva la combinazione adeguata di calcolo, memoria e rete per ogni fase di inferenza.
Richard Ho, responsabile hardware di OpenAI, ha commentato: “I risultati mostrano un avanzamento delle prestazioni molto significativo rispetto allo stato dell’arte. Jalapeño può gestire più lavoro AI per unità di potenza, restituendo risposte in modo più rapido. È molto efficiente nel servire un gran numero di clienti, mantenendo anche una bassa latenza.”
OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa prevista per il 2027. Questo sviluppo rappresenta un passo importante verso l’ottimizzazione dell’inferenza AI, promettendo di migliorare l’efficienza energetica e le prestazioni complessive nel settore.
