Innovazione e tecnologie

OpenAI presenta Jalapeño: il chip ad alte prestazioni per l’inferenza

Chip Jalapeño di OpenAI

In Breve

Cosa è Jalapeño?
Jalapeño è un chip presentato da OpenAI progettato per migliorare le prestazioni nell'inferenza.
Quali sono i vantaggi di Jalapeño?
Jalapeño offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai chip attuali.
Quando sarà disponibile Jalapeño?
Il primo dispiegamento di Jalapeño è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.

Durante la conferenza Hot Chips, OpenAI ha svelato Jalapeño, un chip innovativo progettato per ottimizzare le prestazioni nell’inferenza. I risultati preliminari dei benchmark condotti da InferenceX di Semianalysis evidenziano sia un incremento significativo nel numero di token elaborati per utente, sia una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia.

Il confronto è stato effettuato utilizzando come riferimento un sistema Nvidia Blackwell. Tuttavia, OpenAI ha avvertito che la concorrenza nel settore potrebbe evolversi rapidamente prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in stretta collaborazione con Broadcom, integrando i modelli proprietari di OpenAI nel processo di progettazione. L’azienda prevede che questa piattaforma diventi multigenerazionale, capace di coordinare chip, memoria e modelli in modo efficiente.

L’architettura di Jalapeño è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso rappresentano colli di bottiglia durante il processo di inferenza. Come dichiarato nel comunicato aziendale, “Abbiamo progettato Jalapeño per minimizzare il movimento dei dati e i ritardi di comunicazione.” Questo significa che lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, può essere allocato e mantenuto localmente. Ciò consente al sistema di attivare la combinazione adeguata di calcolo, memoria e rete per ogni fase dell’inferenza.

Richard Ho, responsabile hardware di OpenAI, ha commentato i risultati ottenuti: “In sintesi, i risultati mostrano un avanzamento delle prestazioni molto significativo rispetto allo stato dell’arte. Jalapeño può gestire più lavoro di intelligenza artificiale per unità di potenza, restituendo risposte più rapidamente. È molto efficiente nel servire un gran numero di clienti, ma può anche garantire una latenza molto bassa.”

OpenAI prevede un primo dispiegamento di Jalapeño in volumi ridotti entro la fine del 2026, con una distribuzione più significativa programmata per il 2027. Questa innovazione potrebbe rappresentare un passo fondamentale nel miglioramento delle capacità di inferenza nei sistemi di intelligenza artificiale, aprendo la strada a nuove applicazioni e servizi.

redazione

Autore di Scenario Innovazione.

Tutti gli articoli →