In Breve
- Cosa è Jalapeño di OpenAI?
- Jalapeño è un chip progettato da OpenAI per migliorare le prestazioni nell'inferenza, presentato alla conferenza Hot Chips.
- Quali sono i vantaggi di Jalapeño?
- Il chip offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attuali.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
Durante la conferenza Hot Chips, OpenAI ha presentato Jalapeño, un chip innovativo progettato per ottimizzare le prestazioni nell’inferenza. I risultati dei benchmark realizzati su InferenceX di Semianalysis evidenziano un aumento significativo sia nel numero di token per utente sia nella throughput per kilowatt, rispetto ai processori di inferenza attualmente considerati all’avanguardia.
Il confronto è stato effettuato utilizzando come riferimento il sistema Nvidia Blackwell. Tuttavia, OpenAI ha avvertito che la concorrenza potrebbe evolversi rapidamente prima della piena distribuzione del prodotto. Questo chip è stato sviluppato in stretta collaborazione con Broadcom, integrando i modelli di OpenAI nel processo di progettazione.
Jalapeño è concepito per diventare una piattaforma multigenerazionale, in grado di coordinare chip, memoria e modelli. L’architettura è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che rappresentano colli di bottiglia durante l’inferenza. Come affermato nel comunicato aziendale: “We designed Jalapeño to minimize data movement and communication delays.” Questo significa che lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, può essere allocato e mantenuto localmente, mentre il sistema attiva la combinazione adeguata di calcolo, memoria e rete per ogni fase di inferenza.
Richard Ho, responsabile hardware di OpenAI, ha commentato i risultati, affermando: “The bottom line is that the results show a very, very significant performance advance over state of the art. Jalapeño can serve more AI work per unit of power, while also returning responses more quickly. It’s very efficient to serve a lot of customers, but it can also be very low latency.”
OpenAI prevede un primo dispiegamento in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa programmata per il 2027. Questa innovazione potrebbe rappresentare un punto di svolta nel settore dell’intelligenza artificiale, migliorando l’efficienza e la velocità dei servizi AI per gli utenti di tutto il mondo.
