AI & computing › Neuromorfe & fotonische chips
OpenAI's eerste eigen AI-chip Jalapeño is tot 1,9 keer zuiniger dan Nvidia
OpenAI heeft zijn eerste zelfontworpen chip voor AI-berekeningen gepresenteerd. Jalapeño doet tot 1,9 keer meer werk per watt dan vergelijkbare Nvidia-systemen en reageert tot 3,6 keer sneller. Het bedrijf wil de chip vanaf eind 2026 inzetten in zijn eigen datacenters.
OpenAI bouwt niet langer alleen taalmodellen, maar ook de chips waarop ze draaien. De nieuwe inferentiechip Jalapeño is getest op drie bekende open modellen: GPT-OSS 120B, DeepSeek R1 670B en Kimi K2.5 met maar liefst duizend miljard parameters. Volgens OpenAI presteert de chip daarbij 1,5 tot 1,9 keer beter per watt dan de vergelijkingssystemen, en is de reactietijd tot 3,6 keer korter. Bij interactieve toepassingen, waarbij gebruikers direct antwoord verwachten, loopt de prestatiewinst zelfs op tot een factor vier. De tests zijn uitgevoerd met de publieke InferenceX-benchmark van onderzoeksbureau SemiAnalysis, zodat de resultaten onafhankelijk te controleren zijn.
Twee taken, één chip
Het slimme aan Jalapeño zit in de aanpak van een bekend probleem bij AI-inference. Als een chatbot een vraag krijgt, gebeurt dat in twee fasen. Eerst leest het systeem de prompt van de gebruiker: dat kost vooral rekenkracht. Daarna genereert het model het antwoord woord voor woord, en dat proces hangt juist af van hoe snel data tussen geheugen en processor heen en weer kan. De meeste chips zijn geoptimaliseerd voor het één of het ander. Jalapeño combineert beide taken in dezelfde architectuur en houdt de KV-cache dicht bij de rekeneenheden die haar nodig hebben. Ook het netwerk tussen de chips is in het ontwerp geïntegreerd, zodat er minder data heen en weer hoeft te reizen. Dat scheelt vooral bij AI-agents die tientallen stappen achter elkaar uitvoeren: elke seconde vertraging per stap telt dan dubbel zo hard mee.
AI ontwierp mee aan zijn eigen opvolger
Opvallend is dat OpenAI zijn eigen taalmodellen inzette bij het ontwerpproces. Engineers gebruikten AI om ontwerpen te verkennen, verificatiecycli te verkorten en rekenkundige schakelingen te optimaliseren. Het team ging in negen maanden van eerste schets naar tapeout, het moment waarop een chipontwerp definitief naar de fabriek gaat. Daarna zette OpenAI de programmeertool Codex, gecombineerd met het model GPT-Astra, in om binnen twee maanden drie extra open modellen optimaal op Jalapeño te laten draaien. Voor bepaalde onderdelen van GPT-OSS bleek AI-gegenereerde code zelfs 1,5 tot 1,8 keer sneller dan implementaties die door ervaren engineers met de hand waren geschreven. OpenAI benadrukt dat dit voordeel geldt voor losse onderdelen, niet voor complete modellen.
De chip is officieel geschikt voor 700 watt, maar bleef tijdens de tests op 550 watt of lager. OpenAI wil Jalapeño eind 2026 in gebruik nemen in zijn eigen infrastructuur. Het is de eerste chip in een reeks: een tweede en derde generatie zijn al in ontwikkeling. Het doel is duidelijk: naarmate AI-modellen groter en veeleisender worden, moet gespecialiseerde hardware helpen om de energiekosten van kunstmatige intelligentie beheersbaar te houden.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als grote AI-bedrijven hun eigen chips ontwikkelen in plaats van volledig af te hangen van externe leveranciers zoals Nvidia, kan dat de energiekosten en wachttijden van AI-diensten flink verlagen. Dat is belangrijk omdat de vraag naar rekenkracht voor AI wereldwijd blijft groeien, terwijl energie en chipcapaciteit schaars zijn. Het gebruik van AI om zelf chips te helpen ontwerpen kan bovendien toekomstige ontwikkelcycli van hardware versnellen.
- Inferentiechip
- Een processor die specifiek is ontworpen om AI-modellen antwoorden te laten genereren, in tegenstelling tot chips die gebruikt worden om modellen te trainen.
- KV-cache
- Een geheugentruc waarbij een AI-model eerdere berekeningen bewaart, zodat het bij het genereren van elk volgend woord niet alles opnieuw hoeft uit te rekenen.
- Prefill
- De eerste fase van AI-inference, waarin het model de volledige prompt van de gebruiker inleest en verwerkt. Dit vraagt vooral veel rekenkracht.
- Decode
- De fase waarin het model het antwoord woord voor woord genereert. Deze fase hangt sterk af van hoe snel data tussen geheugen en processor kan bewegen.
- Tapeout
- Het moment waarop een chipontwerp definitief wordt afgerond en overgedragen aan de fabriek voor productie.
- Latentie
- De tijd die verstrijkt tussen een verzoek aan een systeem en het moment waarop het antwoord binnenkomt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.