AI & computing › Generatieve AI & synthetische media
OpenAI's eerste eigen AI-chip Jalapeño verslaat Nvidia in inferentietests
OpenAI heeft op de Hot Chips-conferentie de eerste prestatiecijfers getoond van Jalapeño, zijn eerste zelfontworpen chip voor AI-inferentie. Onafhankelijk geverifieerde benchmarks laten zien dat de chip zuiniger en sneller is dan Nvidia's nieuwste Blackwell- en Rubin-systemen, ondanks dat het OpenAI's allereerste chipontwerp is.
OpenAI bouwt al jaren zijn AI-modellen op chips van Nvidia, maar daar lijkt verandering in te komen. Samen met chipontwerper Broadcom ontwikkelde het bedrijf Jalapeño, een inferentiechip die specifiek is gemaakt om getrainde AI-modellen te laten draaien, niet om ze te trainen. Op de vakconferentie Hot Chips presenteerde OpenAI de eerste benchmarks, deels gecontroleerd door analistenbureau SemiAnalysis in zijn eigen lab.
De cijfers zijn opvallend voor een eerste generatie chip. Jalapeño zou 1,5 tot 1,9 keer meer rekenwerk per watt uitvoeren dan de beste beschikbare systemen van concurrenten, met een reactietijd die tot 3,6 keer korter is. Bij interactieve toepassingen, zoals een chatgesprek waarbij snelheid direct voelbaar is voor de gebruiker, loopt het voordeel op tot een factor vier. De tests gebeurden met drie grote taalmodellen: GPT-OSS 120B, Deepseek R1 670B en Kimi K2.5 1T. Bij gelijke snelheid verwerkte Jalapeño tot 104 keer meer tokens per kilowatt dan de snelste concurrerende chip. SemiAnalysis-topman Dylan Patel noemt dat ongebruikelijk: eerste generatie chips zijn doorgaans niet competitief, maar Jalapeño verslaat zowel Blackwell als het nog niet uitgeleverde Rubin-platform van Nvidia.
Nog geen kant-en-klaar product
Er zijn ook duidelijke kanttekeningen. Jalapeño maakt nog geen gebruik van optimalisatietechnieken zoals speculatief decoderen en multi-token prediction, terwijl concurrerende chips dat wel doen. Daarnaast zijn de vergeleken Nvidia-systemen al bij klanten in gebruik, terwijl Jalapeño het stadium van engineeringmonsters nog niet voorbij is. Ook ontbreken nog testresultaten met de allernieuwste, nog grotere modellen die Nvidia en AMD inmiddels wel hebben doorgerekend. Op het gebied van totale kosten per verwerkt token komen Jalapeño en Nvidia's Vera Rubin-platform, dat net als Jalapeño gebruikmaakt van HBM4-geheugen, ongeveer gelijk uit.
Chipontwerp in recordtempo
Opvallend is ook hoe snel Jalapeño tot stand kwam. Het ontwerptraject startte medio 2024 en het definitieve ontwerp ging in november 2025 naar de fabriek. Tussen het allereerste chipontwerp en de definitieve blauwdruk zat volgens OpenAI slechts negen maanden. Het bedrijf zegt daarbij zijn eigen AI-modellen te hebben ingezet: oudere modelversies hielpen bij het ontwerp van de ASIC, nieuwere versies versnelden de programmering en optimalisatie. Volgens SemiAnalysis relativeert dat de zogeheten 'CUDA-moat', het idee dat Nvidia's softwareplatform concurrenten decennialang buiten de deur houdt.
Aanvulling op bestaande partners
OpenAI-CFO Sarah Friar benadrukt dat Jalapeño past binnen een bredere strategie waarin datacenters, chips, modellen en producten als één geheel worden ontwikkeld. Ze stelt dat de chip de bestaande samenwerkingen met Nvidia, AMD, AWS, Cerebras en CoreWeave aanvult in plaats van vervangt. Die relatie is niet zonder spanning: Nvidia, AMD en AWS zijn tegelijk investeerder, leverancier én chipconcurrent van OpenAI.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als OpenAI zijn eigen chips daadwerkelijk grootschalig gaat inzetten, wordt het minder afhankelijk van Nvidia en kan het mogelijk goedkoper en sneller AI-diensten leveren. Het signaal dat een AI-bedrijf in negen maanden een concurrerende chip kan ontwerpen, met hulp van zijn eigen AI-modellen, kan de dominantie van gevestigde chipmakers onder druk zetten.
- Inferentie
- Het daadwerkelijk gebruiken van een al getraind AI-model om antwoorden of resultaten te genereren, in tegenstelling tot het trainen van het model.
- Tokens per seconde
- De maatstaf voor hoe snel een AI-model tekst genereert; hogere waarden betekenen vlottere antwoorden.
- HBM4
- De nieuwste generatie 'high bandwidth memory', supersnel geheugen dat vlak bij de chip zit en cruciaal is voor AI-prestaties.
- Multi-token prediction
- Een techniek waarbij een AI-model meerdere woorddelen tegelijk voorspelt in plaats van één voor één, wat de snelheid verhoogt.
- Tape-out
- Het moment waarop een definitief chipontwerp wordt overgedragen aan de fabriek voor productie; hierna zijn grote wijzigingen niet meer mogelijk.
- CUDA-moat
- De term voor het concurrentievoordeel dat Nvidia zou hebben dankzij zijn softwareplatform CUDA, waar veel AI-software van afhankelijk is.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.