AI & computing › Generatieve AI & synthetische media
OpenAI lanceert Ultrafast: GPT-5.6 Sol wordt tot 14 keer sneller dankzij Cerebras
OpenAI test een nieuwe versnelling voor zijn AI-model GPT-5.6 Sol: Ultrafast mode. Dankzij chips van partner Cerebras produceert het model tot 750 tokens per seconde, veertien keer sneller dan normaal. Daarmee wil OpenAI taken mogelijk maken die tot nu toe simpelweg te traag verliepen, zoals live meekijken tijdens een storing of fraude opsporen terwijl een transactie nog loopt.
OpenAI opent een nieuwe versnelling voor zijn AI-model. Met de preview van Ultrafast mode kan GPT-5.6 Sol tot 750 outputtokens per seconde produceren, veertien keer sneller dan de standaardsnelheid. Die snelheidswinst komt niet van OpenAI zelf, maar van chipmaker Cerebras, waarmee het bedrijf eerder dit jaar een partnership van tien miljard dollar sloot.
Normaal moeten gebruikers kiezen tussen een groot, krachtig redeneermodel dat traag antwoordt, of een klein, snel model met minder redeneervermogen. Ultrafast mode moet dat dilemma oplossen door de volledige capaciteit van een groot model te combineren met de snelheid van een compact model. OpenAI noemt dit 'meer nuttig werk per seconde'.
De functie is vooralsnog alleen beschikbaar via de OpenAI API, uitsluitend voor GPT-5.6 Sol en beperkt tot een selecte groep klanten. Bedrijven die toegang willen, kunnen zich aanmelden via een wachtlijst. OpenAI breidt de toegang geleidelijk uit naarmate er meer rekencapaciteit beschikbaar komt.
Nieuwe toepassingen door snelheid
Een hogere verwerkingssnelheid opent volgens OpenAI de deur naar taken die voorheen te traag verliepen om nuttig te zijn tijdens een lopend proces. Bij een storing in een IT-systeem kunnen engineers bijvoorbeeld logbestanden, codewijzigingen en foutrapporten laten analyseren terwijl de storing nog bezig is, zodat ze sneller de oorzaak vinden en een oplossing voorbereiden. OpenAI zegt dit model al intern op deze manier te gebruiken.
Het bedrijf noemt nog meer praktijkvoorbeelden. In de financiële sector zou een model marktbewegingen en verdachte transacties kunnen beoordelen terwijl de situatie nog verandert. Bij klantenservice kunnen ingewikkelde vragen in realtime worden afgehandeld, ook als daarvoor meerdere stappen of systemen nodig zijn. In de webwinkelbranche kan een model productvragen beantwoorden, voorraden checken en aanbevelingen personaliseren voordat een twijfelende koper afhaakt.
Ook onderzoek profiteert. Experimenten die vroeger als nachtelijke batchklus draaiden, kunnen dankzij de hogere snelheid interactieve werksessies worden. Onderzoekers testen dan een idee, bekijken meteen de uitkomst, sturen bij en starten een nieuwe poging, zonder dat het proces stilvalt.
Snelheid als verdienmodel
OpenAI verkoopt verwerkingssnelheid al in lagen. Via de API bestaat een 'Fast Mode' die GPT-5.6 Sol tot 2,5 keer sneller maakt tegen ongeveer het dubbele tarief en een lagere latentie. Ultrafast mode voegt daar een derde, nog snellere en vermoedelijk duurdere laag aan toe.
Die aanpak lijkt op wat clouddiensten als Amazon Web Services al jaren doen: extra betalen voor meer rekenkracht en kortere wachttijden. OpenAI past dat principe nu toe op AI-inferentie, het proces waarbij een getraind model daadwerkelijk tokens genereert als antwoord. Als snelheid in steeds meer sectoren de bottleneck wordt, verzekert dit gelaagde prijsmodel OpenAI van een rechtstreeks aandeel in de productiviteitswinst die snellere AI oplevert.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Snellere AI-modellen maken realtime toepassingen mogelijk die voorheen ondenkbaar waren, van live crisisrespons tot razendsnelle fraudedetectie. Door snelheid als apart, duurder product te verkopen, verandert OpenAI verwerkingssnelheid in een nieuwe inkomstenbron naast modelkwaliteit. Dit kan de manier waarop bedrijven AI inzetten fundamenteel versnellen, mits de kosten voor bedrijven opwegen tegen de tijdswinst.
- Ultrafast mode
- Een nieuwe, snelle uitvoeringsmodus van OpenAI die via de API beschikbaar is voor het model GPT-5.6 Sol.
- GPT-5.6 Sol
- Het vlaggenschipmodel van OpenAI waarop Ultrafast mode als eerste wordt toegepast.
- Cerebras
- Amerikaanse chipfabrikant die gespecialiseerde hardware levert om AI-modellen sneller te laten rekenen, en partner van OpenAI in een tien-miljard-dollardeal.
- Outputtokens per seconde
- De maateenheid voor hoe snel een AI-model tekst genereert; hoe hoger dit getal, hoe sneller een antwoord verschijnt.
- API
- Een interface waarmee software van andere bedrijven verbinding kan maken met de AI-modellen van OpenAI.
- Redeneermodel
- Een AI-model dat complexe taken in meerdere stappen doordenkt voordat het een antwoord geeft, doorgaans trager dan eenvoudige modellen.
- Inferentie
- Het proces waarbij een al getraind AI-model daadwerkelijk een antwoord of resultaat produceert.
- Fast Mode
- Een bestaande, snellere API-optie van OpenAI die tot 2,5 keer snellere antwoorden geeft tegen een hoger tarief dan de standaardmodus.
- Latentie
- De vertraging tussen het versturen van een vraag aan een AI-model en het ontvangen van het eerste stukje antwoord.
- Tokens
- De kleine tekstfragmenten (woorddelen) waarin AI-taalmodellen tekst opdelen om te verwerken en te genereren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.