AI & computing › Generatieve AI & synthetische media
GPT-6 Astra herkent meer bugs bij code review, maar kost fors meer
OpenAI's nieuwe taalmodel GPT-6 Astra vindt in tests van codereview-bedrijf CodeRabbit merkbaar meer fouten in software dan voorgangers, vooral bij complexe wijzigingen die meerdere bestanden raken. Die extra intelligentie heeft wel een prijs: Astra is ruim twee keer zo duur in gebruik als het vorige topmodel.
Softwarebedrijf CodeRabbit heeft OpenAI's nieuwste AI-model GPT-6 Astra getest op het vinden van fouten in programmeercode. Uit het onderzoek blijkt dat Astra ongeveer 4% meer bugs opspoort dan het eerdere model GPT-5.6 Sol, en 22% meer dan concurrent Opus 5 van AI-bedrijf Anthropic. Bij code review controleren ontwikkelaars elkaars programmeerwerk voordat het wordt toegevoegd aan een softwareproject. Traditioneel is dat mensenwerk, maar AI-modellen nemen steeds meer van die taak over.
Sterker bij complexe fouten
Het grootste verschil zien onderzoekers bij de lastigste gevallen: fouten die ontstaan doordat een aanpassing in het ene bestand iets breekt in een ander bestand, verderop in de software. Bij dit soort cross-file problemen vindt Astra 20% meer bugs dan Sol en zelfs 33% meer dan Opus 5. Volgens CodeRabbit duidt dit erop dat het model beter is geworden in het combineren van verspreide informatie tot een sluitende conclusie, in plaats van simpelweg meer tekst te kunnen verwerken. Dat is belangrijk, want een wijziging kan er op zichzelf prima uitzien terwijl hij toch iets anders in het systeem kapotmaakt.
Fors hogere kosten per taak
De extra rekenkracht die Astra gebruikt om dieper na te denken, heeft een duidelijke prijs. Volgens de officiële tarieven van OpenAI kost het gebruik van Astra via de API 10 dollar per miljoen invoertokens en 50 dollar per miljoen uitvoertokens. Dat is 2,5 keer zoveel als het goedkopere model Sol, en ongeveer 47 keer zoveel als het instapmodel Luna. Ter vergelijking: Claude Fable 5.1 van Anthropic rekent exact dezelfde tarieven. CodeRabbit benadrukt dat een hogere prijs per token niet automatisch een hogere prijs per opgeloste taak betekent: als een model minder pogingen nodig heeft om tot een goed antwoord te komen, kan het per saldo alsnog goedkoper uitpakken.
Meer dan alleen code
CodeRabbit denkt dat de kracht van Astra ook buiten code review nuttig kan zijn, bijvoorbeeld bij het samenvatten van tegenstrijdige onderzoeksrapporten of het naspeuren van fouten in technische documentatie. Het bedrijf test dit nog niet actief, maar wijst op de gemeenschappelijke deler: taken waarbij bewijs verspreid zit over meerdere bronnen die met elkaar in verband gebracht moeten worden. Als test bouwde CodeRabbit ook een volledige game met Astra, genaamd NIGHTSHIFT, om te zien hoe het model omgaat met het balanceren van complexe, onderling afhankelijke spelsystemen. Het advies van de onderzoekers aan bedrijven: laat een duur model als Astra draaien naast een goedkoper model op dezelfde taken, en vergelijk pas dan de kwaliteit en de totale kosten voordat je overstapt.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-modellen steeds beter worden in het doorgronden van complexe, verspreide informatie, kunnen ze niet alleen software controleren maar ook helpen bij het napluizen van rapporten, logboeken en juridische documenten. Tegelijk laat dit voorbeeld zien dat krachtigere AI vaak duurder is, waardoor bedrijven straks steeds vaker moeten afwegen of de meerprijs opweegt tegen de tijdswinst.
- Code review
- Het proces waarbij programmeurs elkaars code controleren op fouten voordat die wordt toegevoegd aan een softwareproject.
- Token
- Een stukje tekst (ongeveer een woorddeel) dat een AI-taalmodel als rekeneenheid gebruikt; API-kosten worden vaak per miljoen tokens berekend.
- Cross-file review
- Het controleren van code waarbij een wijziging in één bestand gevolgen heeft voor code in een ander bestand.
- API
- Een gestandaardiseerde manier waarop software, zoals een AI-model, kan worden aangeroepen door andere programma's.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.