AI & computingGeneratieve AI & synthetische media

GPT-5.6 Sol: doorbraak in beeldherkenning bij OpenAI

· Bijgewerkt 17 augustus 2026, 15:24 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Hacker News frontpage

OpenAI heeft met het nieuwe model Sol een grote sprong gemaakt in beeldherkenning, blijkt uit onafhankelijke tests van AI-bedrijf Roboflow. Het model herkent en telt objecten in foto's veel beter dan zijn voorganger, maar blijft op kosten en snelheid achter bij concurrenten zoals Google's Gemini 3.5 Flash.

OpenAI heeft vorige week de GPT-5.6-modellenreeks gelanceerd, met daarin de varianten Sol, Terra en Luna. Tijdens de aankondiging lag de nadruk op AI-agents die zelfstandig met computers overweg kunnen: schermen lezen, knoppen aanklikken, formulieren invullen. Voor dat soort taken is goed beeldbegrip onmisbaar. Het Amerikaanse bedrijf Roboflow, gespecialiseerd in computervisie, testte daarom hoe goed de nieuwe modellen daadwerkelijk kunnen zien.

Sterke sprong bij objectdetectie en tellen

Roboflow gebruikte een eigen benchmark, een testset waarmee de prestaties van AI-modellen op uniforme wijze worden vergeleken. Die test meet onder meer visuele taalmodellen op objectdetectie, tellen, tekstherkenning en gegevensextractie. Bij objectdetectie ging Sol van een score van 13,8 naar 46,2 punten op de gangbare mAP-schaal, een meeteenheid die aangeeft hoe nauwkeurig een model objecten in een foto weet te lokaliseren. De voorganger GPT-5.5 scoorde daar dus fors slechter. Ook de goedkopere varianten Terra en Luna boekten met respectievelijk 44,7 en 43,3 punten forse winst.

Bij het tellen van objecten in een foto, zoals overlappende metalen haakjes of kogelgaten binnen een afgebakende zone, steeg de score van Sol naar 73 procent, tegen 64,9 procent voor GPT-5.5. Roboflow test dit soort taken omdat ze meer vragen dan simpelweg objecten herkennen: het model moet ook begrijpen welke objecten geteld moeten worden en binnen welke grenzen. Documenten met tabellen, tekstblokken en handtekeningen worden door Sol eveneens goed herkend, wat van belang is voor bedrijven die grote hoeveelheden scans automatisch willen verwerken.

Niet alles verliep vlekkeloos. Bij grote afbeeldingen, vanaf ongeveer tweeduizend bij tweeduizend pixels, plaatste Sol soms willekeurige kaders die niets met de werkelijke inhoud te maken hadden. OpenAI bevestigde tegenover Roboflow dat het model dan minder stabiel wordt, vooral als er weinig rekentijd voor nadenken wordt ingeruimd. Meer rekentijd verbetert de stabiliteit, maar verhoogt ook de kosten.

Tekstherkenning blijft gelijk, kosten lopen op

Bij het overtypen van tekst uit foto's, ofwel optische tekenherkenning (OCR), presteert Sol nauwelijks anders dan zijn voorganger: 90,7 procent tegen 91,2 procent nauwkeurigheid. Bij het gericht ophalen van één specifiek gegeven, zoals een datum of meetwaarde, scoorde Sol wel duidelijk lager dan GPT-5.5. Het model las overigens wel moeiteloos een bandenmaat op een vieze, versleten autoband en haalde een live sportuitslag uit een tv-uitzending.

De vooruitgang heeft een prijs. Sol gebruikt meer tokens per beeld, de reken-eenheden waarmee AI-modellen tekst en beeld verwerken, wat de kosten opdrijft naar zo'n 2,5 dollarcent per afbeelding, tegen minder dan een halve cent voor Luna. Qua latentie, de tijd tussen vraag en antwoord, doet Sol er gemiddeld tien seconden per beeld over. Concurrent Gemini 3.5 Flash van Google blijft daarbij goedkoper en sneller, en scoort in de benchmark van Roboflow zelfs nog hoger op detectie en tellen.

Toch is de vooruitgang volgens Roboflow moeilijk te negeren. Waar beeldherkenning tot nu toe een zwakke plek was van OpenAI, is dat met GPT-5.6 een bruikbare eigenschap geworden. Voor toepassingen als schermlezende AI-assistenten, documentverwerking en visuele naslagwerken maakt dat OpenAI een geloofwaardigere concurrent dan voorheen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Betere beeldherkenning is een randvoorwaarde voor AI-agents die straks zelfstandig schermen bedienen, documenten verwerken of drones en robots aansturen. De vooruitgang van Sol laat zien dat OpenAI dit gat met gespecialiseerde concurrenten dicht, al blijven kosten en snelheid voorlopig een drempel voor grootschalige toepassing.

Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen eerlijk met elkaar worden vergeleken.
Visueel taalmodel (VLM)
Een AI-model dat naast tekst ook afbeeldingen kan analyseren en daarover in gewone taal kan antwoorden.
Objectdetectie
De techniek waarmee een AI-model bepaalt waar specifieke objecten zich in een afbeelding bevinden.
mAP
Een meeteenheid (mean average precision) die aangeeft hoe nauwkeurig een model objecten in beelden weet te lokaliseren.
OCR
Optische tekenherkenning: de techniek waarmee software gedrukte of geschreven tekst in een afbeelding omzet naar bewerkbare tekst.
Token
De kleine tekst- of beeldeenheden waarmee AI-modellen informatie verwerken; meer tokens betekent meer rekenkosten.
Latentie
De tijd die verstrijkt tussen het stellen van een vraag aan een AI-model en het ontvangen van het antwoord.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media