AI & computingAgentic AI & autonome agents

Klein open AI-model verslaat GPT-5.6 Sol in zoektaken, voor honderdste van de prijs

· Bijgewerkt 5 augustus 2026, 23:36 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Onderzoekers van AI-bedrijf Castform trainden een compact open-source taalmodel van 4 miljard parameters dat even goed zoekopdrachten uitvoert als het veel grotere GPT-5.6 Sol van OpenAI. Dankzij een trainingstechniek genaamd reinforcement learning kost het kleine model honderd keer minder per zoekopdracht, terwijl het net zo accuraat blijft.

Grote AI-modellen zoals GPT-5.6 Sol zijn krachtig, maar duur en traag als ze herhaaldelijk moeten zoeken om een vraag te beantwoorden. Castform, een start-up gespecialiseerd in het trainen van AI-modellen, liet zien dat een veel kleiner open-source model met slechts 4 miljard parameters dezelfde zoekresultaten oplevert als het frontier-model van OpenAI. Het verschil in kosten is enorm: waar een zoekopdracht met GPT-5.6 Sol al snel 3 cent kost en meer dan 10 seconden duurt, is het kleine model honderd keer goedkoper.

Van simpele zoekopdracht naar slimme agent

Een paar jaar geleden volstond het om een taalmodel één keer relevante documenten te laten opzoeken, de bekende RAG-aanpak (retrieval-augmented generation). Inmiddels werken AI-systemen steeds vaker als autonome agents: ze zoeken meerdere keren achter elkaar, verfijnen hun vraag en combineren informatie uit verschillende bronnen voordat ze een antwoord geven. Elke zoekstap betekent een nieuwe aanroep van het onderliggende taalmodel. Bij dure frontier-modellen zoals GPT-5.6 Sol lopen de kosten en de wachttijd daardoor snel op, zeker bij toepassingen die veel gebruikers tegelijk bedienen.

Trainen met bedrijfsdata via Neon

Castform loste dit op door een klein model gericht te trainen op de taak waar het om gaat: zoeken. Bij deze vorm van training, reinforcement learning, probeert het model steeds opnieuw een zoekopdracht uit te voeren en krijgt het een beloning als het de juiste bron vindt, de juiste passage citeert en het juiste antwoord geeft. Voor deze aanpak is een grote hoeveelheid trainingsvragen nodig. Castform haalt die automatisch uit bestaande bedrijfsdata, zoals interne documentatie, klantvragen of wiki-pagina's, die het omzet in vraag-antwoordparen met een bijbehorend juist antwoord.

Voor de opslag en het doorzoeken van die data werkt Castform samen met databasebedrijf Neon. Neons Postgres-database combineert traditionele tekstzoekopdrachten (bekend als BM25) met zoeken op betekenis via zogeheten vector search, en voegt de resultaten van beide methodes samen tot één ranglijst. Tijdens het trainen worden duizenden van deze zoekopdrachten tegelijk uitgevoerd, in korte, hevige pieken. Neons database kan daarbij automatisch op- en afschalen, zodat er geen dure servercapaciteit hoeft te draaien die het grootste deel van de tijd stilstaat.

Een ander voordeel is dat Neon met zogeheten branching voor elke trainingspoging een eigen, geïsoleerde kopie van de database kan aanmaken. Zo kan het model vrij experimenteren, ook met opdrachten die data aanpassen, zonder dat verschillende trainingspogingen elkaar in de weg zitten of productiedata beschadigen.

Wat dit betekent voor bedrijven

Voor bedrijven die zelf AI-assistenten bouwen op hun eigen data, is dit een belangrijk signaal: een fors goedkoper, kleiner model inzetten hoeft niet ten koste te gaan van kwaliteit, mits het gericht is getraind op de eigen taak. Castform positioneert zichzelf als tool waarmee ontwikkelaars dit soort training kunnen uitvoeren zonder zelf kennis van machine learning of grafische rekenchips (gpu's) te hoeven hebben.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze ontwikkeling laat zien dat bedrijven niet per se afhankelijk zijn van dure frontier-modellen om AI-agents te bouwen die goed kunnen zoeken in hun eigen data. Door gericht te trainen op een specifieke taak kunnen kleine, open modellen het gat met grote gesloten modellen dichten tegen een fractie van de kosten. Dat maakt AI-agents die dagelijks duizenden zoekopdrachten uitvoeren, zoals klantenservicebots of interne kennisassistenten, ineens veel betaalbaarder om op grote schaal in te zetten.

Reinforcement learning
Een trainingsmethode waarbij een AI-model via vallen en opstaan leert: het probeert een taak uit en krijgt een beloning als het goed presteert, waardoor het zichzelf steeds verder verbetert.
Agentic AI
AI-systemen die niet in één stap reageren, maar zelfstandig meerdere acties na elkaar ondernemen, zoals meerdere keren zoeken, om tot een antwoord te komen.
Open-source model
Een AI-model waarvan de onderliggende bouwstenen (de zogeheten gewichten) openbaar beschikbaar zijn, zodat ontwikkelaars het zelf kunnen aanpassen en trainen.
Frontier-model
De term voor de meest geavanceerde, krachtigste AI-modellen die op een bepaald moment beschikbaar zijn, zoals GPT-5.6 Sol.
Vector search
Een zoekmethode waarbij tekst wordt omgezet in getallenreeksen die de betekenis weergeven, zodat een computer ook zoekopdrachten kan begrijpen die niet letterlijk dezelfde woorden gebruiken.
RAG (retrieval-augmented generation)
Een techniek waarbij een taalmodel eerst relevante documenten opzoekt en die informatie gebruikt om een beter onderbouwd antwoord te geven.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents