AI & computing › Generatieve AI & synthetische media

Diffusie-taalmodellen: AI die hele zinnen tegelijk schrijft in plaats van woord voor woord

· Bijgewerkt 31 augustus 2026, 04:12 · 2 min leestijd

Generatieve AI & synthetische media
Foto: Cdr. Trevor D. Biscope, CA Emerit (CC BY-SA, via Openverse)

Taalmodellen zoals ChatGPT schrijven van oudsher woord voor woord, van links naar rechts. Onderzoekers van de Kuleshov Group aan Cornell laten zien hoe een nieuwe generatie AI-modellen tekst juist in één keer genereert en die vervolgens stap voor stap verfijnt, een techniek die al bekend was van beeldgeneratie. Grote techbedrijven als Google, NVIDIA en Inception Labs brengen dit jaar de eerste commerciële versies van zulke diffusie-taalmodellen uit.

De meeste chatbots van dit moment, van ChatGPT tot Claude, zijn autoregressieve modellen. Ze voorspellen tekst woord voor woord, van links naar rechts, waarbij elk nieuw woord afhangt van alles wat ervoor is geschreven. Dat werkt goed, maar heeft ook nadelen: een fout die eenmaal is gemaakt, kan niet meer worden hersteld, het genereren duurt net zo lang als de tekst lang is, en het model kan nooit vooruitkijken naar wat er nog komt.

Onderzoekers van de Kuleshov Group, verbonden aan Cornell University, beschrijven in een uitgebreid overzichtsartikel — gebaseerd op lezingen op de AI-conferenties ICLR en MLSS in 2026 — hoe een alternatieve aanpak steeds serieuzer wordt: het diffusiemodel. Deze techniek is al jaren de standaard voor het genereren van afbeeldingen, bijvoorbeeld bij Midjourney en Stable Diffusion, en wordt nu ook toegepast op tekst.

Van ruis naar zin

Bij beeldgeneratie werkt denoising, of ontruizen, als volgt: een model leert een foto die volledig uit willekeurige ruis bestaat, stap voor stap om te vormen tot een scherpe afbeelding. Voor tekst is dat lastiger, omdat je geen 'beetje ruis' aan een los woord kunt toevoegen zoals bij pixels. De oplossing die de onderzoeksgroep populair maakte, heet gemaskeerde diffusie: in plaats van ruis worden woorden simpelweg verborgen achter een masker, vergelijkbaar met een invuloefening.

Een diffusie-taalmodel begint bij het genereren van tekst met een compleet gemaskeerde zin, dus louter blanco plekken. Vervolgens vult een bidirectionele transformer — een AI-model dat zowel naar voorafgaande als naar latere woorden kan kijken — een deel van die plekken in. Daarna wordt een deel van de nieuw ingevulde woorden willekeurig weer gemaskeerd, waarna het model opnieuw een gokje waagt. Dit 'invullen en weer verbergen' herhaalt zich enkele tientallen keren, waarbij elke ronde meer woorden definitief vaststaan, tot er een volledige, samenhangende tekst overblijft.

Sneller én zelfcorrigerend

Dit proces levert twee belangrijke voordelen op ten opzichte van klassieke large language models. Ten eerste kan het model fouten later in het proces nog rechtzetten, omdat niets definitief vastligt tot de laatste stap. Ten tweede is generatie potentieel veel sneller: waar een autoregressief model exact zoveel stappen nodig heeft als er woorden zijn, kan een diffusiemodel met minder verfijningsrondes al een bruikbaar resultaat geven, en zo snelheid tegen kwaliteit afwegen.

Tot 2024 bleef diffusie voor tekst vooral een academisch experiment, omdat de kwaliteit achterbleef bij autoregressieve modellen. Dat kantelde snel: inmiddels hebben Google (met Gemma Diffusion), techbedrijf Inception Labs (met Mercury 2) en chipmaker NVIDIA (met Nemotron Diffusion) eigen diffusie-taalmodellen uitgebracht die qua kwaliteit meekunnen met gangbare chatbots. De onderzoekers benadrukken dat er nog volop werk te doen is, onder meer aan het genereren van teksten met een variabele lengte en aan het verder trainen van deze modellen na de eerste, ongerichte trainingsfase.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als diffusie-taalmodellen qua kwaliteit blijven meegroeien met de gangbare chatbots, kunnen toekomstige AI-assistenten aanzienlijk sneller antwoorden en minder gevoelig zijn voor vroege fouten die zich opstapelen. Dat kan vooral schelen bij toepassingen waar snelheid cruciaal is, zoals live coding-assistenten of realtime vertaling.

Autoregressief model
Een taalmodel dat tekst woord voor woord genereert, van links naar rechts, waarbij elk nieuw woord afhangt van de eerdere woorden.
Diffusiemodel
Een AI-techniek die begint met willekeurige ruis of gemaskeerde data en die in stappen omvormt tot een compleet, samenhangend resultaat, zoals een afbeelding of tekst.
Denoising (ontruizen)
Het stapsgewijs verwijderen van ruis of onzekerheid uit data, waardoor een diffusiemodel geleidelijk een scherp eindresultaat opbouwt.
Large language model
Een groot taalmodel dat getraind is op enorme hoeveelheden tekst en daardoor mensachtige teksten kan begrijpen en genereren.
Gemaskeerde diffusie
Een vorm van diffusie voor tekst waarbij woorden niet met ruis worden vervuild maar tijdelijk worden verborgen achter een masker, waarna het model leert die plekken weer in te vullen.
Bidirectionele transformer
Een AI-model dat bij het voorspellen van een woord zowel naar de voorafgaande als naar de latere tekst kan kijken, in tegenstelling tot modellen die alleen terugkijken.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media