AI & computing › Generatieve AI & synthetische media
Google verandert bestaand taalmodel in razendsnelle 'diffusie'-versie
Google DeepMind heeft een bestaand taalmodel omgebouwd tot een tekstgenerator die in één keer hele blokken tekst verwerkt in plaats van woord voor woord. Het resultaat, DiffusionGemma, is tot enkele keren sneller dan het origineel en hoefde niet vanaf nul getraind te worden. Wel gaat de snelheidswinst nog gepaard met concessies aan kwaliteit.
De meeste chatbots van dit moment, zoals de bekende Gemini- en GPT-modellen, genereren tekst woord voor woord: het volgende woord wordt pas bedacht als het vorige vaststaat. Google DeepMind laat nu zien dat het ook anders kan. Het bedrijf nam zijn bestaande taalmodel Gemma 4 en bouwde dat om tot een zogeheten diffusiemodel: een systeem dat, net als AI die plaatjes maakt, een heel blok van 256 woorddelen tegelijk vanuit ruis opbouwt tot samenhangende tekst. Het resultaat heet DiffusionGemma en werd in juni al als model vrijgegeven; nu volgt het technische rapport met de details.
Hertrainen in plaats van opnieuw beginnen
Opvallend is dat Google niet bij nul begon. Het team gebruikte het bestaande model Gemma-4-26B-A4B als basis en zette dat via aanvullende training om in een diffusiemodel, met minder dan tien procent van het oorspronkelijke trainingsbudget. Dat scheelt enorm in rekenkracht en kosten. Op een Nvidia H100-chip haalt DiffusionGemma ongeveer 1500 tokens per seconde, meerdere keren sneller dan Gemma 4 zelf en dan eerdere diffusiemodellen, bij een vergelijkbare nauwkeurigheid.
De omzetting verloopt in twee trainingsstappen. Eerst leert het model om tekstblokken met ruis te herstellen tot leesbare tekst. Daarna volgt een gecombineerde fase die Google SD·RL noemt: een mix van reinforcement learning, die de kwaliteit van antwoorden verbetert, en een techniek die het aantal benodigde rekenstappen flink verlaagt. Door beide te combineren, stijgt de score op redeneertaken met gemiddeld tien punten, terwijl het model bijna vier keer zoveel tokens per rekenstap verwerkt. Antwoorden worden daarnaast ongeveer 50 procent korter, wat de snelheid verder ten goede komt.
Zelfcorrectie tijdens het denken
Een gewoon taalmodel moet zich meteen vastleggen op het eerste cijfer van een antwoord, nog voordat de redenering is afgerond. In een rekenvoorbeeld uit het rapport begint Gemma 4 met het foutieve antwoord "-1", merkt tijdens de uitleg dat "-25" klopt, en plakt de correctie er achteraf aan vast. DiffusionGemma ontwikkelt antwoord en redenering tegelijk, waardoor het fouten kan herstellen voordat de tekst definitief is. Bij sudoku's, waar elk vakje afhangt van vakjes die pas later worden ingevuld, profiteert het model daar sterk van: na een korte extra training lost het zo'n 85 procent van de puzzels correct op, terwijl het originele Gemma 4 daar volledig op vastloopt. Ook gestructureerde output zoals programmeercode of JSON-bestanden is klaar na maar twee tot drie verfijningsstappen.
Nog geen vervanger voor bestaande modellen
DiffusionGemma haalt niet het kwaliteitsniveau van het originele Gemma 4 op de meeste benchmarks. Google wijt dat aan de korte, achteraf toegevoegde training en aan het feit dat architectuur en trainingsdata niet specifiek voor diffusie zijn ontworpen. Het model raakt soms vast in herhalingslussen en vergeet bij complexere taken weleens delen van zijn redenering netjes af te sluiten. Ook geldt het snelheidsvoordeel vooral bij één gebruiker tegelijk: zodra ongeveer 32 verzoeken gelijktijdig binnenkomen, halen gewone taalmodellen de achterstand in doorvoersnelheid in. Google noemt DiffusionGemma daarom nadrukkelijk experimenteel en heeft het via fine-tuning-vriendelijke licenties vrijgegeven, zodat andere onderzoekers ermee kunnen bouwen. Het model wordt al gebruikt door het startup Interfaze voor meertalige spraakherkenning en in onderzoek naar het automatisch opstellen van radiologieverslagen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? DiffusionGemma laat zien dat bestaande taalmodellen omgebouwd kunnen worden tot snellere varianten zonder de dure en tijdrovende stap van trainen vanaf nul. Dat kan de ontwikkeling van energiezuinige, gespecialiseerde AI-modellen versnellen, al is er nog werk nodig voordat de kwaliteit die van huidige taalmodellen evenaart.
- Diffusiemodel
- Een AI-systeem dat output opbouwt door stapsgewijs ruis te verwijderen, in plaats van deze element voor element te genereren.
- Token
- Een stukje tekst, vaak een woord of woorddeel, dat een taalmodel als eenheid verwerkt.
- Reinforcement learning
- Een trainingsmethode waarbij een AI-model beloond wordt voor gewenst gedrag, waardoor het geleidelijk beter wordt in een taak.
- Fine-tuning
- Het verder trainen van een bestaand AI-model op specifieke data om het beter te maken in een bepaalde taak.
- Autoregressief model
- Een taalmodel dat tekst genereert door telkens het volgende woord of woorddeel te voorspellen op basis van wat er al staat.
- SD·RL
- De trainingsmethode van Google die reinforcement learning combineert met een techniek om het aantal rekenstappen te verminderen, gebruikt om DiffusionGemma sneller en beter te maken.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.