AI & computing › Generatieve AI & synthetische media

Google introduceert Gemini 3.5 Transcribe: spraak naar tekst zonder ge-uh

· Bijgewerkt 26 augustus 2026, 23:12 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Ars Technica

Google heeft Gemini 3.5 Transcribe aangekondigd, een nieuw AI-model dat gesproken taal omzet in vloeiende tekst. Het systeem filtert automatisch stopwoorden en verhaspelingen weg en is fors sneller en nauwkeuriger dan zijn voorganger. Het model duikt de komende maanden op in steeds meer Google-producten, van toetsenbord tot browser.

Wie weleens een bericht insprak en vervolgens alle "euhs" en herhaalde zinnen moest wegtikken, krijgt binnenkort hulp van Google. Het bedrijf heeft Gemini 3.5 Transcribe gepresenteerd, een AI-model dat gesproken taal omzet in nette, leesbare tekst. Het systeem herkent niet alleen woorden, maar probeert ook te begrijpen wat je écht bedoelde te zeggen, en poetst de tekst daar meteen op bij.

Sneller en preciezer dan de voorganger

Volgens Google is het nieuwe model ongeveer 70 procent sneller dan Chirp 3, de spraak-naar-tekst-technologie die het bedrijf tot nu toe gebruikte. Ook de nauwkeurigheid gaat omhoog: het woordfoutpercentage bij live meegesproken tekst daalt van 7,32 naar 5,5 procent. Dat lijkt een klein verschil, maar in de praktijk betekent het minder fouten die je achteraf handmatig moet corrigeren, iets wat bij spraakinvoer altijd omslachtig is geweest.

Het model doet meer dan alleen luisteren. Terwijl je praat, haalt Gemini 3.5 Transcribe stopwoorden als "euh" en "nou ja" weg en verwerkt het live correcties als je jezelf verbetert. Gebruikers kunnen ook een eigen woordenlijst meegeven, zodat het model vakjargon of moeilijke namen goed oppikt. Bij vooraf opgenomen audio kan het systeem bovendien tot drie verschillende sprekers uit elkaar houden, en dat alles in 85 talen.

Waar je het model tegenkomt

Het model draait al in de Gboard-functie "Rambler" op de Pixel 11, en Google belooft die functie dit jaar naar meer toestellen met Gemini-ondersteuning te brengen. Ook gebruikers van de Gemini-app op macOS profiteren vanaf vandaag van het nieuwe model bij spraakinvoer. Voor ontwikkelaars is Gemini 3.5 Transcribe beschikbaar in de programmeeromgeving Antigravity, in het bouwmodel van AI Studio en via de Gemini API, zodat ze het in eigen apps kunnen inbouwen. Google kondigt daarnaast aan dat het model "binnenkort" naar de Chrome-browser komt, waarmee spraakinvoer in elk tekstveld op internet mogelijk wordt: van e-mails tot prompts voor chatbots.

Een kanttekening bij het polijsten

De keerzijde van deze technologie is dat het model niet simpelweg noteert wat je zegt, maar de bewoording actief aanpast om tot een vloeiender resultaat te komen. Voor korte spraakberichten werkt die opschoning doorgaans goed, maar het betekent wel dat de uiteindelijke tekst net iets anders kan zijn dan wat er letterlijk is uitgesproken. Voor alledaags gebruik is dat meestal geen probleem, maar bij formele of juridische toepassingen kan dat verschil wél gaan tellen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Spraakinvoer wordt met modellen als Gemini 3.5 Transcribe eindelijk praktisch bruikbaar voor dagelijks gebruik, omdat gebruikers niet langer zelf hun gesproken tekst hoeven op te schonen. Tegelijk verschuift de grens tussen "wat je zei" en "wat de AI ervan maakte", wat op termijn vraagt om transparantie over hoeveel een AI-systeem de brontekst mag aanpassen. Naarmate dit soort technologie in browsers en besturingssystemen wordt ingebouwd, wordt typen op steeds meer plekken een keuze in plaats van een noodzaak.

Spraak-naar-tekst
Technologie die gesproken taal automatisch omzet in geschreven tekst.
Woordfoutpercentage
Een maatstaf die aangeeft welk percentage van de woorden een spraakherkenningssysteem verkeerd overneemt.
Sprekersdiarisatie
Het automatisch onderscheiden van verschillende sprekers binnen één audio-opname, zodat een transcript aangeeft wie wat zei.
Aangepaste woordenlijst
Een lijst met specifieke woorden, namen of vaktermen die een gebruiker vooraf aan een spraakmodel meegeeft, zodat het die correct herkent.
API
Een programmeerinterface waarmee ontwikkelaars een AI-model als los onderdeel in hun eigen software kunnen inbouwen.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media