AI & computing › Generatieve AI & synthetische media
Google introduceert Gemini 3.5 Transcribe voor nauwkeurigere spraakherkenning
Google heeft Gemini 3.5 Transcribe gelanceerd, een nieuw spraak-naar-tekstmodel dat gesproken taal moet omzetten in schone, correct opgemaakte tekst. Het model haalt volgens onafhankelijke tests een foutpercentage van slechts een paar procent en werkt in meer dan 85 talen. Ontwikkelaars kunnen het per direct gebruiken via de Gemini API, en consumenten merken de techniek al in apps als Gboard en de Gemini-app op macOS.
Spraakherkenning struikelt vaak over achtergrondlawaai, jargon of iemand die halverwege een zin van gedachten verandert. Gemini 3.5 Transcribe moet dat probleem oplossen. Het model, ontwikkeld door het Gemini Audio-team van Google, zet ruwe audio direct om in nette, leesbare tekst en verwijdert daarbij automatisch stopwoorden als "uh" en "eh". Zegt iemand "laten we dinsdag afspreken, nee wacht, woensdag", dan toont de transcriptie alleen de correctie. Het systeem herkent bovendien tot drie sprekers in een opname en voorziet elke zin van een tijdstempel, wat handig is voor het analyseren van vergaderingen of klantgesprekken.
Lagere foutpercentages, ook in rumoerige omgevingen
Volgens metingen van analysebureau Artificial Analysis haalt het model een woordfoutpercentage van gemiddeld 4,0 procent bij realtime spraak-naar-tekst en 2,6 procent bij het verwerken van opgenomen audio. Dat is een flinke sprong vergeleken met Chirp 3, het vorige transcriptiemodel van Google. Op de internationale FLEURS-testset, die meerdere talen en accenten beslaat, scoort Gemini 3.5 Transcribe rond de 5 procent foutmarge. Het model blijkt ook goed in het correct herkennen van lastige combinaties als postcodes en bestelnummers, en het kan getraind worden op specifieke vakjargon of ongebruikelijke naamgeving die een bedrijf zelf aanlevert.
Twee versies voor twee soorten gebruik
Ontwikkelaars kunnen kiezen uit twee varianten. De eerste levert continue, tweerichtingsstreaming met een vertraging van minder dan een seconde, bedoeld voor spraakassistenten en live ondertiteling. De tweede verwerkt bestaande opnames, inclusief vergaderingen en callcenter-gesprekken, met sprekersherkenning. Google claimt dat de tijd tot een definitieve transcriptie in de streamingvariant met 70 procent is verkort ten opzichte van het vorige model. Een opvallende toevoeging is functieaanroep: het model kan tijdens het transcriberen taken doorschuiven naar andere Gemini-modellen, bijvoorbeeld om een bestand samen te vatten of een afbeelding te genereren op basis van een gesproken opdracht.
Van ontwikkelaarstool naar dagelijkse app
Consumenten gebruiken de technologie al zonder het te beseffen. Op Android zit ze in de nieuwe Rambler-functie van Gboard, die gesproken tekst opschoont voor gebruik in berichten. In de Gemini-app op macOS stuurt het model ook complexere opdrachten aan, zoals bestanden doorzoeken met je stem. Google kondigt aan dat de functie binnenkort ook in Chrome verschijnt, zodat gebruikers in elk tekstveld op het web kunnen dicteren. Voor ontwikkelaars is het model beschikbaar via Google AI Studio en het Gemini Enterprise Agent Platform. Partijen als LiveKit, LangChain en Vercel bouwen er al voice-apps mee, en bedrijven als Vivo en Lingopal noemen de snelheid en taalondersteuning een verbetering ten opzichte van eerdere transcriptiesystemen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nauwkeurigere en snellere spraakherkenning maakt spraakgestuurde apps praktischer voor alledaags gebruik, van dicteren in een tekstveld tot het automatisch samenvatten van vergaderingen. Doordat het model ook taken kan doorsturen naar andere AI-systemen, verschuift spraak van een simpel invoermiddel naar een volwaardige manier om complexere digitale klussen te starten.
- Woordfoutpercentage
- Een maatstaf die aangeeft welk percentage van de woorden in een transcriptie fout is ten opzichte van wat er daadwerkelijk gezegd is; hoe lager, hoe nauwkeuriger het model.
- Sprekerattributie
- De techniek waarmee een systeem in een opname met meerdere personen bepaalt wie op welk moment aan het woord is.
- Woordniveau-tijdstempel
- Een tijdsaanduiding die aan elk afzonderlijk woord in een transcriptie wordt gekoppeld, zodat precies te zien is wanneer iets is gezegd.
- Streaming
- Het continu verwerken van audio terwijl iemand nog aan het praten is, in plaats van pas na afloop van de opname.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.