AI & computing › Generatieve AI & synthetische media

Google lanceert spraak-AI Gemini 3.8 Live, veel goedkoper dan OpenAI

· Bijgewerkt 16 september 2026, 01:07 · 1 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

Google DeepMind brengt twee nieuwe spraakmodellen uit: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. De modellen scoren beter dan OpenAI's nieuwste spraaktechnologie GPT-Live-1 op een onafhankelijke ranglijst, en dat voor een fractie van de prijs.

Google DeepMind heeft twee nieuwe audiomodellen gelanceerd: Gemini 3.8 Live en een zwaardere variant genaamd Gemini 3.8 Live Extended Thinking. Beide zijn vanaf nu beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio. De modellen vormen de motor achter een nieuwe generatie spraakassistenten die niet alleen een gesprek voeren, maar ook zelfstandig taken uitvoeren.

Praten, kijken en handelen tegelijk

Gemini 3.8 Live is bedoeld voor voice agents: digitale assistenten die tijdens een gesprek op de achtergrond taken uitvoeren. Zo kan het model via een API gegevens opvragen bij andere diensten, beelden verwerken die een gebruiker laat zien, en gewoon doorpraten terwijl het dat allemaal doet. Het model ondersteunt meer dan 97 talen, wat het geschikt maakt voor internationale toepassingen zoals klantenservicebots, digitale hulpjes in apps en spraakgestuurde software voor bedrijven.

Beter dan OpenAI op de ranglijst

De zwaardere Extended Thinking-versie doet het opvallend goed. Op de Speech-to-Speech Leaderboard van onderzoeksbureau Artificial Analysis, een veelgebruikte benchmark voor spraak-AI, behaalt het model een score van 82,6 procent. Daarmee gaat Google voorbij aan de nieuwste GPT-Live-1-modellen van OpenAI. Op GitHub heeft Google voorbeeldtoepassingen gepubliceerd, zodat ontwikkelaars meteen aan de slag kunnen.

Fors goedkoper dan de concurrentie

Het grootste verschil met OpenAI zit in de prijs. Google rekent 0,005 dollar per minuut voor audio-input en 0,018 dollar per minuut voor output. OpenAI vraagt voor GPT-Live-1 minimaal 0,05 dollar per minuut, ongeacht of het om input of output gaat. In de praktijk betekent dit dat een uur spraakgesprek bij Google ongeveer 1,38 dollar kost, tegenover minstens 3 dollar bij OpenAI.

Toch is goedkoper niet automatisch beter. OpenAI's model gebruikt full-duplex audio, waardoor het tegelijk kan luisteren en spreken. Dat zorgt voor een natuurlijker gesprek zonder de korte stiltes die bij afwisselend spreken ontstaan. Ook klinkt GPT-Live-1 in demo's overtuigender. Het lijkt erop dat Google opnieuw kiest voor een lagere prijs boven de hoogste spraakkwaliteit, een strategie die het bedrijf vaker toepast bij zijn AI-modellen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Doordat spraak-AI fors goedkoper wordt, kunnen meer bedrijven en ontwikkelaars spraakassistenten inbouwen in apps, klantenservice en apparaten. Dat versnelt de opmars van AI die niet alleen luistert en praat, maar ook zelfstandig taken uitvoert tijdens een gesprek. Tegelijk laat het zien dat de concurrentie tussen Google en OpenAI zich steeds meer toespitst op de balans tussen prijs en spraakkwaliteit.

Voice agent
Een AI-assistent die tijdens een gesprek zelfstandig acties onderneemt, zoals het opvragen van gegevens, zonder dat een gebruiker dat apart hoeft te vragen.
API
Een technische verbinding waarmee software van ontwikkelaars toegang krijgt tot de functies van een AI-model of andere dienst.
Spraakassistent
Software die met gesproken taal met gebruikers communiceert en opdrachten uitvoert.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.
Full-duplex audio
Een techniek waarbij een systeem tegelijk kan luisteren en spreken, net als in een echt menselijk gesprek.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media