AI & computing › Generatieve AI & synthetische media

Google laat Gemini in real time praten mét een gezicht: Live Avatar debuteert

· Bijgewerkt 25 september 2026, 01:40 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: DeepMind Blog

Google DeepMind voegt een sprekend, bewegend gezicht toe aan zijn AI-model Gemini. Met de nieuwe functie Live Avatar kunnen bedrijven een virtuele assistent inzetten die niet alleen praat en luistert, maar ook meekijkt en emoties toont, in 97 talen tegelijk beschikbaar.

Google DeepMind, de AI-tak van Google, breidt zijn spraakmodel Gemini 3.8 Live uit met een visueel jasje. De nieuwe functie heet Live Avatar en voegt een bewegend, sprekend gezicht toe aan de bestaande spraaktechnologie van Gemini. Waar gebruikers eerder al met het AI-model konden praten, kunnen ze er vanaf nu ook naar kijken: een virtuele figuur die luistert, ziet én terugpraat, met vloeiende mondbewegingen en herkenbare gezichtsuitdrukkingen.

De techniek is vanaf nu beschikbaar in Gemini Enterprise, de zakelijke variant van Google's AI-dienst. Bedrijven kunnen de avatar inzetten voor klantenservice of voor interactieve productdemonstraties. Volgens Google verloopt het gesprek natuurlijker dan bij een gewone chatbot, omdat de avatar niet lang hoeft na te denken voordat hij reageert. Die beurtwisselingslatentie, de tijd tussen het uitspreken van een zin en de reactie van de AI, is bewust kort gehouden om een gesprek soepel te laten aanvoelen.

Werken op de achtergrond

Een opvallende toevoeging is dat de avatar tijdens het gesprek zelf taken kan uitvoeren zonder de dialoog te onderbreken. Google noemt dit een asynchrone toolaanroep: de AI start op de achtergrond een actie, zoals het opzoeken van gegevens of het inchecken van een hotelgast, terwijl het gesprek gewoon doorloopt. Voor de gebruiker voelt dit aan als een menselijke medewerker die ondertussen even iets opzoekt in het systeem, zonder de klant te laten wachten.

Van 97 talen tot een avatar op maat

Live Avatar is gebouwd op een spraak-naar-spraakmodel, waarbij gesproken taal direct wordt verwerkt en beantwoord zonder tussenstap via tekst. Dat model ondersteunt 97 talen en kan halverwege een gesprek moeiteloos wisselen van taal, meldt Google, zonder dat de lipsynchronisatie uit de pas gaat lopen of de videokwaliteit terugvalt. Bedrijven kunnen kiezen uit een bibliotheek van kant-en-klare avatars, of een eigen versie laten maken op basis van één referentiefoto. Die laatste optie, waarbij het uiterlijk en de huisstijl van een merk behouden blijven, is voorlopig alleen beschikbaar voor geselecteerde zakelijke klanten.

Omdat het om volledig computergegenereerd beeld en geluid gaat, plakt Google er een digitale sticker op: elk stukje video en audio krijgt een onzichtbaar watermerk genaamd SynthID. Daarmee moet het voor derde partijen mogelijk blijven om te herkennen dat content door AI is gemaakt, ook als iemand het beeld deelt zonder bronvermelding. Google presenteert dit als onderdeel van zijn beleid rond verantwoord gebruik van generatieve AI, de bredere categorie technologie waarmee computers zelf tekst, beeld, audio of video produceren.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Virtuele assistenten met een gezicht en stem kunnen klantcontact persoonlijker maken, maar vervagen ook verder de grens tussen menselijke en AI-gestuurde gesprekken. Watermerktechnologie zoals SynthID wordt daardoor steeds belangrijker om nep van echt te blijven onderscheiden, zeker nu dit soort avatars ook op maat voor merken gemaakt kan worden.

Beurtwisselingslatentie
De tijd die verstrijkt tussen het einde van iemands zin en het begin van het antwoord van de AI; hoe korter, hoe natuurlijker een gesprek aanvoelt.
Toolaanroep
Het moment waarop een AI-systeem een extern programma of databron aanspreekt om een taak uit te voeren, zoals het opzoeken van informatie.
Spraak-naar-spraakmodel
Een AI-model dat gesproken taal direct verwerkt en beantwoordt met gesproken taal, zonder de omweg via geschreven tekst.
Spraak-naar-lipsynchronisatie
De techniek waarmee mondbewegingen in gegenereerd beeld exact worden afgestemd op de uitgesproken woorden.
Watermerk (SynthID)
Een onzichtbare digitale markering in AI-gegenereerd beeld of geluid, waarmee de herkomst achteraf detecteerbaar blijft.
Generatieve AI
Kunstmatige intelligentie die zelfstandig nieuwe content maakt, zoals tekst, beeld, audio of video.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media