RoboticaHumanoïde robots

Galbot leert humanoïde robots gebaren die passen bij wat ze zeggen

· Bijgewerkt 7 september 2026, 12:13 · 2 min leestijd

Humanoïde robots
Beeld: Interesting Engineering

Het Chinese robotbedrijf Galbot heeft een systeem ontwikkeld waarmee humanoïde robots tijdens een gesprek automatisch passende gebaren maken. RoboGesture koppelt spraakherkenning, bewegingsgeneratie en een veiligheidsfilter aan elkaar, zodat een robot binnen ongeveer twee seconden reageert met woorden én lichaamstaal. Het systeem wordt eind 2026 gepresenteerd op de European Conference on Computer Vision.

Humanoïde robots kunnen inmiddels aardig praten, maar hun bewegingen ogen vaak houterig: dezelfde armzwaai, ongeacht wat er wordt gezegd. Het Chinese bedrijf Galbot wil dat probleem oplossen met RoboGesture, een nieuw framework dat humanoïde robots realtime gebaren laat maken die aansluiten bij de betekenis, het ritme en de toon van gesproken taal. Het systeem is ontwikkeld samen met onderzoekers van Tsinghua University, Peking University, het Beijing Institute of Technology, het Harbin Institute of Technology en het Shanghai Qi Zhi Institute.

Luisteren naar meer dan alleen woorden

De kern van RoboGesture is een module die rechtstreeks naar spraak luistert, in plaats van alleen naar de tekst die daaruit is afgeleid. Dat is belangrijk, want intonatie, nadruk en spreeksnelheid vertellen vaak meer dan de woorden zelf. Binnenkomende spraak wordt eerst omgezet in audiotokens met de Mimi-audiocodec, waarna het systeem zowel snelle klankveranderingen als de bredere betekenis van een zin analyseert. De onderzoekers trainden dit onderdeel met driehonderd verschillende gebaartypes, zodat de robot een breed repertoire aan bewegingen tot zijn beschikking heeft.

Die signalen gaan vervolgens naar een bewegingsmodel op basis van een diffusion transformer. In plaats van vaste bewegingscommando's af te vuren, genereert dit model beweging in een continue ruimte, rekening houdend met zowel de binnenkomende spraak als de voorgaande beweging van de robot. Zo vloeien gebaren natuurlijk in elkaar over, in plaats van dat de robot van houding naar houding springt.

Wanneer een robot in herhaling valt

Tijdens het onderzoek stuitte het team op een probleem dat ze 'modality eclipse' noemen: het bewegingsmodel leunt dan te sterk op de vorige beweging en blijft dezelfde actie herhalen, ook als de spraak allang is veranderd. Om dat te voorkomen gebruikt RoboGesture een techniek genaamd Anti-Inertia classifier-free guidance masking, die het model dwingt opnieuw goed te luisteren naar de actuele audio in plaats van op de automatische piloot te blijven bewegen.

Een veiligheidsfilter tegen zelfbotsingen

Bewegingen die een AI-model bedenkt, garanderen niet automatisch dat een fysieke robot geen ledematen tegen zichzelf aan botst of buiten zijn bewegingsgrenzen schiet. Daarom stuurt RoboGesture elke gegenereerde beweging eerst door een veiligheidsfilter gebaseerd op model predictive control (MPC), die de beweging toetst aan de fysieke grenzen van de robot en zo nodig bijstuurt. In tests daalde het percentage beeldframes met een zelfbotsing daardoor van 4,16 naar 0,13 procent.

Het systeem is getest op een Unitree G1, een humanoïde robot uitgerust met behendige handen van BrainCo. De volledige keten combineert automatische spraakherkenning, een taalmodel, tekst-naar-spraak-technologie, audioverwerking, gebaargeneratie en het veiligheidsfilter. Daardoor kan de robot luisteren, een antwoord bedenken, dat uitspreken én tegelijk met passende gebaren ondersteunen — de hele cyclus van luisteren tot bewegen duurt ongeveer twee seconden.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Robots die vloeiend meebewegen met hun eigen spraak, ogen minder mechanisch en kunnen daardoor beter functioneren in menselijke omgevingen zoals winkels, zorginstellingen of kantoren. Door de nadruk op veiligheid via een apart controlesysteem, wordt ook een belangrijke drempel voor praktijkinzet van expressieve humanoïde robots weggenomen. Dit soort technologie kan de manier waarop mensen robots vertrouwen en accepteren in sociale settings sterk beïnvloeden.

Mimi-audiocodec
Een techniek die spraakgeluid omzet in compacte digitale tokens, zodat een AI-model de audio efficiënt kan verwerken.
Diffusion transformer
Een type AI-model dat stap voor stap ruwe, willekeurige data verfijnt tot een bruikbaar resultaat, hier toegepast op het genereren van vloeiende robotbewegingen.
Modality eclipse
Een probleem waarbij een bewegingsmodel te veel steunt op eerdere bewegingen en daardoor blijft herhalen in plaats van op nieuwe spraak te reageren.
Model predictive control (MPC)
Een regeltechniek die vooraf voorspelt hoe een systeem zich gedraagt en bewegingen daarop bijstuurt om binnen veilige grenzen te blijven.
Zelfbotsing
Het per ongeluk tegen elkaar aan botsen van de eigen ledematen van een robot tijdens een beweging.
ASR en TTS
Afkortingen voor automatische spraakherkenning (ASR) en tekst-naar-spraak (TTS), de technieken waarmee een robot menselijke taal verstaat en zelf kan uitspreken.
ECCV
De European Conference on Computer Vision, een grote internationale wetenschappelijke conferentie waar nieuwe AI- en visietechnieken worden gepresenteerd.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Humanoïde robots