Robots leren radslagen en trapkicks zonder aparte training per beweging
Amerikaanse onderzoekers hebben een systeem ontwikkeld waarmee humanoïde robots ingewikkelde, mensachtige bewegingen leren zonder dat elke beweging apart geprogrammeerd hoeft te worden. Het systeem, BeyondMimic, laat een robot moeiteloos overschakelen van lopen naar een radslag en weer terug, en combineert zelfs meerdere vaardigheden tegelijk.
Een robot leren lopen is één ding, maar een robot leren om vloeiend over te schakelen tussen lopen, een radslag en een trapkick is heel wat lastiger. Onderzoekers presenteren nu een nieuw systeem genaamd BeyondMimic dat dit probleem aanpakt. In plaats van voor elke beweging een aparte trainingsronde nodig te hebben, leert het systeem uit menselijke bewegingsdata en kan het die kennis daarna zelf combineren en aanpassen aan nieuwe situaties.
Van menselijke bewegingen naar robotvaardigheden
Bestaande besturingssystemen voor humanoïde robots hebben vaak een groot nadeel: voor elke nieuwe beweging is uitgebreide, specifieke afstelling nodig. Het resultaat oogt daardoor al snel houterig en onnatuurlijk. BeyondMimic lost dit op met een tweetrapsaanpak. In de eerste fase gebruiken de onderzoekers reinforcement learning om een robot een breed scala aan menselijke bewegingen te laten nabootsen. Belangrijk is dat ze daarbij voor alle bewegingen dezelfde beloningsstructuur en instellingen gebruiken, in plaats van voor iedere beweging apart te sleutelen aan de software.
Voor de training gebruikten de onderzoekers ongeveer 2,5 uur aan menselijke bewegingsdata. Daaruit leerde het systeem honderden vaardigheden, van gewoon lopen en rennen tot balanceren op één been, dansbewegingen, vechtsportacties en radslagen. Eenentwintig van deze bewegingen werden vervolgens getest op een echte humanoïde robot, waarbij bleek dat de vaardigheden goed overkwamen van simulatie naar de praktijk.
Slim combineren zonder opnieuw te trainen
De tweede fase van BeyondMimic maakt gebruik van een diffusiemodel dat in een compacte, wiskundige representatie van bewegingen leert werken. Hierdoor kan het systeem niet alleen bestaande bewegingen afspelen, maar ze ook combineren en aanpassen aan nieuwe doelen, zoals het volgen van een joystick-commando, het vermijden van obstakels of het bewegen naar een bepaald punt, zonder dat de onderliggende besturing opnieuw getraind hoeft te worden.
In demonstraties liet de robot indrukwekkende staaltjes van deze flexibiliteit zien. Hij ging vloeiend over van lopen naar een radslag en weer terug, voerde reeksen van meerdere radslagen af gewisseld met rennen uit, en combineerde het volgen van een route met het ontwijken van hindernissen. Tijdens een luchtradslag registreerden de onderzoekers piekversnellingen van 31 meter per seconde in het kwadraat, vergelijkbaar met wat getrainde menselijke turners bereiken.
Opvallend is dat de bewegingen die het systeem produceert niet alleen acrobatischer zijn, maar ook natuurlijker overkomen. In een onderzoek onder 77 deelnemers beoordeelde 70,8 procent de bewegingen van BeyondMimic als menselijker dan die van de originele besturingssoftware van de robot. Volgens de onderzoekers is de kern van hun aanpak niet één nieuwe truc, maar de combinatie van schaalbare bewegingsherkenning met dit soort flexibele, generatieve technieken. Dat opent de weg naar robots die grote repertoires aan menselijke bewegingen leren en die vervolgens zelfstandig kunnen inzetten in nieuwe, onvoorziene situaties.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als robots bewegingen net zo soepel kunnen combineren als mensen, worden ze bruikbaarder in onvoorspelbare omgevingen zoals huizen, rampgebieden of fabrieken. Dit soort algemene bewegingsvaardigheid is een belangrijke stap richting humanoïde robots die niet voor één taak zijn geprogrammeerd, maar zich net als mensen kunnen aanpassen aan wat de situatie vraagt.
- Reinforcement learning
- Een manier van machine learning waarbij een systeem leert door te experimenteren en beloningen te krijgen voor gewenst gedrag.
- Diffusiemodel
- Een AI-techniek die geleerd heeft om vanuit willekeurige ruis stap voor stap een gewenst resultaat te genereren, hier gebruikt voor het combineren van bewegingen.
- Variationele autoencoder
- Een neuraal netwerk dat complexe data, zoals bewegingen, samenperst tot een compacte wiskundige representatie waarmee makkelijker gerekend kan worden.
- Classifier guidance
- Een techniek waarbij een diffusiemodel tijdens het genereren wordt bijgestuurd naar een bepaald doel, zonder dat het model opnieuw getraind hoeft te worden.
- Hyperparameter
- Een instelling van een AI-model die vooraf wordt vastgelegd en bepaalt hoe het model leert, zoals de leersnelheid.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.