Robots leren van 1 miljoen uur menselijke video, taken lukken tot 90%
Het Amerikaanse robotbedrijf Dyna Robotics traint zijn robots niet langer op dure robotdata, maar op meer dan 1 miljoen uur video van gewone mensen. Volgens het bedrijf stijgt het slagingspercentage bij precisiewerk daardoor van 20 naar wel 90 procent.
Robots leren normaal gesproken door robotbewegingen na te bootsen die mensen vooraf hebben voorgedaan via afstandsbediening, ofwel teleoperatie. Dat kost veel tijd en geld, want elke beweging moet apart worden ingeoefend. Dyna Robotics uit Redwood City, Californië, kiest een andere weg. Het bedrijf trainde zijn nieuwe model, DYNA-2, op meer dan 1 miljoen uur video waarin mensen gewoon dagelijkse dingen doen: voorwerpen oppakken, spullen verplaatsen, taken uitvoeren. Dat is omgerekend zo'n 170 jaar aan menselijke waakervaring.
Het idee: als een robot goed genoeg begrijpt hoe de fysieke wereld werkt, hoeft hij niet voor elke taak apart getraind te worden op robotdata. DYNA-2 kreeg tijdens deze fase zelfs helemaal geen robotdata te zien.
Van menselijke video naar robotactie
DYNA-2 is wat onderzoekers een wereldactiemodel noemen: een systeem dat niet alleen voorspelt welke actie een robot moet uitvoeren, maar ook hoe de omgeving daardoor verandert. Het model combineert het voorspellen van het volgende videobeeld met het voorspellen van de volgende beweging. Doordat het is getraind op zogeheten egocentrische video – beelden gefilmd vanuit het perspectief van de handelende persoon – pikt het patronen op die overdraagbaar blijken naar heel verschillende soorten robots: stilstaande robotarmen, humanoïde prototypes en robothanden met vingers.
Volgens Dyna is nauwelijks aanpassing nodig om die kennis daadwerkelijk op een fysieke robot los te laten. Een paar uur lokale training was voldoende om een robot met twee vijfvingerige handen te leren een dop van een fles te draaien.
Van 46 naar 87 procent geslaagde taken
Het bedrijf vergeleek DYNA-2 met zijn voorganger DYNA-1, die werkt volgens een ander ontwerp: een vision-language-action-model, dat beeld, taal en actie combineert maar wel op robotdata leunt. Bij een test bij een klant zonder voorafgaande training op die specifieke situatie – een zogeheten zero-shot-test – haalde DYNA-2 een slagingspercentage van 87 procent, tegen 46 procent voor DYNA-1. Ook bleek het nieuwe model beter bestand tegen verstoringen: als tijdens een taak zoals groente snijden iets misging, herstelde DYNA-2 zichzelf, terwijl DYNA-1 daarvoor een menselijk ingrijpen nodig had. Op taken waarbij een robot een instructie moest opvolgen en daarbij van beweging moest wisselen, verbeterden de scores met 133 procent.
Al aan het werk in hotels en restaurants
Dyna Robotics zet zijn humanoïde robots, vooralsnog aangedreven door het oudere DYNA-1-model, al in bij hotels, restaurants en wasserettes. Medeoprichter Jason Ma, voormalig onderzoeker bij DeepMind, noemt het handmatig verzamelen van robotdata al jaren de grootste rem op de ontwikkeling van generalistische robots. Video van mensen is daarentegen overal beschikbaar. Of DYNA-2 op grotere schaal net zo goed blijft presteren als in de tests van Dyna zelf, moet nog blijken uit onafhankelijke evaluaties.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als robots inderdaad fysieke vaardigheden kunnen leren van gewone videobeelden in plaats van dure robotdata, verdwijnt een belangrijke rem op de ontwikkeling van bruikbare huishoud- en werkrobots. Dat kan de opmars van humanoïde robots in bijvoorbeeld de horeca en logistiek versnellen, al is onafhankelijk bewijs voor de gerapporteerde succespercentages nog nodig.
- Wereldactiemodel
- Een AI-systeem dat tegelijk voorspelt hoe een omgeving verandert én welke actie daarbij hoort, waardoor het geleerde gedrag overdraagbaar is naar verschillende robots.
- Egocentrische video
- Beeldmateriaal gefilmd vanuit het perspectief van de persoon die de handeling uitvoert, vaak met een camera op het hoofd of dichtbij het lichaam.
- Teleoperatie
- Het op afstand besturen van een robot door een mens, vaak gebruikt om robots trainingsvoorbeelden voor te doen.
- Vision-language-action-model
- Een AI-architectuur die beeld, taal en fysieke actie combineert zodat een robot instructies kan begrijpen en uitvoeren.
- Zero-shot
- Een test waarbij een AI-systeem een taak moet uitvoeren zonder dat het daar vooraf specifiek voor is getraind.
- Humanoïde robot
- Een robot met een mensachtige vorm, meestal met twee armen en twee benen, ontworpen om in menselijke omgevingen te functioneren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.