Google DeepMind laat humanoïde robots met heel hun lichaam bewegen
Google DeepMind heeft Gemini Robotics 2 gepresenteerd, een nieuwe versie van het AI-systeem dat robots aanstuurt. Het model kan voor het eerst een heel humanoïde lichaam besturen, van lopen tot fijne handbewegingen, en laat robots onderling samenwerken aan complexe klussen.
Google DeepMind heeft een nieuwe versie van zijn robot-besturingssysteem gepresenteerd: Gemini Robotics 2. Het model is een zogeheten vision-language-action-model, kortweg VLA. Zo'n systeem vertaalt camerabeelden en gesproken instructies direct naar bewegingen. De vorige versie kon vooral de bovenkant van een humanoïde robot aansturen, voor taken op een tafelblad zoals iets oppakken of neerzetten. Gemini Robotics 2 stuurt nu het hele lichaam aan. Op de humanoïde robot Apollo 2 van het Amerikaanse bedrijf Apptronik kan een gebruiker bijvoorbeeld vragen om een gieter in de groene bak op de onderste plank te leggen. De robot loopt vervolgens zelf naar de tafel, pakt de gieter op, loopt naar de kast en zet het voorwerp precies op de juiste plek neer. Voor dat soort taken moet een robot kunnen lopen, hurken en reiken, en die bewegingen combineren met grijpen. DeepMind noemt dit een belangrijke stap, al erkent het bedrijf dat de snelheid van robotbewegingen nog moet verbeteren voordat ze net zo vlot werken als mensen.
Vingers die knopen leggen
Naast grovere bewegingen richt de update zich ook op fijne motoriek. Het model kan de vijfvingerige SharpaWave-hand van de Apollo 2-robot aansturen, een grijparm met 22 bewegingsvrijheden. Daarmee lukken precisietaken zoals een knoop leggen in een touw of een diepvrieszakje dichtdrukken. Hetzelfde model werkt ook met een eenvoudigere tweevingerige parallelgrijper op een Franka Duo-robotarm, waarmee spullen strak worden ingepakt. Dat een en hetzelfde AI-model met heel verschillende grijpers en handen overweg kan, is volgens DeepMind een teken dat de technologie breed inzetbaar wordt, ongeacht het type robot.
Samenwerken en veilig blijven
Complexe klussen duren vaak minuten en bestaan uit tientallen stappen. Daarvoor introduceert DeepMind Gemini Robotics ER 2, een model voor belichaamde redenering dat fungeert als het 'brein' van de robot. Dit model bekijkt de omgeving, bedenkt een stappenplan, communiceert met mensen en controleert of elke stap goed verloopt. Gaat er iets mis, dan corrigeert het systeem zichzelf. Nieuw is ook dat meerdere robots via dit systeem kunnen samenwerken om een taak sneller af te ronden. Voor toepassingen zonder internetverbinding bracht DeepMind bovendien Gemini Robotics On-Device 2 uit, een lichtere variant die lokaal op een robot draait. Dankzij bewegingstransfer-technieken leert dit model al binnen een paar uur en met minder dan tweehonderd voorbeelden werken met een compleet nieuw robotlichaam, ook als de vorm, sensoren of gewrichten sterk afwijken. Veiligheid krijgt eveneens aandacht: met de nieuwe ASIMOV-Agentic-testmethode meet DeepMind of een robot onveilige opdrachten weigert en op tijd stopt als een mens te dichtbij komt. Volgens het bedrijf is Gemini Robotics ER 2 tot dusver het veiligste model dat het heeft ontwikkeld.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Robots die met hun hele lichaam kunnen bewegen én zelfstandig meerstapstaken uitvoeren, komen dichterbij toepassing in huishoudens, magazijnen en fabrieken. Doordat hetzelfde AI-model op verschillende robotlichamen en grijpers werkt, kan de ontwikkeling van praktische robots sneller gaan dan wanneer voor elk robotmodel apart software moet worden geschreven. Tegelijk laat DeepMind zien dat veiligheid, zoals het herkennen van nabije mensen en het weigeren van riskante opdrachten, een steeds grotere rol speelt naarmate robots zelfstandiger worden.
- Vision-language-action-model (VLA)
- Een AI-model dat beeld en taal combineert om er direct fysieke robotbewegingen uit af te leiden.
- Belichaamde redenering
- Het vermogen van een AI-systeem om de fysieke wereld te begrijpen, plannen te maken en de voortgang van taken te bewaken.
- Graden van vrijheid
- Het aantal onafhankelijke bewegingsrichtingen dat een robotonderdeel, zoals een hand of arm, kan maken.
- Bewegingstransfer
- Een techniek waarmee een AI-model geleerde bewegingen snel kan aanpassen aan een nieuw, ander robotlichaam.
- Eindeffector
- Het onderdeel aan het uiteinde van een robotarm waarmee de robot daadwerkelijk grijpt of iets bewerkt, zoals een hand of grijper.
- Parallelgrijper
- Een eenvoudige robotgrijper met doorgaans twee vingers die recht op elkaar toe bewegen om voorwerpen vast te pakken.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.