Ruimtelijk geheugen: hoe machines onthouden waar alles staat
Stel je voor dat je elke ochtend in een compleet onbekend huis wakker zou worden. Geen idee waar de deur zit, waar de trap begint, of de keuken links of rechts is. Je zou constant moeten rondtasten. Mensen hebben dat probleem niet: we bouwen in ons hoofd een soort plattegrond op van onze omgeving en die plattegrond blijft hangen, ook als we onze ogen dichtdoen. Dat vermogen heet ruimtelijk geheugen.
In de technologie duidt de term op iets vergelijkbaars, maar dan bij machines. Een robotstofzuiger die na een paar schoonmaakbeurten precies weet dat de bank links van de deur staat, gebruikt in feite ruimtelijk geheugen. Hetzelfde geldt voor een zelfrijdende auto die onthoudt hoe een kruising eruitziet, of een AR-bril (augmented reality: digitale beelden die over de echte wereld heen worden geprojecteerd) die een virtuele pijl precies op dezelfde plek laat hangen, ook nadat je bent weggelopen en teruggekomen.
Wat is het precies?
De basis van ruimtelijk geheugen bij machines is waarneming. Een robot of auto gebruikt camera's, lidar (een soort laserradar die met lichtpulsen afstanden meet) of gewone radar om te zien wat er om hem heen is. Die losse waarnemingen zijn op zichzelf niet genoeg: het systeem moet ze ook aan elkaar knopen tot één samenhangend beeld van de ruimte.
De techniek die dat doet heet SLAM, kort voor Simultaneous Localization and Mapping: tegelijkertijd een kaart opbouwen én bepalen waar je jezelf op die kaart bevindt. Dat klinkt als een kip-en-ei-probleem, en dat is het ook: je hebt een kaart nodig om je positie te bepalen, maar je hebt je positie nodig om de kaart te kunnen tekenen. SLAM-algoritmes lossen dit stap voor stap op, door bij elke nieuwe waarneming de vorige schatting van kaart én positie een beetje bij te stellen.
Een belangrijk onderdeel daarvan is loop closure: het herkennen van een plek waar het systeem al eerder is geweest. Als een robot een rondje door een gang heeft gelopen en de startplek herkent, kan hij kleine meetfouten die onderweg zijn opgestapeld corrigeren. Zonder die correctie zou de kaart langzaam gaan 'kromtrekken'.
De opgeslagen kaart zelf kan er verschillend uitzien: een puntenwolk (duizenden losse gemeten punten in de ruimte), een rooster van cellen die wel of niet bezet zijn, of tegenwoordig steeds vaker een compacte representatie binnen een neuraal netwerk, vergelijkbaar met hoe een samenvatting meer is dan een lijst losse feiten. Die laatste aanpak is deels geïnspireerd door de biologie: in 2014 kregen John O'Keefe, May-Britt Moser en Edvard Moser de Nobelprijs voor de Fysiologie of Geneeskunde voor de ontdekking van plaatscellen en roostercellen in de hippocampus, hersencellen die precies actief worden op basis van waar een dier zich in de ruimte bevindt. Onderzoekers gebruiken die ontdekking als inspiratie voor hoe kunstmatige systemen ruimte zouden kunnen coderen.
Tot slot is er een onderscheid tussen kortetermijn- en langetermijngeheugen. Tijdens één enkele taak, bijvoorbeeld het navigeren door één kamer, houdt een systeem een werkgeheugen bij. Persistente systemen gaan een stap verder: de kaart wordt opgeslagen en de volgende keer weer opgehaald, zodat niet alles opnieuw hoeft te worden ingescand.
Wat wil men ermee bereiken?
Het eerste doel is autonome navigatie zonder voortdurende hulp van buitenaf. Gps werkt niet binnenshuis en is buiten soms tot enkele meters onnauwkeurig; een systeem dat zijn eigen omgeving kent en herkent, is daar niet van afhankelijk.
Een tweede doel is efficiëntie. Als een robot elke keer opnieuw zijn hele omgeving zou moeten scannen en interpreteren, kost dat tijd en energie. Een opgeslagen kaart maakt het mogelijk om direct de kortste route te plannen in plaats van al verkennend rond te tasten.
Een derde doel zit in augmented en virtual reality: virtuele objecten die op precies dezelfde plek blijven hangen, ook tussen sessies door of voor meerdere gebruikers tegelijk die met hun eigen bril of telefoon dezelfde ruimte bekijken. Dat vereist dat het systeem de fysieke locatie herkent en er een gedeeld referentiepunt aan koppelt.
Een breder en ambitieuzer doel is het bouwen van kunstmatige intelligentie die net als mensen en dieren over ruimte kan redeneren: niet alleen een taak uitvoeren, maar ook kunnen inschatten wat er om een hoek ligt, of een kortere weg kunnen bedenken die nog nooit is afgelegd. Dat sluit aan bij het onderzoek naar zogeheten wereldmodellen, interne representaties waarmee een AI-systeem gevolgen van acties kan voorspellen voordat het ze daadwerkelijk uitvoert.
Voorbeelden uit de praktijk
iRobot voerde in 2018 met de Roomba i7 de functie Imprint Smart Mapping in: de robotstofzuiger onthoudt de plattegrond van een huis tussen schoonmaakbeurten door, waardoor gebruikers per kamer opdrachten kunnen geven in plaats van steeds het hele huis te laten scannen.
Google bouwde met ARCore een Visual Positioning System (VPS), dat een telefooncamera gebruikt om de exacte positie en oriëntatie ten opzichte van vooraf ingescande omgevingen te bepalen. Deze techniek zit onder de motorkap van de Live View-looproutes in Google Maps, waarbij digitale pijlen over straatbeelden heen worden getoond.
Waymo, het zelfrijdende-autobedrijf van Alphabet, combineert vooraf gemaakte gedetailleerde kaarten met realtime sensordata om voortdurend te bepalen waar de auto zich precies bevindt, tot op enkele centimeters nauwkeurig. Sinds de start van de volledig chauffeurloze ritdienst in Phoenix rond 2020 is dit type ruimtelijk geheugen de basis van hoe het voertuig zich door de stad beweegt.
Onderzoekers van DeepMind publiceerden in 2018 in het tijdschrift Nature een studie waarin een kunstmatig navigatieagentje, getraind met reinforcement learning (leren door beloning en straf op basis van eigen acties), spontaan interne patronen ontwikkelde die sterk lijken op de roostercellen die bij dieren zijn gevonden. Dit werd gezien als een aanwijzing dat dit soort ruimtelijke codering een efficiënte, wellicht bijna onvermijdelijke oplossing is voor het navigatieprobleem, of die nu in een brein of in een neuraal netwerk wordt gevonden.
Apple bracht in 2024 de Vision Pro-headset uit, die gebruikmaakt van ARKit om ruimtes blijvend te herkennen: virtuele vensters en apps kunnen op een vaste plek in een kamer 'geparkeerd' worden en staan daar nog steeds wanneer de gebruiker de bril later opnieuw opzet.
Hoe ver is de techniek?
Voor afgebakende, relatief statische omgevingen is SLAM inmiddels volwassen technologie: het zit standaard in robotstofzuigers, drones en telefoons, en werkt doorgaans betrouwbaar. Dat is een geleidelijke ontwikkeling geweest van enkele decennia onderzoek, met name sinds de jaren negentig in de robotica, naar praktische toepassingen die nu in consumentenproducten zitten.
Lastiger blijft het omgaan met verandering. Een kaart die klopte toen hij werd gemaakt, kan verouderen zodra meubels verschuiven, mensen door het beeld lopen of seizoenen het uiterlijk van een buitenomgeving veranderen. Systemen die dit soort verandering herkennen en de kaart bijwerken zonder alles opnieuw te hoeven leren, zijn onderwerp van actief onderzoek en nog niet overal even robuust.
Ook het combineren van ruimtelijk geheugen met taal en redeneervermogen, zodat een robot bijvoorbeeld kan reageren op 'ga naar de plek waar we gisteren de doos neerzetten', staat nog in een vroeg stadium. Dit soort taken vereist dat ruimtelijke informatie wordt gekoppeld aan betekenis, niet alleen aan coördinaten.
Een minder technisch obstakel is privacy: een persistente 3D-kaart van iemands huis of kantoor is gevoelige informatie, en het is niet in alle gevallen duidelijk waar die kaarten worden opgeslagen en wie er toegang toe heeft.
Wie werken eraan?
Op het gebied van consumentenrobotica en kaarten is iRobot een belangrijke naam, evenals techbedrijven als Google (ARCore, Visual Positioning System) en Apple (ARKit, Vision Pro). In de zelfrijdende auto-industrie werken onder meer Waymo en, in China, bedrijven als Baidu aan grootschalige, zeer nauwkeurige kaartsystemen. NVIDIA levert met zijn Isaac-platform reken- en softwareonderdelen die veel robotmakers gebruiken voor navigatie. Boston Dynamics test met robots als Spot hoe machines zelfstandig door complexe, veranderlijke omgevingen kunnen navigeren.
Op onderzoeksgebied speelt DeepMind (onderdeel van Google/Alphabet, Verenigd Koninkrijk) een rol met werk aan neurale representaties van ruimte, terwijl universiteiten als MIT, Stanford en ETH Zürich robotica-labs hebben die aan SLAM en verwante technieken werken. De neurowetenschappelijke basis komt voor een belangrijk deel uit het Kavli Institute for Systems Neuroscience in Trondheim, Noorwegen (het lab van May-Britt en Edvard Moser), en University College London, waar John O'Keefe zijn ontdekkingen deed.
Verder lezen
- Nobelprize.org — achtergrond over de Nobelprijs voor plaats- en roostercellen (2014)
- DeepMind — onderzoek naar navigatie en ruimtelijke representaties in AI
- Nature — wetenschappelijke publicaties over ruimtelijk geheugen en navigatie
- Google ARCore-documentatie — technische uitleg over Visual Positioning System en ruimtelijk ankeren
- NTNU / Kavli Institute for Systems Neuroscience — onderzoek naar plaats- en roostercellen