AI & computing › Agentic AI & autonome agents
Zero-Mem laat AI-agents geheugen raadplegen zonder extra taalmodel-rekenwerk
Onderzoekers presenteren Zero-Mem, een geheugensysteem voor AI-agents dat oude gesprekken en acties kan doorzoeken zonder daarbij een taalmodel in te schakelen. Dat scheelt rekentijd en voorkomt dat details verloren gaan doordat een AI-model het geheugen eerst zelf samenvat.
AI-agents die lange tijd met gebruikers of taken bezig zijn, hebben een geheugen nodig. Ze moeten onthouden wat er eerder is gezegd of gedaan, anders raken ze de draad kwijt. Het probleem: de meeste bestaande systemen zetten daarvoor telkens een large language model aan het werk. Dat model vat oude gesprekken samen tot compacte notities, die later weer worden opgehaald. Dat kost tijd en geld, want elke aanroep van het model verbruikt tokens — de reken-eenheden waarin AI-taalmodellen tekst verwerken. Bovendien gaat er informatie verloren als het model bij het samenvatten details weglaat of door elkaar haalt.
Geheugen zonder samenvatten
Een team van onderzoekers, onder wie Yilin Xiao en collega's, presenteert in een nieuwe studie het systeem Zero-Mem. De naam verwijst naar het uitgangspunt: geheugenbeheer zonder één token te verbruiken bij een taalmodel. In plaats van gesprekken samen te vatten, bewaart Zero-Mem de originele interacties gewoon zoals ze zijn. Die ruwe data wordt op twee manieren geordend. Een zogeheten entiteit-contextgrafiek legt verbanden tussen onderwerpen en gebeurtenissen uit verschillende gesprekken bloot. Daarnaast houdt een tijdshiërarchie bij wat er recent binnen één sessie is gebeurd, zodat de agent de lokale context van een gesprek niet kwijtraakt.
Bij elke nieuwe vraag bepaalt het systeem automatisch hoe zwaar het op elk van de twee structuren moet leunen, en haalt het relevante stukjes op uit beide bronnen. Dat proces lijkt op multi-hop retrieval, waarbij een systeem meerdere stapjes zet om verspreide informatie bij elkaar te zoeken — maar dan volledig op basis van vaste regels, zonder dat er onderweg een taalmodel aan te pas komt. Pas helemaal aan het einde, als het uiteindelijke antwoord wordt geformuleerd, wordt er één keer een taalmodel geraadpleegd. Daarvoor filtert het systeem eerst tegenstrijdige of irrelevante informatie weg, zodat het antwoord stevig verankerd blijft in wat er werkelijk is gezegd.
Sneller dan bestaande systemen
De onderzoekers testten Zero-Mem op benchmarks voor lange gesprekken en grote hoeveelheden tekst, waarbij systemen vragen moeten beantwoorden op basis van eerdere interacties. Zero-Mem presteert daarbij vergelijkbaar met bestaande methodes, maar is aanzienlijk sneller: de tijd die nodig is voor geheugenbeheer daalt met 57,6 procent ten opzichte van de snelste concurrent, bij een gelijk contextvenster voor het uiteindelijke antwoord. Aanvullende tests laten zien dat zowel de entiteit-contextgrafiek als de tijdshiërarchie allebei bijdragen aan de prestaties, en dat de combinatie van beide beter werkt dan elk apart.
De bevindingen suggereren dat geheugensystemen voor AI-agents niet per se een tussenstap van samenvatten nodig hebben. Dat kan relevant worden naarmate AI-agents langer en zelfstandiger taken uitvoeren, waarbij de kosten van voortdurend geheugenbeheer flink kunnen oplopen. Code en implementatiedetails worden na peer review openbaar gemaakt.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-agents langer zelfstandig taken uitvoeren, wordt het beheer van hun geheugen een steeds grotere kostenpost. Een aanpak die geheugen raadpleegt zonder telkens een taalmodel te hoeven inzetten, kan agents goedkoper, sneller en betrouwbaarder maken doordat originele informatie niet meer verloren gaat bij het samenvatten.
- Large language model (LLM)
- Een AI-taalmodel dat is getraind op grote hoeveelheden tekst en daardoor mensachtige taal kan begrijpen en genereren.
- AI-agent
- Een AI-systeem dat niet alleen antwoord geeft, maar zelfstandig stappen zet en taken uitvoert om een doel te bereiken.
- Token
- De kleine tekstbrokjes waarin een taalmodel woorden opdeelt om ze te kunnen verwerken; elke berekening met een taalmodel kost tokens en dus geld.
- Entiteit-contextgrafiek
- Een netwerkstructuur die verbanden tussen personen, onderwerpen en gebeurtenissen uit verschillende gesprekken zichtbaar maakt.
- Tijdshiërarchie
- Een ordening van informatie op basis van tijd en sessie, waardoor een systeem weet wat er recent binnen één gesprek is gebeurd.
- Retrieval
- Het opzoeken van relevante informatie uit een grote hoeveelheid opgeslagen data, vaak als voorbereiding op het genereren van een antwoord.
- Calibratie
- Het proces waarbij tegenstrijdige of onbetrouwbare informatie wordt weggefilterd voordat een systeem een definitief antwoord geeft.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-systemen onderling worden vergeleken.
- Ablatiestudie
- Een experiment waarbij losse onderdelen van een systeem worden weggelaten om te meten hoeveel elk onderdeel bijdraagt aan de totale prestatie.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.