AI & computing › Agentic AI & autonome agents

Nieuwe AI-agent Talos blokkeert gevaarlijke commando's voordat ze worden uitgevoerd

· Bijgewerkt 28 augustus 2026, 16:30 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Een Zwitserse ontwikkelaar heeft een open-source AI-agent gebouwd die niet blindelings commando's van een taalmodel uitvoert. Talos plaatst een streng controlesysteem tussen de AI en de computer, dat elke actie eerst toetst voordat er iets gebeurt. Zo moet worden voorkomen dat een AI-assistent per ongeluk bestanden wist of wachtwoorden lekt.

Wie een AI-agent toegang geeft tot een computer, loopt risico. Het programma kan bestanden wissen, wachtwoorden lekken of onbedoeld schade aanrichten. Een Zwitserse ontwikkelaar heeft daarom Talos gebouwd: een agentic AI-systeem met een streng controlemechanisme dat tussen het taalmodel en de computer in staat. Elke actie die de AI wil uitvoeren, wordt eerst getoetst voordat er iets gebeurt.

Een vaste beslisboom in plaats van AI-oordeel

Het hart van Talos is de zogeheten policy kernel, een los stukje software dat onafhankelijk van het taalmodel beslist of een commando mag worden uitgevoerd. Die beslissing verloopt in vaste stappen: eerst wordt gecheckt of een pad verboden terrein is, dan of het om een harde weigering gaat, vervolgens of iets gevaarlijk is, en ten slotte wat het effect van de actie is. Onschuldige acties, zoals het lezen van een bestand, mogen altijd door. Risicovolle acties, zoals het aanpassen van systeembestanden, worden geweigerd. Twijfelgevallen, zoals het verwijderen van een map, legt het systeem voor aan de gebruiker. Belangrijk verschil met veel andere AI-agents: de AI zelf bepaalt niet of iets mag. Dat doet vaste, voorspelbare code.

Shell-commando's, opdrachten die rechtstreeks met het besturingssysteem praten, draaien bovendien in een sandbox: een afgeschermde omgeving op de computer waarin het programma niet bij de rest van het systeem kan. Op Linux gebeurt dat met het programma bubblewrap, op macOS met sandbox-exec. Is zo'n afscherming niet beschikbaar, dan weigert Talos domweg te draaien in plaats van onbeschermd verder te gaan.

179 testgevallen bij elke update

Om te bewijzen dat het systeem doet wat het belooft, draait de installatie van Talos een testreeks van 179 aanvalsscenario's, een vorm van red teaming waarbij expres geprobeerd wordt de beveiliging te omzeilen. Denk aan commando's die een SSH-sleutel proberen te stelen, systeembestanden proberen te overschrijven of de hele harde schijf proberen te wissen. Pas als alle 179 gevallen zich gedragen zoals verwacht, start de installatie daadwerkelijk. Faalt er ook maar één test, dan stopt de installatie automatisch.

Het permissiemodel van Talos kent geen standaardtoegang: een gebruiker moet expliciet zijn eigen identiteit instellen voordat het systeem iets mag doen. Zonder die stap start de agent helemaal niet. Talos kan ook grotere taken uitbesteden aan een afgeschermde AI-hulpprogrammeur, die code schrijft en test binnen een eigen werkmap. Verder kent het systeem noodknoppen: /stop breekt direct alles af, /undo maakt de laatste bestandswijziging ongedaan, en /autonomy 0 zet de agent volledig aan de ketting. Deze commando's werken zonder tussenkomst van het taalmodel zelf, zodat een AI die in de fout gaat zichzelf niet kan tegenhouden of overrulen.

De maker benadrukt dat het systeem geen garantie biedt tegen een kwaadwillend AI-model en niet geschikt is voor meerdere gebruikers op één machine. Het is vooral bedoeld als bescherming tegen vergissingen en tegen prompt injection, waarbij kwaadaardige instructies via tekst of bestanden het systeem proberen te misleiden.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Naarmate AI-agents meer taken zelfstandig uitvoeren op computers, groeit het risico op fouten en misbruik. Systemen zoals Talos laten zien hoe ontwikkelaars vaste, testbare technische grenzen inbouwen die niet afhankelijk zijn van het gedrag van het taalmodel zelf. Zulke beveiligingslagen kunnen een blauwdruk worden voor hoe toekomstige AI-assistenten veilig toegang krijgen tot systemen en data.

Agentic AI
AI-systemen die niet alleen antwoorden geven, maar zelfstandig taken uitvoeren, zoals het draaien van commando's of het schrijven van code.
Policy kernel
Een apart, vast stuk software dat onafhankelijk van het taalmodel beslist of een actie is toegestaan, geweigerd, of aan de gebruiker moet worden voorgelegd.
Sandbox
Een afgeschermde omgeving op een computer waarin een programma draait zonder toegang tot de rest van het systeem.
Red teaming
Het bewust proberen te omzeilen van beveiliging om zwakke plekken op te sporen voordat kwaadwillenden dat doen.
Permissiemodel
Het systeem dat bepaalt wie welke rechten heeft en welke acties automatisch mogen worden uitgevoerd.
Prompt injection
Een aanvalstechniek waarbij verborgen instructies in tekst of bestanden een AI-systeem proberen te misleiden.
Shell-commando
Een tekstopdracht waarmee direct met het besturingssysteem van een computer wordt gecommuniceerd.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents