AI & computing › Agentic AI & autonome agents
AI-agents beveiligen: NVIDIA pleit voor engineering-aanpak per laag
Chipgigant NVIDIA roept de techsector op om beveiliging van AI-agents net zo serieus te nemen als andere technische disciplines. Volgens het bedrijf moet elke laag van een AI-agent - van het onderliggende taalmodel tot de omgeving waarin het draait - eigen beveiligingseisen, verantwoordelijken en bewijsvoering krijgen.
AI-agents kunnen steeds meer: ze redeneren, gebruiken digitale gereedschappen en passen hun acties aan op basis van binnenkomende informatie. Die groeiende zelfstandigheid brengt nieuwe risico's met zich mee. NVIDIA stelt in een recente blogpost dat bekende beveiligingsprincipes - identiteit vaststellen, toegang beperken, blootstelling minimaliseren en controleren of beschermingsmaatregelen werken - ook voor agentic AI gelden, maar dan toegepast op een compleet nieuwe manier van werken.
Drie lagen, drie verantwoordelijkheden
Een AI-agent bestaat volgens NVIDIA uit drie onderdelen die stuk voor stuk beveiligd moeten worden. Het taalmodel levert de vaardigheden, het agentharnas organiseert de context, gereedschappen en werkstromen, en de runtime-omgeving levert de infrastructuur waarin acties daadwerkelijk worden uitgevoerd. Data, instructies en acties bewegen zich door al die lagen heen, en elke laag heeft eigen kwetsbaarheden.
NVIDIA illustreert het risico met een voorbeeld: een agent die een klantendossier bijwerkt, stuit op kwaadaardige instructies verstopt in een bijgevoegd document en probeert vervolgens klantgegevens naar een onbevoegde bestemming te exporteren. Een netwerkbeleid moet die overdracht blokkeren, en beveiligde logbestanden moeten vastleggen welke actie is geprobeerd en waarom die is geweigerd. Het recht om een dossier te wijzigen betekent volgens het bedrijf nadrukkelijk niet dat een agent ook gegevens mag exporteren - en een agent mag zichzelf nooit extra bevoegdheden toekennen.
Grenzen die standhouden, ook bij een foute beslissing
Een belangrijk uitgangspunt is dat beveiliging moet blijven werken, zelfs als een agent een verkeerde beslissing neemt. De omgeving waarin een agent draait moet dus onafhankelijk van diens 'redenering' grenzen opleggen aan bestanden, netwerkbestemmingen en processen. Elke agent heeft daarnaast een herleidbare identiteit nodig met inloggegevens die beperkt zijn tot de toegewezen taak, en risicovolle acties vereisen altijd goedkeuring van een mens.
Om dit in de praktijk te brengen bouwt NVIDIA aan OpenShell, een open source runtime die beleid afdwingt buiten het bereik van de agent zelf en zorgt voor geïsoleerde uitvoering. Partners binnen de Open Secure AI Alliance bouwen hierop voort: Cisco voegt met DefenseClaw een governancelaag toe, en JFrog controleert de herkomst en integriteit van de 'skills' die agents gebruiken.
Testen, bewijzen en van elkaar leren
Voor livegang moeten teams volgens NVIDIA kunnen aantonen dat hun controles pogingen blokkeren om toegangsrechten te verruimen of gevoelige data te exporteren - en die tests herhalen na elke wezenlijke wijziging. Bedrijven als CrowdStrike en Palo Alto Networks bieden inmiddels tools voor herhaalde aanvalssimulaties en continue red teaming van AI-systemen. Ook het delen van bevindingen tussen organisaties is volgens NVIDIA cruciaal: wat in het ene bedrijf faalt of juist werkt, helpt andere teams hun eigen systemen te versterken.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-agents meer taken zelfstandig uitvoeren - van klantcontact tot financiële transacties - wordt structurele beveiliging per laag onmisbaar om misbruik en datalekken te voorkomen. Open standaarden en gedeelde testresultaten kunnen die beveiliging sneller naar een breder deel van de sector brengen dan wanneer elk bedrijf dit apart uitzoekt.
- Agentic AI
- AI-systemen die zelfstandig kunnen redeneren, tools gebruiken en meerdere stappen zetten om een taak te voltooien.
- Agentharnas
- De software rond een taalmodel die context, gereedschappen en werkstromen organiseert zodat het model daadwerkelijk kan handelen.
- Red teaming
- Het gecontroleerd testen van een systeem door het doelbewust aan te vallen, om zwakke plekken te vinden voordat kwaadwillenden dat doen.
- Agentruntime
- De infrastructuur waarbinnen een AI-agent daadwerkelijk acties uitvoert, los van het taalmodel zelf.
- Beleidsafdwinging
- Het technisch garanderen dat vastgestelde regels en grenzen worden nageleefd, ongeacht wat een systeem 'beslist'.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.