AI & computing › Agentic AI & autonome agents
AI-agent Aura speurt zelf naar oorzaak van serverstoringen en herstelt ze
Het Amerikaanse bedrijf Mezmo heeft zijn interne AI-systeem Aura als opensourcesoftware vrijgegeven. De tool onderzoekt zelfstandig storingen in serverinfrastructuur, legt de oorzaak bloot en stelt reparaties voor, terwijl mensen de laatste beslissing houden.
Als een website of app plotseling niet meer werkt, zoeken technici doorgaans handmatig in logbestanden, meetgegevens en systeeminstellingen naar de oorzaak. Dat kan uren duren. Het Amerikaanse observability-bedrijf Mezmo bouwde daarom Aura: een agentic AI-systeem dat dit speurwerk zelf uitvoert. De software is geschreven in de programmeertaal Rust en nu gratis beschikbaar op GitHub onder een opensourcelicentie.
Aura bestaat uit meerdere gespecialiseerde AI-agents die samenwerken. In een demonstratie van het bedrijf onderzoekt het systeem een mislukte betaling in een webshop. De agents combineren foutmeldingen en logs uit Mezmo's eigen platform, snelheidsmetingen uit het monitoringprogramma Prometheus en de recente updategeschiedenis van een Kubernetes-cluster, waarin containers van een applicatie draaien. Zo ontdekken ze dat een nieuwe versie van een productcatalogus-dienst een zogeheten N+1-regressie veroorzaakte: een programmeerfout waardoor het systeem bij elke bevraging onnodig veel extra databasequery's uitvoert, wat alles vertraagt. Aura adviseert een terugrol naar de vorige, werkende softwareversie en levert meteen een controlelijst voor engineers.
Mens blijft aan het roer
Omdat een AI-systeem dat zelfstandig ingrijpt in productieomgevingen risico's met zich meebrengt, bouwde Mezmo stevige guardrails in. Gevoelige acties, zoals het herstarten van diensten of het aanpassen van instellingen, vereisen expliciete goedkeuring van een medewerker: een vorm van human-in-the-loop-toezicht. Gaat er iets mis met die goedkeuringsstap, dan weigert het systeem standaard om door te gaan in plaats van zelf te improviseren. Bedrijven leggen agents, regels en bevoegdheden vast in leesbare configuratiebestanden, zodat wijzigingen controleerbaar blijven.
Aura werkt met bestaande taalmodellen van onder meer OpenAI, Anthropic, Google en Amazon, en kan ook lokale modellen via Ollama draaien. Voor toegang tot externe systemen gebruikt het de Model Context Protocol-standaard, waarmee de agents kunnen koppelen met tientallen diensten zoals AWS, Azure, GitHub, Jira, Datadog en PagerDuty. Elke stap die een agent zet, van modelaanroep tot toolgebruik, wordt vastgelegd via OpenTelemetry-tracering, zodat achteraf precies te herleiden is welke beslissingen zijn genomen.
Van interne tool naar breed inzetbaar
Aura begon als het interne gereedschap waarmee Mezmo's eigen technici de storingen van hun cloudplatform oplosten. Inmiddels draait de software ook bij andere bedrijven en verwerkt Mezmo's gehoste platform er naar eigen zeggen maandelijks duizenden agent-sessies mee. Omdat de code open source is, kunnen organisaties Aura in hun eigen datacenter draaien, ook in afgeschermde of sterk gereguleerde omgevingen zonder internetverbinding. Dat maakt de tool interessant voor sectoren waar gevoelige data het huis niet uit mag, zoals de financiële sector of overheid.
De opkomst van dit soort AI-systemen voor systeembeheer, ook wel AIOps genoemd, weerspiegelt een bredere trend: bedrijven vertrouwen steeds meer routinematig, maar tijdrovend technisch speurwerk toe aan AI-agents, terwijl mensen verantwoordelijk blijven voor de uiteindelijke ingreep.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Tools zoals Aura laten zien hoe AI-agents steeds vaker taken overnemen die voorheen alleen ervaren technici konden uitvoeren, van het opsporen van bugs tot het voorstellen van reparaties. Doordat de software open source is en met ingebouwde goedkeuringsstappen werkt, kunnen ook bedrijven met strenge veiligheidseisen ermee experimenteren zonder direct de controle te verliezen. Dit soort systemen kan de druk op IT-afdelingen verlichten, maar vergroot ook de afhankelijkheid van AI-modellen voor kritieke infrastructuur.
- Agentic AI
- Kunstmatige intelligentie die niet alleen antwoord geeft, maar ook zelfstandig stappen onderneemt om een taak te volbrengen.
- Guardrails
- Ingebouwde beperkingen en regels die voorkomen dat een AI-systeem buiten toegestane grenzen handelt.
- Human-in-the-loop
- Een werkwijze waarbij een mens goedkeuring moet geven voordat een AI-systeem een belangrijke actie uitvoert.
- Model Context Protocol (MCP)
- Een open standaard waarmee AI-modellen op een uniforme manier verbinding maken met externe tools en databronnen.
- OpenTelemetry-tracering
- Een techniek waarmee elke stap van een softwareproces wordt vastgelegd, zodat achteraf te herleiden is wat er precies gebeurde.
- Rust
- Een programmeertaal die bekendstaat om snelheid en veiligheid, vaak gebruikt voor systemen die zeer betrouwbaar moeten draaien.
- Kubernetes
- Software waarmee bedrijven containers, kleine verpakte stukjes applicatiecode, op grote schaal beheren.
- Prometheus
- Een populair opensource-programma voor het verzamelen en bewaken van technische meetgegevens van servers en applicaties.
- N+1-regressie
- Een programmeerfout waarbij software onnodig veel extra databasebevragingen doet, wat systemen sterk vertraagt.
- Air-gapped omgeving
- Een IT-omgeving die volledig is afgesloten van internet of externe netwerken, vaak gebruikt voor extra beveiliging.
- Site Reliability Engineering (SRE)
- Een vakgebied waarin technici softwaretechnieken gebruiken om de betrouwbaarheid en beschikbaarheid van IT-systemen te waarborgen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.