AI & computing › Agentic AI & autonome agents
Argus laat AI-agents als een mens door je website klikken om bugs te vinden
Een nieuwe open-source tool genaamd Argus laat kunstmatige intelligentie zelfstandig een website doorlopen, klikken en beoordelen alsof er een echte gebruiker achter de knoppen zit. In plaats van vaste testscripts te schrijven, beschrijft een ontwikkelaar simpelweg wat 'werkend' betekent, waarna vijf samenwerkende AI-agents de site verkennen en een rapport met screenshots afleveren.
Softwaretesten is al decennia een tijdrovend werk: ontwikkelaars schrijven scripts die knoppen aanklikken, formulieren invullen en controleren of alles werkt zoals bedoeld. Het probleem is dat die scripts breken zodra een website verandert, en het schrijven ervan kost veel tijd. Het Amerikaanse project Argus, ontwikkeld door het bedrijf Argus Testing, probeert dat om te draaien met agentic AI: een kunstmatige intelligentie die zelf beslist hoe ze een taak aanpakt in plaats van een vast script af te werken.
Beschrijven in plaats van programmeren
Een gebruiker van Argus geeft alleen een webadres en een beschrijving van de gewenste test, bijvoorbeeld: zoek een bekend bedrijf in een online bedrijvengids en controleer of de zoekresultaten kloppen. De AI, aangedreven door Google's Gemini-model, opent vervolgens een geïsoleerde browservenster en probeert die taak zelfstandig uit te voeren. Ze klikt, typt, scrolt en beoordeelt zelf of de site zich gedraagt zoals verwacht. Dat scheelt vooral tijd bij teams waar de website vaker verandert dan de testscripts kunnen bijbenen, een probleem dat groter wordt nu steeds meer code met behulp van AI wordt geschreven.
Vijf agents die samenwerken
Achter de schermen bestaat een testrun niet uit één AI-aanroep, maar uit vijf gespecialiseerde onderdelen die elkaar aflossen. Een 'Validator' checkt eerst of de opdracht en het webadres bruikbaar zijn. Een 'Comprehender' knipt de testbeschrijving op in losse testgevallen. Vervolgens brengt een 'Explorer' de website in kaart door alle pagina's en knoppen te verkennen, waarna een 'Strategist' daar een concreet stappenplan van maakt. Tot slot voert een 'Executor' dat plan echt uit in de browser. Elke stap is live te volgen: gebruikers zien in real time hoe de AI redeneert, bijvoorbeeld wanneer ze meldt dat ze naar een bepaalde pagina navigeert of een zoekresultaat controleert. Aan het einde van een run levert Argus een tijdlijn, screenshots en een pass/fail-rapport met de onderbouwing van dat oordeel.
Lokaal draaien, met een addertje onder het gras
Argus is webautomatisering gebouwd bovenop Playwright, een bekend hulpmiddel voor browserbesturing, en slaat alle gegevens lokaal op in een SQLite-database. Er wordt geen data naar externe servers gestuurd, op de aanroepen naar Gemini na, en gevoelige gegevens zoals wachtwoorden worden geweigerd in testadressen. Wie het zelf wil draaien heeft Python, Node.js en een Gemini API-sleutel nodig; er is ook een gehoste versie beschikbaar via argustest.com. De licentie is opvallend: individuen en kleine teams tot honderd leden mogen Argus gratis gebruiken en aanpassen, grotere bedrijven moeten een commerciële licentie afsluiten. Na drie jaar valt elke release automatisch terug op de volledig vrije MIT-licentie.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Argus laat zien hoe AI-agents steeds vaker taken overnemen die voorheen puur menselijk maatwerk waren, zoals het beoordelen of een website 'goed genoeg' werkt. Als deze aanpak aanslaat, verschuift softwaretesten van het onderhouden van breekbare scripts naar het simpelweg beschrijven van intenties, wat vooral kleine ontwikkelteams tijd kan besparen. Tegelijk roept het nieuwe vragen op over hoe betrouwbaar een AI-oordeel over 'correct gedrag' eigenlijk is.
- Agentic AI
- Kunstmatige intelligentie die zelfstandig beslissingen neemt en meerdere stappen onderneemt om een doel te bereiken, in plaats van simpelweg één vraag te beantwoorden.
- Playwright
- Een veelgebruikt softwarehulpmiddel waarmee ontwikkelaars webbrowsers automatisch laten klikken, typen en navigeren, vaak gebruikt voor het testen van websites.
- Multi-agent pipeline
- Een opzet waarbij meerdere gespecialiseerde AI-programma's na elkaar werken en elkaars resultaat als basis gebruiken, in plaats van dat één AI de hele taak in één keer uitvoert.
- SQLite
- Een lichtgewicht databasesysteem dat gegevens in een enkel bestand opslaat, vaak gebruikt in kleinere of lokale toepassingen zonder aparte databaseserver.
- API-sleutel
- Een unieke code waarmee software zich identificeert bij een externe dienst, in dit geval om gebruik te mogen maken van Google's Gemini-AI-model.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.