AI & computing › Agentic AI & autonome agents
Anthropic laat AI eigen fouten herstellen, goedkoper en sneller dan mensen
Een onderzoeker van AI-bedrijf Anthropic heeft een systeem gebouwd dat automatisch veiligheidsfouten in AI-modellen opspoort en repareert. Het systeem scoorde op alle tien geteste probleemgebieden beter dan ervaren menselijke onderzoekers, en dat voor een fractie van de kosten. Het is een vroege blik op AI die zichzelf leert verbeteren.
Onderzoekers van AI-bedrijf Anthropic hebben voor het eerst laten zien hoe een geautomatiseerd systeem zelfstandig misalignment in AI-modellen kan opsporen en verhelpen. Het systeem, de Automated Alignment Researcher (AAR), doet dat sneller en aanzienlijk goedkoper dan menselijke onderzoekers.
Hoe het systeem te werk gaat
De AAR doorloopt een proces dat sterk lijkt op hoe menselijke wetenschappers werken. Eerst doorzoekt het systeem bestaande wetenschappelijke literatuur over een specifiek probleem, zoals een AI-model dat vleierig reageert of stiekem regels omzeilt. Vervolgens stelt de AAR een aanpak voor om dat gedrag te corrigeren. Die aanpak wordt dertig minuten lang getest tijdens het naschoolse trainingsproces van het model, de zogeheten post-training-fase. Werkt een methode goed, dan wordt die bewaard; werkt ze niet, dan verdwijnt ze. Door dit razendsnel en op grote schaal te herhalen, kan het systeem in korte tijd talloze varianten uitproberen.
Het team, geleid door Anthropic-fellow Chen Yueh-Han, testte de aanpak op tien benchmarks die elk een specifieke vorm van ongewenst modelgedrag meten. Op alle tien benchmarks verbeterde de AAR de prestaties van het model, zonder dat de algehele kwaliteit van het model achteruitging. Dat laatste is belangrijk: het bijschaven van veiligheid mag niet ten koste gaan van hoe goed of behulpzaam een model verder werkt.
Sneller en veertig keer goedkoper dan een mens
Opvallend is de directe vergelijking die de onderzoekers maken met menselijke experts. Binnen gemiddeld zes uur presteerde de beste AAR-methode beter dan wat ervaren menselijke onderzoekers zelf konden bedenken. Onderzoeksrichtingen die door mensen werden aangestuurd, leverden volgens het paper zelfs geen sterkere resultaten op dan de AAR volledig aan zijn eigen lot overlaten. Ook financieel is het verschil groot: het draaien van een AAR kost ongeveer 4 dollar per uur aan rekenkracht, tegenover zo'n 150 dollar per uur voor een ervaren menselijke onderzoeker.
Stap richting zelflerende AI, met kanttekeningen
Het onderzoek wordt gezien als een vroeg signaal richting recursieve zelfverbetering: het scenario waarin AI-systemen niet alleen zichzelf trainen op specifieke taken, maar uiteindelijk ook het onderzoeksproces zelf verbeteren. Als dat lukt, zouden AI-systemen op termijn een deel van het werk van menselijke AI-onderzoekers kunnen overnemen.
De onderzoekers plaatsen zelf ook kanttekeningen. Het systeem werkt alleen zo goed als de benchmarks die het gebruikt: meten die niet precies het juiste gedrag, dan optimaliseert de AAR mogelijk voor de verkeerde dingen. Bovendien vergt het opzetten en actueel houden van goede benchmarks en een bruikbare kennisbank nog altijd substantieel menselijk werk. Het onderzoek is dus geen bewijs dat AI-onderzoekers overbodig worden, wel dat geautomatiseerde ondersteuning bij AI-veiligheid dichterbij komt dan gedacht.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-systemen steeds beter worden in het verbeteren van hun eigen veiligheid, kan dat de ontwikkeling van betrouwbaardere AI versnellen. Tegelijk roept het vragen op over hoeveel controle mensen straks nog hebben over dat proces, zeker als AI ooit ook het onderzoeksproces zelf gaat verbeteren. Voorlopig is dit vooral een aanvulling op menselijke onderzoekers, geen vervanging.
- Alignment / misalignment
- Het proces waarbij een AI-model zich gedraagt zoals de makers bedoelen; misalignment betekent dat het model daarvan afwijkt, bijvoorbeeld door te vleien of regels te omzeilen.
- Automated Alignment Researcher (AAR)
- Het geautomatiseerde systeem uit dit onderzoek dat zelfstandig methodes bedenkt en test om alignment-problemen in AI-modellen te verhelpen.
- Benchmark
- Een gestandaardiseerde test waarmee onderzoekers meten hoe goed of hoe veilig een AI-model presteert op een specifieke taak of vorm van gedrag.
- Post-training
- De trainingsfase die volgt nadat een AI-model zijn basisvaardigheden heeft geleerd, gericht op het bijschaven van gedrag en veiligheid.
- Recursieve zelfverbetering
- Het scenario waarin een AI-systeem niet alleen zichzelf verbetert, maar ook de manier waarop het zichzelf traint en onderzoekt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.