Veiligheidsbelasting: wat kost het om AI veilig te maken?
Stel je een auto voor die net van de fabrieksband rolt, zonder gordels, airbags of kreukelzones. Die auto is lichter, sneller en goedkoper om te bouwen. Voeg je alle veiligheidsvoorzieningen toe, dan wordt de auto zwaarder, iets trager en duurder in productie. Die extra kosten en dat verlies aan prestatie noemen ingenieurs soms een veiligheidsbelasting: de prijs die je betaalt om iets veiligs te maken uit iets dat dat van nature niet is.
Bij kunstmatige intelligentie speelt hetzelfde probleem. Een taalmodel dat rechtstreeks uit een enorme berg internettekst is getraind, is vaak verrassend krachtig, maar ook ongefilterd: het kan giftige teksten produceren, gevaarlijke instructies geven of gewoon dingen verzinnen. Om dat model tot een bruikbare, beleefde assistent te maken, moet het worden bijgeschaafd, en dat bijschaven kost vaak iets van de ruwe kracht van het origineel. In het Engels heet dit de alignment tax, in het Nederlands wel vertaald als veiligheidsbelasting: het woord "belasting" verwijst hier zowel naar een kostenpost als naar een extra last of last op het systeem, net als elektrische belasting op een stroomnet.
Wat is het precies?
Een taalmodel wordt eerst getraind door het miljarden zinnen te laten voorspellen: gegeven een stuk tekst, wat is het volgende woord? Dit "basismodel" is veelzijdig en vaak verbluffend goed in taal, rekenen of code, maar het heeft geen ingebouwd besef van wat gepast, veilig of eerlijk is. Het herhaalt simpelweg patronen uit zijn trainingsdata, inclusief de foute en schadelijke patronen.
Om er een assistent van te maken die instructies volgt en weigert om bijvoorbeeld een wapen te helpen bouwen, passen ontwikkelaars een tweede trainingsronde toe. De bekendste methode heet reinforcement learning from human feedback (RLHF): mensen beoordelen antwoorden van het model, en die beoordelingen worden gebruikt om het model bij te sturen richting behulpzame, veilige antwoorden. Een nieuwere variant, RLAIF, laat een ander AI-systeem die beoordeling doen in plaats van mensen, wat sneller en goedkoper is.
Het probleem is dat deze bijsturing soms de scherpe randjes van het model afslijpt die ook nuttig waren. Een model dat is getraind om nooit te grof te klinken, kan te voorzichtig worden en nuttige vragen weigeren. Een model dat sterk is afgestemd op menselijke voorkeuren, kan op bepaalde reken- of redeneertaken net iets slechter scoren dan de ruwe versie. Dat prestatieverlies, gemeten op standaardtests, is de kern van de veiligheidsbelasting. Daarnaast bestaat er een letterlijke rekenkundige belasting: veel systemen draaien naast het hoofdmodel nog een los classificatiemodel dat input en output controleert op schadelijke inhoud, wat extra rekentijd en vertraging kost.
Wat wil men ermee bereiken?
Niemand in de sector ontkent dat veiligheid nodig is, maar iedereen wil de rekening zo laag mogelijk houden. Als veiligheid een grote hap uit de prestaties neemt, ontstaat er een prikkel om ermee te sjoemelen, zeker in een markt waar bedrijven elkaar proberen te overtreffen met steeds krachtigere modellen. Het uiteindelijke doel van onderzoek naar de veiligheidsbelasting is dus tweeledig.
Ten eerste willen onderzoekers de techniek zo verfijnen dat veiligheid vrijwel niets kost: een model dat even goed rekent, schrijft en codeert, maar toch weigert om te helpen bij schadelijke verzoeken. Ten tweede hopen beleidsmakers dat als die belasting laag genoeg is, ze als eerlijke, algemeen aanvaarde standaard kan gelden, zodat geen enkel bedrijf de verleiding voelt om veiligheid te laten vallen om een concurrentievoordeel te behalen. Vergelijk het met milieueisen voor auto's: als iedereen ze moet naleven, wordt het geen concurrentienadeel meer.
Voorbeelden uit de praktijk
Het onderzoeksveld draait om een handvol invloedrijke projecten die de veiligheidsbelasting zichtbaar hebben gemaakt en geprobeerd hebben te verlagen.
- InstructGPT (OpenAI, 2022): in het onderliggende onderzoekspaper werd expliciet gemeten hoeveel prestatie een model verliest door RLHF-training, en liet zien dat het mengen van de oorspronkelijke trainingsdata terug in het proces dat verlies gedeeltelijk kon herstellen.
- Constitutional AI / Claude (Anthropic, 2022): Anthropic liet een model zichzelf bijsturen aan de hand van een geschreven set principes, met AI-feedback in plaats van uitsluitend dure menselijke beoordelingen, om de kosten en snelheid van veiligheidstraining te verbeteren.
- Sparrow (DeepMind, 2022): deze proefopzet voor een dialoogsysteem werd getraind met expliciete regels over wat wel en niet mocht, en de onderzoekers documenteerden hoe strenger naleving van regels soms ten koste ging van hoe behulpzaam en informatief de antwoorden waren.
- Llama 2 (Meta, 2023): bij de release beschreef Meta uitgebreid hoe het balanceren tussen behulpzaamheid en onschadelijkheid tijdens RLHF een terugkerende afweging vormde, met aparte trainingsrondes voor beide doelen.
- Llama Guard (Meta, 2023): in plaats van veiligheid alleen in het hoofdmodel te bouwen, bracht Meta een apart, kleiner classificatiemodel uit dat als filter naast een taalmodel draait. Dat verlaagt de belasting op het hoofdmodel zelf, maar voegt een extra rekenstap en dus vertraging toe aan elk antwoord.
Hoe ver is de techniek?
De veiligheidsbelasting is de afgelopen jaren duidelijk gedaald, maar niet verdwenen. Nieuwere trainingsmethoden zoals Direct Preference Optimization (DPO), voorgesteld in 2023, maken het mogelijk om modellen af te stemmen op menselijke voorkeuren zonder het omslachtige, foutgevoelige aparte beloningsmodel dat klassieke RLHF nodig heeft. Dat maakt afstemming goedkoper en stabieler, al is nog niet aangetoond dat het de belasting tot nul terugbrengt.
Een lastig punt is dat er geen eenduidige, algemeen aanvaarde meetlat bestaat. De ene benchmark laat weinig verschil zien tussen een ruw en een afgestemd model, de andere juist een duidelijke terugval, afhankelijk van de taak en de gebruikte techniek. Bovendien duikt er een omgekeerd probleem op: modellen die te sterk zijn afgestemd, worden soms overdreven voorzichtig of buigen te makkelijk mee met de mening van de gebruiker, een fenomeen dat onderzoekers sycofantie noemen. Het zoeken naar de juiste balans tussen behulpzaam en veilig blijft dus een actief onderzoeksterrein zonder afgeronde oplossing.
Naast de technische belasting is er ook een financiële kant die steeds zichtbaarder wordt. Regelgeving zoals de Europese AI-verordening verplicht aanbieders van hoog-risico AI-systemen tot conformiteitsbeoordelingen en documentatie, wat voor bedrijven reële extra kosten met zich meebrengt, los van wat het model zelf aan rekenkracht kost.
Wie werken eraan?
De grote Amerikaanse AI-laboratoria vormen de kern van dit onderzoek: OpenAI, Anthropic en Google DeepMind publiceren regelmatig over afstemmingstechnieken en de bijbehorende prestatieafwegingen, en Meta AI doet dat via zijn Llama-modellenreeks. Aan academische kant dragen groepen zoals Stanford's Human-Centered AI Institute en het Center for Human-Compatible AI van de Universiteit van Californië, Berkeley bij aan onderzoek naar afstemming en de meetbaarheid van de veiligheidsbelasting.
Op regelgevend vlak zijn overheidsinstanties zoals het Britse AI Safety Institute en het Amerikaanse NIST, via zijn AI Safety Institute, bezig met het onafhankelijk evalueren van modellen op veiligheid. In Europa speelt de Europese Commissie via de AI-verordening een vergelijkbare rol door bedrijven te verplichten veiligheid aantoonbaar te maken, wat de discussie over wie welke kosten draagt verder aanwakkert.