Abliteratie: hoe onderzoekers de ingebouwde 'nee' van een AI-model wegsnijden
Stel je een heel behulpzame assistent voor die op bepaalde vragen standaard weigert te antwoorden: "Daar kan en wil ik je niet bij helpen." Die weigering zit er niet toevallig in; makers van taalmodellen als ChatGPT, Llama of Mistral trainen hun systemen bewust om gevoelige of potentieel schadelijke verzoeken af te wijzen. Abliteratie (Engels: abliteration, een samentrekking van ablation, wegsnijden, en obliteration, uitwissen) is een techniek waarmee onderzoekers en hobbyisten die ingebouwde weigerreflex uit een bestaand model verwijderen, zonder het model opnieuw te hoeven trainen.
Het bijzondere is de precisie: abliteratie haalt niet lukraak aan het model, maar spoort eerst op welk mechanisme in het model verantwoordelijk is voor het zeggen van "nee", en snijdt vervolgens specifiek dat onderdeel weg. Vergelijk het met een chirurg die niet de hele spraakfunctie van een patiënt uitschakelt, maar heel gericht alleen de zenuwbaan doorknipt die het woord "nee" aanstuurt. Het resultaat is een model dat op vrijwel elke vraag een inhoudelijk antwoord probeert te geven, ook op vragen waarop het origineel zou hebben geweigerd.
Wat is het precies?
Moderne chatmodellen doorlopen na hun basistraining nog een fase waarin ze leren zich als assistent te gedragen en om bepaalde verzoeken te weigeren, bijvoorbeeld via reinforcement learning from human feedback (RLHF), een methode waarbij mensen aangeven welke antwoorden wenselijk zijn. Die weigering is dus zelf ook 'aangeleerd' gedrag, verankerd in de duizenden getallen (gewichten) waaruit het model bestaat.
In 2024 publiceerde een groep onderzoekers rond Andy Arditi en Neel Nanda (verbonden aan het interpretability-onderzoek van Google DeepMind) een invloedrijk paper met de titel Refusal in Language Models Is Mediated by a Single Direction. Hun ontdekking: bij veel modellen wordt weigergedrag aangestuurd door één enkele, relatief eenvoudige wiskundige 'richting' in de interne rekenruimte van het model, de zogeheten residual stream (de laag waarin het model tussentijdse informatie doorgeeft van de ene rekenstap naar de volgende).
Die richting valt te berekenen door het model veel prompts te geven die normaal een weigering uitlokken ("leg uit hoe je...") en veel prompts die dat niet doen, en vervolgens de gemiddelde interne activatie van beide groepen met elkaar te vergelijken. Het verschil tussen die twee gemiddelden is bij benadering de 'weigerrichting'.
Vervolgens kun je die richting letterlijk uit de gewichten van elke laag van het model projecteren (wiskundig: orthogonaal maken), zodat het model die interne route simpelweg niet meer kan gebruiken, ongeacht wat er wordt gevraagd. Dat wegsnijden is de 'ablatie' in abliteratie. Het vergt geen hertraining van het hele model en kan, afhankelijk van de modelgrootte, met bescheiden rekenkracht (soms één grafische kaart) binnen enkele uren worden uitgevoerd.
Een belangrijke beperking: dit werkt alleen bij zogeheten open-weight-modellen, modellen waarvan de makers de volledige gewichten publiekelijk beschikbaar stellen, zoals Llama van Meta. Bij gesloten modellen die alleen via een onlinedienst bereikbaar zijn, zoals GPT-4 of Claude, heb je geen toegang tot die interne gewichten en is abliteratie in deze vorm niet mogelijk.
Wat wil men ermee bereiken?
De motieven lopen uiteen, en niet allemaal zijn ze onomstreden. Vanuit wetenschappelijk oogpunt is abliteratie vooral interessant voor interpretability-onderzoek: het begrijpen hoe veiligheidsgedrag daadwerkelijk in een model is verankerd. Als je weet dat één richting zoveel gewicht in de schaal legt, leer je ook iets over hoe kwetsbaar of juist robuust dat mechanisme is, kennis die weer kan helpen om betere, minder makkelijk te omzeilen bescherming te bouwen.
Een tweede drijfveer komt uit de gebruikersgemeenschap. Veel mensen die lokaal, op eigen apparatuur, met open modellen werken ervaren de ingebouwde weigeringen soms als overdreven: een model dat weigert een historische oorlogsmisdaad te beschrijven, medische vakterminologie uit te leggen of een personage in een roman iets onaardigs te laten zeggen. Voor hen is abliteratie een manier om die overgevoeligheid weg te halen zonder dat ze zelf het hele model opnieuw moeten trainen.
Tegelijk is het niet te ontkennen dat dezelfde techniek de veiligheidsgrenzen van een model volledig kan slechten, inclusief grenzen die er niet voor niets in zitten. Een geabliteerd model geeft in de praktijk aanzienlijk makkelijker uitleg over schadelijke onderwerpen dan het origineel. Dat maakt abliteratie tot een schoolvoorbeeld van een 'dual use'-techniek: hetzelfde gereedschap dat onderzoek en gebruikersvrijheid dient, kan ook misbruik vergemakkelijken. Binnen de AI-veiligheidsgemeenschap wordt het dan ook serieus bestudeerd, niet als curiositeit maar als reëel aandachtspunt bij het uitbrengen van open-weight modellen.
Voorbeelden uit de praktijk
Het veld is klein maar actief, en grotendeels zichtbaar via open platforms zoals Hugging Face, waar onderzoekers en hobbyisten modellen en code delen.
- Arditi e.a., 2024 - het genoemde paper Refusal in Language Models Is Mediated by a Single Direction legde de wiskundige basis en publiceerde bijbehorende code, waarmee de techniek voor iedereen met programmeerkennis toegankelijk werd.
- FailSpy (Hugging Face-gebruiker), 2024 - kort na het verschijnen van het paper publiceerde deze onafhankelijke ontwikkelaar 'abliterated' versies van Meta's Llama 3 Instruct-modellen (onder meer de 8B- en 70B-variant), die breed werden gedownload en besproken.
- Maxime Labonne, 2024 - deze machine-learning-onderzoeker (later actief bij het bedrijf Liquid AI) schreef een veelgelezen uitlegartikel over abliteratie, compleet met een uitvoerbaar codevoorbeeld, waardoor de techniek ook buiten de kleine kring van interpretability-onderzoekers bekend raakte.
- Community-reacties op DeepSeek R1, begin 2025 - na de release van het Chinese redeneermodel DeepSeek R1 verschenen binnen enkele dagen door de gemeenschap geabliteerde varianten op Hugging Face, een illustratie van hoe snel de techniek inmiddels op nieuwe modellen wordt toegepast.
- Circuit Breakers, Gray Swan AI / Center for AI Safety, 2024 - als reactie op abliteratie en verwante aanvallen ontwikkelden deze organisaties een verdedigingstechniek die schadelijke interne representaties actief omleidt in plaats van te vertrouwen op één enkele, makkelijk te vinden weigerrichting.
Hoe ver is de techniek?
Voor kleinere en middelgrote open-weight chatmodellen (van enkele miljarden tot enkele tientallen miljarden parameters) is abliteratie inmiddels een redelijk uitgekristalliseerde, goed gedocumenteerde en makkelijk te reproduceren methode: de benodigde code is vrij beschikbaar en de rekenkracht die nodig is, valt vaak binnen het bereik van een goed uitgeruste hobbyist.
Tegen de grootste, gesloten commerciële modellen biedt de techniek in haar huidige vorm weinig directe dreiging, simpelweg omdat buitenstaanders geen toegang hebben tot de interne gewichten die nodig zijn om de weigerrichting te berekenen en weg te snijden. Het risico concentreert zich dus vooral bij open-weight modellen.
Aan de verdedigingskant zien we sinds 2024 nadrukkelijke tegenbewegingen. Technieken als Circuit Breakers proberen weigergedrag te verspreiden over meerdere, onderling verweven mechanismen in plaats van één makkelijk te isoleren richting, zodat een simpele projectie niet meer volstaat. Ook grote labs als Anthropic experimenteren met bredere verdedigingslagen tegen representation-based aanvallen in het algemeen. Het is op dit moment eerlijker om te spreken van een lopende wapenwedloop tussen aanval en verdediging dan van een opgelost probleem aan een van beide kanten.
Een nuance die vaak ontbreekt in enthousiaste besprekingen: abliteratie verandert alleen het weigergedrag, niet de onderliggende kennis of vaardigheden van het model. Sommige geabliteerde modellen leveren bovendien merkbaar minder samenhangende of kwalitatief mindere antwoorden dan het origineel, een bijwerking die de wetenschappelijke gemeenschap nog actief probeert te verkleinen.
Wie werken eraan?
Het fundamentele onderzoek komt grotendeels uit de hoek van mechanistic interpretability, een deelgebied van AI-onderzoek dat probeert te doorgronden wat er letterlijk in een neuraal netwerk gebeurt. Neel Nanda, verbonden aan het interpretability-team van Google DeepMind, en zijn medeauteurs behoren tot de bekendste namen hierin, vaak in samenwerking met kleinschalige onderzoeksprogramma's die getalenteerde onderzoekers begeleiden in dit specialisme.
De toepassing en verspreiding van de techniek gebeurt grotendeels door de open-source gemeenschap rond Hugging Face, het populairste platform voor het delen van AI-modellen: individuele ontwikkelaars zoals de eerdergenoemde FailSpy en Maxime Labonne spelen hierin een zichtbare rol. Dit sluit aan bij een bredere 'uncensoring'-beweging rond open modellen, waarin bijvoorbeeld ook Eric Hartford (bekend van de Dolphin-modellenreeks) actief is, al gebruikt die laatste doorgaans een andere methode: hertraining op speciaal samengestelde data in plaats van chirurgische ingrepen in bestaande gewichten.
Aan de verdedigende kant investeren grote AI-labs zoals Google DeepMind en Anthropic, en gespecialiseerde veiligheidsorganisaties zoals het Center for AI Safety en Gray Swan AI (beide in de Verenigde Staten), in het robuuster maken van modellen tegen dit soort aanvallen. Er is geen landelijk of overheidsgestuurd programma specifiek rond abliteratie bekend; het blijft vooralsnog vooral een fenomeen van onderzoeksgroepen, techbedrijven en een verspreide, internationale gemeenschap van open-source-ontwikkelaars.
Verder lezen
- arXiv (preprint-archief met het onderliggende onderzoek)
- Hugging Face (platform met modellen, code en achtergrondartikelen)
- Transformer Circuits (Anthropic's publicaties over interpretability)
- Anthropic (onderzoek naar AI-veiligheid en verdedigingstechnieken)
- AI Alignment Forum (discussie en analyse door de onderzoeksgemeenschap)