Kennisbank

Activatiesturing: een AI bijsturen door in zijn ‘gedachten’ te knijpen

Bijgewerkt: 28 september 2026 · 6 min leestijd

Stel je een groot orkest voor dat een stuk muziek speelt. Je kunt de partituur herschrijven (dat kost weken), of je kunt de dirigent nieuwe aanwijzingen fluisteren voordat het stuk begint (dat werkt soms, maar niet altijd precies zoals je wilt). Activatiesturing is een derde weg: je loopt tijdens het spelen naar een paar specifieke violisten en draait hun volumeknop iets harder of zachter. De partituur blijft ongewijzigd, de dirigent krijgt geen nieuwe instructies, maar het totaalgeluid verschuift toch merkbaar — bijvoorbeeld melancholischer of vrolijker.

Bij kunstmatige intelligentie werkt dit principe verrassend letterlijk. Grote taalmodellen (de technologie achter chatbots zoals ChatGPT en Claude) verwerken tekst in lagen van rekenkundige bewerkingen. Op elke laag ontstaan zogeheten activaties: lange rijen getallen die een soort tussentijdse ‘gedachte’ van het model vormen. Onderzoekers hebben ontdekt dat bepaalde concepten — denk aan boosheid, eerlijkheid, of zelfs iets specifieks als ‘de Golden Gate Bridge’ — corresponderen met een herkenbare richting in die getallenmassa. Activatiesturing (in het Engels activation steering) betekent: die richting opsporen en er tijdens het genereren van tekst een beetje bij optellen of aftrekken, zodat het model zich meer of minder naar dat concept toe gedraagt. Geen nieuwe training, geen ander prompt-tekstje — gewoon een kleine wiskundige duw in de interne rekenmachine van het model.

Wat is het precies?

Om te snappen hoe dit werkt, helpt het de stappen op een rijtje te zetten.

Stap 1 — Activaties zijn overal. Een taalmodel bestaat uit tientallen lagen. Elke laag zet de tekst-tot-dan-toe om in een vector: een lijst van duizenden getallen. Deze vectoren zijn niet toevallig; ze coderen betekenis, toon, feitenkennis en nog veel meer, alleen niet in mensentaal maar in getallen.

Stap 2 — Concepten als richting. Verrassend genoeg gedragen veel concepten zich lineair in deze ruimte. Dat betekent: als je het gemiddelde activatiepatroon berekent bij teksten die eerlijk zijn, en dat vergelijkt met teksten die ontwijkend of leugenachtig zijn, dan is het verschil tussen die twee gemiddelden een vector die ‘eerlijkheid’ representeert. Deze techniek heet contrastive activation addition: je maakt bewust contrastparen (wel/niet het concept) om de richting bloot te leggen.

Stap 3 — Een preciezere methode: sparse autoencoders. Een nieuwere en verfijndere aanpak ontleedt de activaties met een klein hulpnetwerk (een sparse autoencoder) in duizenden of miljoenen losse, interpreteerbare ‘kenmerken’ (features), elk gekoppeld aan een herkenbaar concept. Dit is arbeidsintensiever om te bouwen, maar levert veel scherpere en specifiekere sturingsvectoren op dan de contrastmethode.

Stap 4 — De vector toepassen. Eenmaal gevonden, telt men de vector — vermenigvuldigd met een sterkte-factor — op bij de activaties van een gekozen laag, telkens opnieuw terwijl het model woord voor woord tekst genereert. Een positieve factor versterkt het concept, een negatieve onderdrukt het.

Stap 5 — Het verschil met prompten en fine-tunen. Bij prompten verander je alleen de invoertekst; het model interpreteert die zelf, met wisselend succes. Bij fine-tunen pas je de gewichten (de eigenlijke ‘kennis’) van het model permanent aan, wat rekenkracht en data kost. Activatiesturing zit daartussenin: geen gewichtswijziging, geen extra prompttekst, maar een directe, tijdelijke en goedkope ingreep in het rekenproces zelf.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is AI-veiligheid. Onderzoekers hopen ongewenst gedrag — overdreven vleierij, misleiding, het aanmoedigen van schadelijke verzoeken — direct te kunnen afremmen door de bijbehorende richting in de activaties te dempen, als aanvulling op bestaande methodes zoals training met menselijke feedback.

Een tweede doel is interpretatie: als je een vermoeden hebt over wat een model ‘denkt’, kun je dat testen door de bijbehorende richting te versterken en te kijken of het gedrag verandert zoals voorspeld. Zo wordt activatiesturing ook een onderzoeksinstrument om de zwarte doos van neurale netwerken te doorgronden.

Ten derde is er een praktisch, economisch motief: stijl, toon of persoonlijkheid van een model aanpassen zonder de dure en tijdrovende weg van hertraining. Voor bedrijven die een model willen personaliseren is dit potentieel veel goedkoper.

Belangrijk is wel de andere kant van de medaille: dezelfde techniek waarmee je veiligheidsmaatregelen kunt versterken, kan in theorie ook gebruikt worden om ingebouwde weigeringen (‘ik kan dat niet doen’) te onderdrukken. Dit dubbele gebruik — ook wel dual use genoemd — maakt activatiesturing zowel een veelbelovend als een gevoelig onderzoeksterrein.

Voorbeelden uit de praktijk

Golden Gate Claude (Anthropic, mei 2024). Het bekendste publieke voorbeeld. Op basis van hun onderzoek ‘Scaling Monosemanticity’, waarin miljoenen interpreteerbare kenmerken in het taalmodel Claude 3 Sonnet werden blootgelegd met sparse autoencoders, versterkte Anthropic tijdelijk het kenmerk voor ‘de Golden Gate Bridge’ zo sterk dat de chatbot bijna elk antwoord terugbracht naar die brug — een speelse maar heldere demonstratie van hoe letterlijk sturing werkt.

Activation Addition / ActAdd (Turner e.a., 2023). Een van de eerste gepubliceerde technieken, getest op het oudere GPT-2-model, waarbij eenvoudige contrastvectoren (bijvoorbeeld ‘liefde’ tegenover ‘haat’) de toon van gegenereerde tekst zichtbaar verschoven, zonder enige training.

Representation Engineering (Center for AI Safety, Zou e.a., 2023). Dit onderzoek liet zien dat ook complexere eigenschappen als machtshonger, moraliteit en risicobereidheid als richtingen in de activatieruimte te herkennen en te manipuleren zijn, en positioneerde de aanpak als een ‘top-down’ alternatief voor interpretatie op neuronniveau.

Contrastive Activation Addition op Llama 2 (Rimsky e.a., 2023-2024). Met contrastparen van prompts werden sturingsvectoren afgeleid die sycofantie (overdreven instemming met de gebruiker) verminderden en de weigering van schadelijke verzoeken juist versterkten, getest op Meta’s open Llama 2-model.

Open-source gereedschap voor kleinere modellen. Onafhankelijke onderzoekers en de gemeenschap rond EleutherAI hebben laagdrempelige bibliotheken gepubliceerd waarmee ook buiten grote techbedrijven met steering-vectoren geëxperimenteerd kan worden op modellen als Mistral en Llama, wat het onderzoeksveld snel heeft verbreed.

Hoe ver is de techniek?

Activatiesturing is vooral nog een onderzoeksinstrument, geen standaardonderdeel van commerciële chatbots die je dagelijks gebruikt. Demo’s als Golden Gate Claude waren tijdelijk en bedoeld om de mogelijkheden te tonen, niet als permanente productiefunctie.

De techniek werkt het best bij concepten die zich redelijk ‘lineair’ en geïsoleerd gedragen. Bij vagere of sterk verweven eigenschappen — zoals subtiele vormen van manipulatie of context-afhankelijke moraliteit — is het veel moeilijker een schone, eenduidige richting te vinden.

Een terugkerend probleem is interferentie: het versterken van één concept kan onbedoeld andere vaardigheden aantasten, zoals rekenvaardigheid of coherentie, waardoor de balans tussen sturing en algemene kwaliteit lastig te bewaken is.

Sparse autoencoders, de preciezere methode, zijn rekenkundig zwaar om te trainen op grote modellen en lijden nog aan wat onderzoekers ‘feature splitting’ noemen: hetzelfde concept kan over meerdere, deels overlappende kenmerken verspreid raken, wat sturing minder voorspelbaar maakt.

Kortom: de resultaten uit laboratoria zijn indrukwekkend en het tempo van publicaties is hoog, maar een robuuste, op grote schaal ingezette veiligheidslaag op basis van activatiesturing bestaat nog niet. Het wordt vooral gebruikt naast bestaande methodes, ter aanvulling en als testinstrument.

Wie werken eraan?

Anthropic is momenteel de meest zichtbare drijvende kracht, met een eigen interpretatieteam dat regelmatig publiceert via het platform Transformer Circuits en dat de Golden Gate Claude-demonstratie ontwikkelde.

Center for AI Safety (CAIS), een Amerikaanse non-profitorganisatie, publiceerde met het Representation Engineering-onderzoek een van de invloedrijkste bredere kaders voor de techniek.

EleutherAI, een gedecentraliseerd, vrijwilligersgedreven onderzoekscollectief, draagt bij aan open-source gereedschap en experimenten, waardoor academici en hobbyisten zonder grote rekenbudgetten kunnen meedoen.

Ook academische groepen, onder meer aan Amerikaanse universiteiten die zich richten op interpretatie en modelbewerking van neurale netwerken, publiceren geregeld verwant werk, vaak in nauwe samenwerking met of als reactie op de industrieonderzoekers.

Verder circuleren veel losse experimenten en replicaties op onderzoeksforums gericht op AI-veiligheid en -uitlijning, waar onafhankelijke onderzoekers snel nieuwe toepassingen en tegenvoorbeelden delen. Geografisch is het onderzoek sterk geconcentreerd in de Verenigde Staten, met groeiende belangstelling vanuit Europese en Britse academische groepen die zich bezighouden met AI-transparantie.

Verder lezen