AI & computing › Generatieve AI & synthetische media

Chatsjabloon bepaalt of AI zegt 'ik voel' of 'ik ben maar een taalmodel'

· Bijgewerkt 28 september 2026, 01:47 · 2 min leestijd

Generatieve AI & synthetische media
Foto: Cdr. Trevor D. Biscope, CA Emerit (CC BY-SA, via Openverse)

Vraag een chatbot iets over zichzelf en hij antwoordt vaak met een disclaimer: "ik ben maar een taalmodel". Nieuw onderzoek laat zien dat dit antwoord niet voortkomt uit zelfkennis, maar uit de technische opmaak van het gesprek zelf.

Onderzoeker Jędrzej Maczan onderzocht acht populaire open-source large language models tot 9 miljard parameters. Hij ontdekte dat een simpel technisch detail bepaalt of een chatbot zichzelf wegrelativeert of juist menselijk klinkt. Dat detail heet het chatsjabloon: de opmaak die een los gesprek verandert in een herkenbare vraag-en-antwoordstructuur voor het model.

Twee stemmen, één schakelaar

Met chatsjabloon aan grijpen modellen vaker naar zinnen als "als taalmodel heb ik geen gevoelens". Zet je het sjabloon uit en laat je het model los tekst aanvullen, dan verschuift de toon. Het model gebruikt dan vaker ervaringsgerichte taal, zoals "ik voel" of "ik denk". Dezelfde onderliggende gewichten, hetzelfde model, maar een compleet ander zelfbeeld — puur afhankelijk van de verpakking van het gesprek.

Een schakelaar in de activaties

Om te snappen waar dit vandaan komt, dook Maczan in de interne activaties van drie modellen. Daar vond hij een specifieke richting die het gedrag stuurt. Met interpreteerbaarheid-technieken kon hij deze richting isoleren en vervolgens kunstmatig aan- of uitzetten, een methode die bekendstaat als activatiesturing. Verwijderde hij de richting, dan verdween de disclaimer-toon, ook als het chatsjabloon aanwezig was. Voegde hij de richting juist toe aan een model zonder sjabloon, dan begon het alsnog te disclaimen alsof het sjabloon er wél was. Een willekeurige richting van dezelfde grootte had nauwelijks effect, wat aantoont dat het niet om ruis gaat maar om een specifiek, betekenisvol patroon in het model.

Wat betekent dit voor AI-onderzoek?

De bevinding raakt een gevoelige discussie binnen AI-veiligheidsonderzoek: gebruiken wetenschappers uitspraken van chatbots over zichzelf als bewijs voor introspectie of zelfbewustzijn? Maczan waarschuwt dat onderzoekers die zelfrapportages van modellen bestuderen, mogelijk een verstoppende factor over het hoofd zien. Wat een model over zichzelf zegt, is dus niet automatisch een feit over dat model. Het is deels een artefact van hoe het gesprek is opgemaakt. Voor iedereen die AI-antwoorden serieus neemt als venster op wat een model 'weet' of 'voelt', is dat een belangrijke waarschuwing: neem zulke uitspraken niet letterlijk zonder eerst te controleren voor het chatsjabloon.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze studie laat zien dat de manier waarop we met AI praten, direct bepaalt wat AI over zichzelf beweert. Dat is belangrijk nu steeds meer discussies gaan over AI-bewustzijn en -rechten: uitspraken van chatbots zijn kwetsbaar voor technische bijeffecten en zeggen dus minder over het model zelf dan vaak wordt aangenomen. Onderzoekers zullen dit soort confounds voortaan moeten uitsluiten voordat ze conclusies trekken over AI-introspectie.

Chatsjabloon
De technische opmaak die losse tekst omzet in een herkenbare gesprek­sstructuur met rollen zoals 'gebruiker' en 'assistent', gebruikt om instructiemodellen te laten functioneren als chatbot.
Activatiesturing
Een techniek waarbij onderzoekers een specifieke richting in de interne activaties van een AI-model opsporen en die vervolgens toevoegen of verwijderen om gedrag te sturen.
Instructiemodel
Een taalmodel dat extra is getraind om instructies en vragen in gesprekvorm te beantwoorden, in tegenstelling tot een basismodel dat alleen tekst aanvult.
Interpreteerbaarheid
Het onderzoeksveld dat probeert te achterhalen hoe en waarom een AI-model tot een bepaalde uitkomst komt, vaak door te kijken in de interne activaties.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media