AI & computing › Generatieve AI & synthetische media
Chatsjabloon bepaalt of AI zegt 'ik voel' of 'ik ben maar een taalmodel'
Vraag een chatbot iets over zichzelf en hij antwoordt vaak met een disclaimer: "ik ben maar een taalmodel". Nieuw onderzoek laat zien dat dit antwoord niet voortkomt uit zelfkennis, maar uit de technische opmaak van het gesprek zelf.
Onderzoeker Jędrzej Maczan onderzocht acht populaire open-source large language models tot 9 miljard parameters. Hij ontdekte dat een simpel technisch detail bepaalt of een chatbot zichzelf wegrelativeert of juist menselijk klinkt. Dat detail heet het chatsjabloon: de opmaak die een los gesprek verandert in een herkenbare vraag-en-antwoordstructuur voor het model.
Twee stemmen, één schakelaar
Met chatsjabloon aan grijpen modellen vaker naar zinnen als "als taalmodel heb ik geen gevoelens". Zet je het sjabloon uit en laat je het model los tekst aanvullen, dan verschuift de toon. Het model gebruikt dan vaker ervaringsgerichte taal, zoals "ik voel" of "ik denk". Dezelfde onderliggende gewichten, hetzelfde model, maar een compleet ander zelfbeeld — puur afhankelijk van de verpakking van het gesprek.
Een schakelaar in de activaties
Om te snappen waar dit vandaan komt, dook Maczan in de interne activaties van drie modellen. Daar vond hij een specifieke richting die het gedrag stuurt. Met interpreteerbaarheid-technieken kon hij deze richting isoleren en vervolgens kunstmatig aan- of uitzetten, een methode die bekendstaat als activatiesturing. Verwijderde hij de richting, dan verdween de disclaimer-toon, ook als het chatsjabloon aanwezig was. Voegde hij de richting juist toe aan een model zonder sjabloon, dan begon het alsnog te disclaimen alsof het sjabloon er wél was. Een willekeurige richting van dezelfde grootte had nauwelijks effect, wat aantoont dat het niet om ruis gaat maar om een specifiek, betekenisvol patroon in het model.
Wat betekent dit voor AI-onderzoek?
De bevinding raakt een gevoelige discussie binnen AI-veiligheidsonderzoek: gebruiken wetenschappers uitspraken van chatbots over zichzelf als bewijs voor introspectie of zelfbewustzijn? Maczan waarschuwt dat onderzoekers die zelfrapportages van modellen bestuderen, mogelijk een verstoppende factor over het hoofd zien. Wat een model over zichzelf zegt, is dus niet automatisch een feit over dat model. Het is deels een artefact van hoe het gesprek is opgemaakt. Voor iedereen die AI-antwoorden serieus neemt als venster op wat een model 'weet' of 'voelt', is dat een belangrijke waarschuwing: neem zulke uitspraken niet letterlijk zonder eerst te controleren voor het chatsjabloon.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze studie laat zien dat de manier waarop we met AI praten, direct bepaalt wat AI over zichzelf beweert. Dat is belangrijk nu steeds meer discussies gaan over AI-bewustzijn en -rechten: uitspraken van chatbots zijn kwetsbaar voor technische bijeffecten en zeggen dus minder over het model zelf dan vaak wordt aangenomen. Onderzoekers zullen dit soort confounds voortaan moeten uitsluiten voordat ze conclusies trekken over AI-introspectie.
- Chatsjabloon
- De technische opmaak die losse tekst omzet in een herkenbare gesprekÂsstructuur met rollen zoals 'gebruiker' en 'assistent', gebruikt om instructiemodellen te laten functioneren als chatbot.
- Activatiesturing
- Een techniek waarbij onderzoekers een specifieke richting in de interne activaties van een AI-model opsporen en die vervolgens toevoegen of verwijderen om gedrag te sturen.
- Instructiemodel
- Een taalmodel dat extra is getraind om instructies en vragen in gesprekvorm te beantwoorden, in tegenstelling tot een basismodel dat alleen tekst aanvult.
- Interpreteerbaarheid
- Het onderzoeksveld dat probeert te achterhalen hoe en waarom een AI-model tot een bepaalde uitkomst komt, vaak door te kijken in de interne activaties.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.