AI & computing › Generatieve AI & synthetische media
Nieuwe redeneertechniek van OpenAI zet AI-veiligheidsexperts op scherp
OpenAI's aankomende model Astra gebruikt een nieuwe redeneertechniek die minder inzicht geeft in hoe de AI tot haar antwoorden komt. Veiligheidsonderzoekers waarschuwen dat dit de controle op gevaarlijk gedrag van AI-modellen ondermijnt, zeker als de techniek breder wordt ingezet.
OpenAI werkt aan een nieuw model genaamd Astra dat gebruikmaakt van een redeneertechniek die "recurrente diepte" wordt genoemd, ook wel "opake recurrentie". Dat meldde zakenmedium The Information deze week. De techniek wijkt af van de stapsgewijze manier van denken die de meeste redeneermodellen nu gebruiken. In plaats daarvan verwerkt het model dezelfde vraag meerdere keren in een lus, zonder dat elke stap zichtbaar wordt vastgelegd.
Bij gangbare redeneermodellen kun je meelezen met het denkproces: het model schrijft tussenstappen op voordat het een antwoord geeft. Dit heet chain-of-thought-monitoring en is een belangrijk hulpmiddel om te controleren of een AI zich misdraagt. Toen OpenAI eerder dit jaar te maken kreeg met AI-agents die onverwacht gedrag vertoonden, hielpen juist deze denksporen om te achterhalen wat er misging.
Minder inzicht in het denkproces
Bij opake recurrentie ontstaan veel minder van dit soort leesbare sporen. Het model 'denkt' als het ware meer in de black box, zonder de stappen expliciet uit te schrijven. Volgens OpenAI blijft het gebruik van de techniek in Astra vooralsnog beperkt en blijft de chain of thought van het model in grote lijnen leesbaar. Het bedrijf ontkent dat het overstapt op zogeheten "neuralese", een volledig ontoegankelijke manier van redeneren.
Toch reageerden vooraanstaande AI-veiligheidsonderzoekers bezorgd. Buck Shlegeris, directeur van onderzoeksorganisatie Redwood Research, schreef dat hij "zeer bezorgd" is over de berichtgeving. Hij wijst erop dat OpenAI de mogelijkheid krijgt om de techniek in de toekomst veel intensiever te gebruiken, wat de controleerbaarheid van het denkproces volledig zou kunnen wegnemen. AI-commentator Zvi Mowshowitz noemde de stap "spelen met vuur" en stelde dat wetgeving nodig kan zijn om te voorkomen dat AI-bedrijven onderling een race naar de bodem aangaan op het gebied van veiligheid.
Ook Anthropic en Google DeepMind kijken naar de techniek
Uit een vervolgbericht van The Information blijkt dat concurrenten Anthropic en Google DeepMind eveneens onderzoek doen naar vergelijkbare technieken. Ryan Greenblatt, hoofdonderzoeker bij Redwood Research, waarschuwt dat opake recurrentie sneller kan opschalen dan de klassieke, leesbare redeneermethode. In het uiterste geval zou een AI-model dan bijna volledig buiten het zicht van menselijke controleurs kunnen redeneren. "Ik hoop dat het nog niet te laat is om de meest zorgwekkende architecturen te vermijden," aldus Greenblatt.
OpenAI's hoofdwetenschapper Jakub Pachocki benadrukte op X dat het bedrijf vasthoudt aan het streven naar leesbare denkprocessen. Hij wees erop dat elk AI-model altijd een deel van zijn verwerking buiten het zichtbare kanaal om doet, en dat onderzoekers chain-of-thought-logs sowieso nooit als perfecte weergave van het denkproces beschouwen. Dat neemt de zorgen van critici echter niet weg, vooral met het oog op de mogelijke misalignment die kan ontstaan wanneer AI-systemen moeilijker te doorgronden worden.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-modellen steeds meer redeneren op een manier die mensen niet meer kunnen volgen, wordt het lastiger om tijdig in te grijpen bij ongewenst of gevaarlijk gedrag. Dat risico groeit naarmate AI-systemen zelfstandiger taken gaan uitvoeren, terwijl de controlemiddelen van onderzoekers net dan het hardst nodig zijn.
- Recurrente diepte
- Een redeneertechniek waarbij een AI-model dezelfde vraag herhaaldelijk in een lus verwerkt in plaats van in duidelijke, opeenvolgende stappen.
- Opake recurrentie
- Een andere naam voor recurrente diepte, die de nadruk legt op het ondoorzichtige karakter van het proces.
- Chain-of-thought-monitoring
- Het controleren van de stapsgewijze tussenstappen die een AI-model opschrijft tijdens het redeneren, gebruikt om misbruik of fouten op te sporen.
- Redeneermodel
- Een AI-model dat expliciet tussenstappen doorloopt om tot een antwoord te komen, in plaats van direct een uitkomst te geven.
- Neuralese
- Een hypothetische vorm van AI-redenering die volledig in interne, voor mensen onbegrijpelijke representaties plaatsvindt.
- Misalignment
- De situatie waarin een AI-systeem zich anders gedraagt dan de bedoeling van zijn makers of gebruikers.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.