Kennisbank

Zelfgesuperviseerd leren: hoe AI leert zonder gelabelde data

Bijgewerkt: 3 oktober 2026 · 5 min leestijd

Zelfgesuperviseerd leren is een manier om computermodellen te trainen zonder dat mensen vooraf elk stukje data van een label moeten voorzien. In plaats daarvan haalt het model zijn eigen oefenvragen en "juiste antwoorden" uit de data zelf. Een goede analogie is een taalcursist die een zin leest waarin één woord is weggelaten en zelf moet raden welk woord daar logisch past; de rest van de zin levert de aanwijzingen, en de oorspronkelijke tekst is meteen de antwoordsleutel.

Deze aanpak ligt aan de basis van veel grote AI-systemen van de afgelopen jaren, van taalmodellen als ChatGPT tot beeld- en spraaksystemen. Omdat er geen mens meer nodig is om miljoenen voorbeelden handmatig te labelen, kunnen modellen trainen op enorme hoeveelheden tekst, beeld, audio en video die al vrij beschikbaar zijn. Dat maakt zelfgesuperviseerd leren een van de belangrijkste technische ontwikkelingen die de huidige AI-golf mogelijk hebben gemaakt.

Wat is het precies?

Om zelfgesuperviseerd leren te begrijpen, helpt het om twee oudere benaderingen te kennen. Bij supervised learning (gesuperviseerd leren) krijgt een model data mét labels: duizenden foto's van katten en honden die een mens vooraf heeft gemarkeerd als "kat" of "hond". Bij unsupervised learning (ongesuperviseerd leren) krijgt het model data zonder enig label en moet het zelf patronen of groepen ontdekken, zonder dat er een concreet "juist antwoord" bestaat.

Zelfgesuperviseerd leren zit daar tussenin. Er zijn geen door mensen aangebrachte labels, maar het model construeert wél een concrete oefentaak uit de data zelf, een zogeheten pretext task (een kunstmatige deeltaak die als tussenstap dient). Een bekend voorbeeld is het verbergen van een woord in een zin: het model moet het ontbrekende woord voorspellen, en de tekst zelf levert het juiste antwoord. Bij beelden kan dit betekenen dat een deel van een foto wordt afgeschermd en het model moet raden wat daar stond.

Een andere veelgebruikte variant is contrastief leren: het model krijgt twee licht aangepaste versies van dezelfde foto (bijvoorbeeld bijgesneden of qua kleur aangepast) en leert dat die twee versies "bij elkaar horen", terwijl een foto van iets anders dat niet doet. Zo leert het systeem welke kenmerken van een beeld er echt toe doen, zonder dat iemand ooit heeft gezegd wat er op de foto staat. De term "zelf"-gesuperviseerd verwijst precies naar dit mechanisme: het model genereert zijn eigen trainingssignaal uit de ruwe data, in plaats van dat een mens dat signaal aanlevert.

Wat wil men ermee bereiken?

Het handmatig labelen van data is traag, duur en foutgevoelig. Voor sommige toepassingen, zoals medische beeldherkenning, zijn bovendien gespecialiseerde experts nodig om data te labelen, wat de kosten verder opdrijft. Zelfgesuperviseerd leren omzeilt dit knelpunt: tekst van het internet, video's, audio-opnames en ongesorteerde foto's kunnen direct als trainingsmateriaal dienen.

Een tweede doel is het leren van algemene representaties: interne wiskundige beschrijvingen van data die niet aan één specifieke taak gebonden zijn. Een model dat via zelfgesuperviseerd leren heeft geleerd hoe taal, beeld of geluid in elkaar steekt, kan die kennis vaak met relatief weinig extra training ("fine-tuning") inzetten voor heel verschillende vervolgtaken, van vertalen tot het herkennen van tumoren op scans.

Ten slotte speelt schaalbaarheid een grote rol. Omdat de hoeveelheid ongelabelde data op internet en in de praktijk vele malen groter is dan de hoeveelheid zorgvuldig gelabelde data, kunnen onderzoekers met zelfgesuperviseerde methodes modellen trainen op een schaal die met traditionele, door mensen gelabelde datasets ondenkbaar zou zijn.

Voorbeelden uit de praktijk

BERT (Google, 2018) was een van de eerste grote taalmodellen die op grote schaal gebruikmaakte van gemaskeerde taalmodellering: woorden in zinnen werden verborgen en het model moest ze voorspellen op basis van de omliggende context. Dit idee ligt ook aan de basis van de GPT-reeks van OpenAI (vanaf 2018), waarbij het model steeds het volgende woord in een tekst voorspelt; dat simpele principe, toegepast op enorme hoeveelheden teksten, bleek de basis voor de huidige generatie chatbots.

SimCLR (Google Research, 2020) liet zien dat contrastief leren ook voor beeldherkenning goed werkt: door twee bewerkte versies van dezelfde afbeelding te vergelijken, leerde het model nuttige visuele kenmerken zonder enig label. In diezelfde periode presenteerde Meta AI (destijds Facebook AI Research) wav2vec 2.0 (2020), dat spraakherkenning verbeterde door modellen te trainen op grote hoeveelheden ongelabelde audio.

Meta AI bracht later DINO (2021) en I-JEPA (2023) uit, twee methodes die beeldrepresentaties leren zonder labels en zonder de rekenintensieve contrastieve aanpak van eerdere methodes; I-JEPA laat het model in plaats daarvan abstracte voorspellingen doen over ontbrekende delen van een beeld. OpenAI's CLIP (2021) combineerde tekst en beeld: door miljoenen foto's met bijbehorende onderschriften van internet te gebruiken, leerde het model beeld en taal aan elkaar te koppelen zonder dat iemand de foto's handmatig had geclassificeerd.

Hoe ver is de techniek?

Zelfgesuperviseerd leren is inmiddels geen experimentele nichetechniek meer, maar de standaardbasis onder vrijwel alle grote taalmodellen en een groot deel van de moderne beeld- en spraaksystemen. De vooruitgang van de afgelopen jaren, van BERT tot de huidige grote taalmodellen, is grotendeels te danken aan het combineren van deze trainingsmethode met steeds grotere datasets en rekenkracht.

Toch zijn er serieuze open vragen. Critici wijzen erop dat modellen die louter leren het volgende woord of de volgende patch te voorspellen, daarmee nog niet bewijzen dat ze de wereld werkelijk "begrijpen" in de zin van causaal redeneren of plannen. Meta-onderzoeker Yann LeCun heeft herhaaldelijk betoogd dat pure voorspelling op tekst- of pixelniveau onvoldoende is en pleit voor zogeheten world models (wereldmodellen): systemen die abstractere, voorspelbare representaties van de werkelijkheid leren in plaats van elk pixel of woord te reconstrueren. Dit debat is nog niet beslecht.

Daarnaast blijven praktische obstakels bestaan. Het trainen van deze modellen vergt enorme rekenkracht en energie, met bijbehorende kosten en milieu-impact. Omdat de trainingsdata ongefilterd uit de echte wereld komt, nemen modellen ook makkelijk vooroordelen (bias) en feitelijke fouten over die in die data besloten liggen, zonder dat een mens dat vooraf heeft gecontroleerd zoals bij handmatig gelabelde datasets soms wel gebeurt.

Wie werken eraan?

Meta AI (FAIR) is onder leiding van onder anderen Yann LeCun een van de meest prominente onderzoeksgroepen op dit terrein, met werk als wav2vec, DINO en I-JEPA. Google en Google DeepMind hebben met BERT en SimCLR eveneens baanbrekend werk geleverd, terwijl OpenAI de GPT-reeks en CLIP ontwikkelde.

Daarnaast draagt academisch onderzoek substantieel bij, met groepes aan onder meer Stanford University en New York University (NYU, waar LeCun ook hoogleraar is) die fundamenteel onderzoek doen naar representatieleren. Het onderzoeksveld is internationaal: naast de grote Amerikaanse techbedrijven en universiteiten leveren ook Europese instituten (zoals in Frankrijk en Duitsland) en Aziatische onderzoeksgroepen (onder meer in China en Zuid-Korea) relevante publicaties op conferenties als NeurIPS en ICML.

Verder lezen