Kennisbank

Labelefficiëntie: hoe kunstmatige intelligentie leert met minder menselijke hulp

Bijgewerkt: 21 september 2026 · 7 min leestijd

Stel je voor dat je een kind duizenden foto's van katten moet laten zien, allemaal voorzien van het label 'kat', voordat het snapt wat een kat is. Zo werkte kunstmatige intelligentie lange tijd: een model kreeg pas een goed beeld van de wereld nadat mensen tienduizenden of miljoenen voorbeelden hadden voorzien van een label, zoals 'kat', 'hond' of 'verkeersbord'. Labelefficiëntie gaat over het omgekeerde: hoeveel van dat handmatige labelwerk kun je weglaten en toch een AI-systeem bouwen dat net zo goed, of bijna net zo goed, presteert?

Een model dat 'labelefficiënt' is, heeft dus relatief weinig gelabelde voorbeelden nodig om iets te leren. Dat klinkt technisch, maar de gevolgen zijn concreet: minder mensuren aan handmatig labelen, lagere kosten, en de mogelijkheid om AI te gebruiken in situaties waar simpelweg te weinig gelabelde data bestaat, bijvoorbeeld bij zeldzame ziektebeelden op medische scans. Labelefficiëntie is daarmee geen losstaande technologie, maar een verzameling technieken en een manier van denken die overal in de AI-ontwikkeling terugkomt.

Wat is het precies?

Om te begrijpen waarom labelefficiëntie belangrijk is, moet je eerst weten hoe traditionele machine learning werkt. Bij supervised learning (gesuperviseerd leren) toont men een algoritme een grote hoeveelheid voorbeelden waarbij steeds een 'label' hoort: een foto van een auto met het label 'auto', een zin met het sentiment 'positief' of 'negatief'. Het model zoekt patronen die de invoer koppelen aan het juiste label. Hoe meer gelabelde voorbeelden, hoe beter het model doorgaans wordt, maar het labelen zelf gebeurt meestal door mensen en is tijdrovend en duur.

Labelefficiëntie probeert dezelfde of vergelijkbare prestaties te bereiken met minder van dat handwerk. Dat gebeurt via verschillende technieken die vaak worden gecombineerd. Bij self-supervised learning (zelf-gesuperviseerd leren) laat men een model eerst 'oefenen' op enorme hoeveelheden ongelabelde data, bijvoorbeeld door delen van een zin of afbeelding te verbergen en het model te laten voorspellen wat daar hoort te staan. Zo bouwt het model algemene kennis op zonder dat er ook maar één menselijk label aan te pas komt. Pas daarna wordt het model met een klein beetje gelabelde data 'fijngeslepen' voor een specifieke taak, een stap die fine-tuning heet.

Een tweede aanpak is semi-supervised learning: een kleine gelabelde dataset wordt gecombineerd met een veel grotere hoeveelheid ongelabelde data, waarbij het model leert om structuur in de ongelabelde data te herkennen en die kennis te benutten. Bij active learning (actief leren) draait het om slimme selectie: in plaats van willekeurig data te labelen, kiest een algoritme zelf uit welke voorbeelden het meest waardevol zijn om te laten labelen, meestal de gevallen waarover het model het meest onzeker is. Zo bereik je met minder labels een grotere leerwinst.

Daarnaast bestaat few-shot learning, waarbij een model met slechts een handvol voorbeelden een nieuwe taak oppikt, en zelfs zero-shot learning, waarbij een model een taak uitvoert zonder ooit specifiek voorbeeld te hebben gezien, puur op basis van eerder opgedane algemene kennis en een goede instructie. Grote taalmodellen zoals de GPT-familie kunnen dit tot op zekere hoogte, doordat ze tijdens hun training al zoveel taalpatronen hebben gezien dat ze nieuwe, verwante taken kunnen afleiden. Tot slot helpt data-augmentatie: het kunstmatig vermenigvuldigen van een kleine gelabelde dataset door bijvoorbeeld afbeeldingen te spiegelen, draaien of van kleur te veranderen, zodat het model meer variatie ziet zonder dat er extra labels nodig zijn.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is praktisch: het labelen van data is duur en traag. Voor gespecialiseerde domeinen, zoals het beoordelen van medische scans, juridische documenten of zeldzame talen, zijn er vaak maar weinig experts beschikbaar die betrouwbaar kunnen labelen. Labelefficiëntie maakt het mogelijk om AI toe te passen in precies die domeinen waar grootschalig labelen onhaalbaar is.

Een tweede doelstelling is het verlagen van de drempel voor kleinere spelers. Grote techbedrijven kunnen enorme labelteams inzetten of data inkopen, maar universiteiten, start-ups en onderzoekers in minder welvarende landen vaak niet. Als modellen met minder gelabelde data goed kunnen presteren, wordt AI-ontwikkeling toegankelijker en minder afhankelijk van kapitaalkrachtige organisaties.

Ten derde speelt snelheid van innovatie mee: als een nieuw probleem zich aandient, bijvoorbeeld het detecteren van een nieuwe fraudevorm of een nieuw type gewasziekte, wil men niet maandenlang wachten tot er genoeg gelabelde voorbeelden zijn verzameld. Labelefficiënte technieken maken het mogelijk om sneller met beperkte data een werkend model te bouwen. Tot slot is er een ethisch en praktisch argument rond dataprivacy: hoe minder mensen ruwe, mogelijk gevoelige data hoeven te bekijken en te labelen, hoe kleiner het risico op datalekken of onnodige blootstelling van privacygevoelige informatie.

Voorbeelden uit de praktijk

Een van de invloedrijkste doorbraken was BERT, een taalmodel dat Google in 2018 publiceerde. BERT werd eerst getraind op enorme hoeveelheden ongelabelde tekst van het internet door woorden in zinnen te laten 'raden', en kon vervolgens met relatief weinig gelabelde voorbeelden worden afgestemd op specifieke taken zoals vraagbeantwoording of sentimentanalyse. Dit tweetrapsproces, eerst voorleren en dan fijnslijpen, werd de standaardaanpak voor tekstverwerkende AI.

In de beeldherkenning liet Google in 2020 SimCLR zien, een methode voor contrastive learning: het model leert door te bepalen of twee bewerkte versies van dezelfde afbeelding (bijvoorbeeld bijgesneden of van kleur veranderd) bij elkaar horen, zonder dat er ooit een label als 'hond' of 'kat' aan te pas komt. Modellen die op deze manier waren voorgetraind, hadden daarna veel minder gelabelde beelden nodig om goed te presteren op standaardtaken.

OpenAI's GPT-3, gepubliceerd in 2020, liet zien dat een voldoende groot taalmodel nieuwe taken kan uitvoeren op basis van slechts een paar voorbeelden in de prompt zelf, zonder dat het model opnieuw getraind hoeft te worden. Dit 'in-context leren' was een opvallende vorm van labelefficiëntie: in plaats van duizenden gelabelde trainingsvoorbeelden volstonden soms drie of vier voorbeelden in de tekst van de vraag. In 2021 volgde CLIP van OpenAI, dat leerde door miljoenen afbeeldingen te koppelen aan bijschriften die al op het internet bestonden, in plaats van aan handmatig toegekende labels, waardoor het model met weinig extra training nieuwe beeldcategorieën kon herkennen.

Ook in de medische beeldvorming wordt actief geëxperimenteerd met labelefficiënte methoden, omdat het labelen van röntgenfoto's, MRI-scans of pathologiebeelden radiologen of pathologen vereist, wier tijd schaars en kostbaar is. Onderzoeksgroepen aan onder meer Stanford hebben laten zien dat modellen die eerst zelf-gesuperviseerd zijn voorgetraind op grote, ongelabelde verzamelingen medische beelden, met een fractie van de gebruikelijke hoeveelheid geannoteerde scans al bruikbare diagnostische ondersteuning kunnen bieden. De precieze prestatiewinst verschilt sterk per studie en per aandoening, en dit soort systemen wordt in Nederland en daarbuiten nog vrijwel altijd als hulpmiddel naast, niet in plaats van, de arts ingezet.

Hoe ver is de techniek?

Op het gebied van tekst en taal is labelefficiëntie inmiddels gangbare praktijk: vrijwel alle moderne taalmodellen worden eerst zelf-gesuperviseerd voorgetraind en pas daarna met relatief kleine, gelabelde datasets afgestemd op specifieke toepassingen. Ook in de beeldherkenning is deze aanpak breed geaccepteerd en verder ontwikkeld sinds de introductie van methoden als SimCLR.

Toch is het probleem niet 'opgelost'. Modellen die volledig zonder gelabelde data leren, presteren over het algemeen nog altijd iets minder goed dan modellen die wel toegang hebben tot ruime hoeveelheden hoogwaardige, door mensen gecontroleerde labels, zeker bij taken die veel precisie vereisen, zoals medische diagnostiek of juridische classificatie. Een terugkerend obstakel is bovendien dat zelf-gegenereerde of automatisch verzamelde 'labels' (zoals bijschriften van het internet) ruis en vooroordelen kunnen bevatten, die het model dan onbedoeld overneemt.

Een ander knelpunt is evaluatie: het is lastig om objectief vast te stellen hoeveel labels een model 'echt' nodig heeft, omdat dit sterk verschilt per taak, per domein en per hoeveelheid ongelabelde data die beschikbaar is voor het voortraject. Onderzoekers zijn het er daarom niet altijd over eens hoe labelefficiëntie het best gemeten en vergeleken moet worden. Het tempo van vooruitgang is de afgelopen jaren wel hoog geweest, mede dankzij de opkomst van grote, algemene 'foundation models' die als basis dienen voor talloze specifieke toepassingen met weinig extra data.

Wie werken eraan?

Onderzoek naar labelefficiëntie wordt sterk gedreven door de grote Amerikaanse techbedrijven. Google (via Google Research en Google DeepMind) heeft met werk als BERT en SimCLR een grondlegende rol gespeeld. OpenAI heeft met GPT-3 en CLIP laten zien hoe ver few-shot- en zero-shot-technieken kunnen komen. Meta (het voormalige Facebook), via zijn onderzoeksafdeling FAIR, heeft eveneens veel gepubliceerd over zelf-gesuperviseerd leren, onder meer voor spraaktechnologie.

Op academisch vlak spelen Amerikaanse universiteiten als Stanford, met zijn Human-Centered AI Institute (Stanford HAI), en instituten als MIT en UC Berkeley een grote rol in fundamenteel onderzoek naar leertheorie en efficiënte trainingsmethoden. Ook in Europa en Azië lopen onderzoeksgroepen mee, bijvoorbeeld aan Duitse en Britse universiteiten en bij Chinese techbedrijven en academische instellingen, al blijft de Verenigde Staten voorlopig het zwaartepunt van de meest invloedrijke publicaties op dit gebied. In Nederland wordt op kleinere schaal onderzoek gedaan aan onder meer technische universiteiten, vaak gericht op toepassingen in medische beeldanalyse en taalverwerking voor het Nederlands, waar gelabelde data sowieso schaarser is dan voor het Engels.

Verder lezen