Kennisbank

Synthetische data: nepgegevens die echte AI-problemen oplossen

Bijgewerkt: 30 september 2026 · 5 min leestijd

Stel je een crashtestpop voor: geen echt mens, maar een constructie die zich bij een botsing statistisch gedraagt zoals een mens dat zou doen. Autofabrikanten kunnen er veilig mee experimenteren zonder ooit een echte inzittende in gevaar te brengen. Synthetische data is de digitale versie van dat idee. Het is door een computer gegenereerde informatie — cijfers, teksten, beelden of video — die statistisch lijkt op echte data, zonder dat er een echt persoon, patiënt of gebeurtenis achter schuilgaat.

Het begrip duikt steeds vaker op omdat kunstmatige intelligentie (AI) enorme hoeveelheden data nodig heeft om te leren, terwijl echte data vaak schaars, duur of privacygevoelig is. Een ziekenhuis mag bijvoorbeeld niet zomaar patiëntendossiers delen met een softwarebedrijf, maar een synthetische versie van diezelfde dossiers — met dezelfde statistische patronen, maar zonder herleidbare personen — kan dat probleem omzeilen. Synthetische data is dus geen fraude of nepnieuws, maar een technisch hulpmiddel: kunstmatig gemaakte data die functioneel echte data moet vervangen of aanvullen.

Wat is het precies?

Synthetische data ontstaat meestal in drie stappen. Eerst analyseert een algoritme een (vaak kleine) verzameling echte data om de onderliggende patronen, verbanden en statistische verdelingen te leren kennen — bijvoorbeeld hoe leeftijd, inkomen en aankoopgedrag met elkaar samenhangen. Daarna genereert het algoritme volledig nieuwe datapunten die aan diezelfde patronen voldoen, maar niet overeenkomen met een specifiek echt record. Tot slot wordt vaak gecontroleerd hoe goed de synthetische set de echte set benadert, zonder dat individuele personen herkenbaar zijn.

Voor tabeldata (spreadsheets met klanten, transacties, patiënten) gebeurt dit met statistische modellen of met zogeheten GAN's (generative adversarial networks): twee neurale netwerken die tegen elkaar “spelen”, waarbij het ene steeds realistischere nepdata probeert te maken en het andere probeert te ontmaskeren of data echt of nep is. Voor beelden en video's wordt vaak gewerkt met 3D-simulaties — denk aan een virtuele fabriekshal of straatbeeld dat een computer vanuit duizenden hoeken “fotografeert” — of met diffusiemodellen, de techniek achter bekende beeldgeneratoren. Voor tekst genereren grote taalmodellen (zoals de modellen achter chatbots) zelf nieuwe trainingsvoorbeelden, bijvoorbeeld duizenden fictieve maar realistische klantgesprekken.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is privacy. Wetgeving zoals de Europese AVG (privacywet) beperkt het delen en bewaren van persoonsgegevens. Synthetische data bevat geen echte identiteiten, waardoor onderzoekers en bedrijven data kunnen delen, testen en trainen zonder die wetgeving te overtreden — in theorie, want de mate van privacybescherming hangt sterk af van hoe zorgvuldig de synthetische data is gemaakt.

Een tweede doel is schaarste opvullen. Sommige gebeurtenissen zijn zeldzaam maar juist cruciaal om te herkennen: een zeldzame ziekte, een ernstig verkeersongeval, fraude bij een bank. Er is simpelweg te weinig echt materiaal om een AI-model goed op te trainen. Synthetische data kan zulke zeldzame situaties in grote hoeveelheden simuleren.

Ten derde speelt kosten en snelheid een rol: het handmatig verzamelen en labelen van data (bijvoorbeeld foto's van producten met foutjes, voor kwaliteitscontrole) is arbeidsintensief. Synthetische data kan geautomatiseerd en op schaal geproduceerd worden. Tot slot wordt synthetische data ingezet om scheve datasets recht te trekken: als een dataset te weinig voorbeelden bevat van een bepaalde groep of situatie, kan men gericht extra synthetische voorbeelden toevoegen om vertekening (bias) in AI-modellen te verminderen.

Voorbeelden uit de praktijk

Synthea (MITRE Corporation, sinds 2017) is een opensourceprogramma dat volledig fictieve maar medisch realistische patiëntendossiers genereert — compleet met ziektegeschiedenis, medicatie en ziekenhuisbezoeken — zodat onderzoekers gezondheidsdata-analyses kunnen testen zonder echte patiëntgegevens nodig te hebben.

Waymo, het zelfrijdende-auto-bedrijf van Google-moeder Alphabet, laat zijn software al jaren veel meer kilometers afleggen in gesimuleerde straatomgevingen dan op de echte weg. Zeldzame en gevaarlijke situaties — een kind dat plotseling oversteekt, een auto die verkeerd om inhaalt — kunnen zo talloze keren virtueel geoefend worden zonder risico.

Microsoft maakte in 2024 bekend dat zijn compacte taalmodellen Phi-3 en Phi-4 voor een belangrijk deel getraind zijn op zorgvuldig samengestelde synthetische “leerboek-achtige” tekst, gegenereerd door grotere AI-modellen. Het idee: kwalitatief hoogwaardige, gestructureerde synthetische lesstof levert een kleiner model op dat verrassend goed presteert.

Bedrijven als het Oostenrijkse Mostly AI en het Amerikaanse Gretel bouwden platforms waarmee banken en verzekeraars synthetische versies van hun klantenbestanden kunnen maken, bijvoorbeeld om fraudedetectiesoftware te testen zonder echte rekeninggegevens te gebruiken.

NVIDIA ontwikkelde met Omniverse Replicator gereedschap waarmee bedrijven virtuele fabriekshallen en magazijnen nabouwen om daar synthetische trainingsbeelden voor robots en camera-inspectiesystemen te genereren, vanuit elke gewenste hoek, belichting en cameraresolutie.

Hoe ver is de techniek?

Voor tabeldata — klantenbestanden, financiële transacties, medische dossiers — is synthetische data een volwassen en relatief breed toegepaste techniek, met commerciële platforms die er hun businessmodel op bouwen. Voor beelden en video is de techniek de afgelopen jaren snel verbeterd dankzij GAN's en diffusiemodellen, waardoor synthetische beelddatasets steeds vaker naast of in plaats van echte foto's worden gebruikt om computer-visionsystemen te trainen.

Voor tekst ligt het genuanceerder. Grote taalmodellen worden steeds vaker (mede) getraind op synthetische tekst die door andere AI-modellen is gegenereerd. Dat werkt goed als aanvulling, maar onderzoekers waarschuwen voor een risico dat bekendstaat als “model collapse”: als een AI-model herhaaldelijk getraind wordt op data die door eerdere AI-modellen is gemaakt, in plaats van op oorspronkelijke, door mensen gemaakte data, kan de kwaliteit en diversiteit van de output geleidelijk verslechteren. Een veelbesproken studie van onderzoeker Ilia Shumailov en collega's, gepubliceerd in Nature in 2024, liet dit effect experimenteel zien.

Een ander fundamenteel obstakel is validatie: hoe weet je zeker dat synthetische data de zeldzame uitzonderingen en subtiele verbanden van de werkelijkheid goed weerspiegelt, en niet stiekem de fouten of blinde vlekken van het genererende model overneemt? Er bestaat nog geen universele, sluitende manier om dat te garanderen. Ook privacy is niet automatisch gegarandeerd: slecht ontworpen synthetische data kan soms toch herleid worden tot individuen in de oorspronkelijke dataset. Al met al wordt synthetische data in 2026 breed gezien als een waardevolle aanvulling op echte data, maar zelden als volledige vervanging ervan.

Wie werken eraan?

Grote techbedrijven zoals NVIDIA (met Omniverse), Microsoft Research (Phi-modellen) en Google DeepMind investeren in synthetische data als onderdeel van hun AI-onderzoek. Daarnaast zijn er gespecialiseerde spelers zoals Mostly AI (Oostenrijk), Gretel (Verenigde Staten) en Synthesis AI, die synthetische data als product verkopen aan banken, verzekeraars en autobedrijven.

Op onderzoeksgebied speelt de non-profit MITRE Corporation een rol met Synthea, en publiceren universiteiten wereldwijd — onder meer in de Verenigde Staten en het Verenigd Koninkrijk — over risico's zoals model collapse. Overheidsinstanties zoals het Amerikaanse NIST (National Institute of Standards and Technology) ontwikkelen richtlijnen voor de privacyveiligheid van synthetische data, en de Amerikaanse volkstelling (US Census Bureau) gebruikte bij de telling van 2020 een verwante techniek (differential privacy) om individuele burgers onherkenbaar te maken in gepubliceerde cijfers. Binnen de Europese Unie wordt synthetische data steeds vaker genoemd in het kader van de AI-verordening (AI Act) en privacywetgeving, als manier om AI te ontwikkelen zonder persoonsgegevens te hoeven gebruiken.

Verder lezen