Distributionele dekking: weet een AI-systeem wel genoeg van de wereld?
Stel je een rij-examinator voor die een kandidaat alleen laat oefenen op een lege parkeerplaats op een zonnige dag. De kandidaat slaagt glansrijk. Maar wat gebeurt er de eerste keer dat hij in de regen over een drukke rotonde moet, of een fietser plotseling oversteekt? De examinator heeft de kandidaat niet voorbereid op situaties die hij nooit heeft geoefend. Dit is in de kern waar distributionele dekking over gaat, maar dan voor kunstmatige intelligentie: in hoeverre dekken de voorbeelden waarmee een AI-systeem is getraind en getest, alle situaties die het systeem in de echte wereld kan tegenkomen?
Het woord 'distributie' verwijst hier naar een kansverdeling: een wiskundige beschrijving van welke situaties vaak voorkomen en welke zeldzaam zijn. Een zelfrijdende auto die getraind is op data uit Californische steden heeft een trainingsdistributie die bestaat uit zonnig weer, brede wegen en Amerikaanse verkeersborden. Zet diezelfde auto in een Nederlandse regenachtige binnenstad vol fietsers, en hij opereert plotseling buiten de situaties die hij kent. Onderzoekers noemen dit een distributional shift (verschuiving van de verdeling) en de ontbrekende situaties een coverage gap, een dekkingsgat. Hoe groter en onvoorspelbaarder die gaten, hoe groter de kans op gevaarlijke fouten.
Wat is het precies?
Om distributionele dekking te begrijpen, helpt het de stappen te volgen die onderzoekers doorlopen bij het bouwen en testen van een AI-systeem.
Eerst wordt het volledige operationele domein bepaald: alle situaties waarin het systeem ooit moet functioneren. Voor een zelfrijdende auto is dat elke denkbare combinatie van weer, verkeer, wegtype en onverwachte gebeurtenissen. Voor een taalmodel als ChatGPT is dat elke mogelijke vraag die een gebruiker kan stellen, inclusief kwaadaardige pogingen om het systeem te misleiden.
Vervolgens wordt data verzameld of gegenereerd: via camera's op echte auto's, via simulaties, of via tekst van het internet. Dit is per definitie een steekproef, nooit het complete domein. Daarna proberen onderzoekers de gaten in die steekproef op te sporen: welke soorten situaties zijn ondervertegenwoordigd of ontbreken helemaal? Dit gebeurt met technieken als clusteranalyse (groepeer vergelijkbare situaties en kijk welke groepen klein zijn) en out-of-distribution detectie: algoritmes die signaleren wanneer een nieuwe invoer sterk afwijkt van alles wat het systeem eerder zag.
Als gaten zijn gevonden, proberen teams die gericht te vullen: extra data verzamelen van zeldzame situaties, kunstmatige variaties toevoegen aan bestaande data (data-augmentatie), of extra scenario's simuleren. Tot slot wordt het systeem getest op voorbeelden die het nooit heeft gezien tijdens training, om in te schatten hoe het presteert buiten de geoefende situaties. Ook na lancering blijft dit proces doorlopen: door monitoring in de praktijk kunnen nieuwe, onvoorziene situaties ('unknown unknowns') alsnog aan het licht komen.
Een belangrijk inzicht uit de wiskundige kant van dit vakgebied, met name uit offline reinforcement learning (een manier van machine learning waarbij een systeem leert van vastgelegde data in plaats van door zelf te experimenteren), is dat dekking niet alleen gaat om 'hoeveel data', maar om hoe representatief die data is voor wat het systeem later moet doen. Een dataset kan miljoenen voorbeelden bevatten en toch slecht dekkend zijn, als die voorbeelden allemaal lijken op elkaar.
Wat wil men ermee bereiken?
Het hoofddoel is simpel te formuleren maar lastig te realiseren: voorkomen dat een AI-systeem faalt zodra het een situatie tegenkomt die niet in de trainingsdata zat. Bij veiligheidskritische toepassingen, zoals zelfrijdende auto's, medische diagnosesystemen of luchtvaartsoftware, kan zo'n fout levens kosten. Goede distributionele dekking moet dat risico vooraf zichtbaar en beheersbaar maken, in plaats van pas na een ongeluk te ontdekken dat een scenario simpelweg nooit was getest.
Een tweede doel is het bouwen van vertrouwen en het leveren van bewijs richting toezichthouders. Regelgevers willen steeds vaker aantoonbaar bewijs zien dat een systeem is getest op een breed en representatief palet aan situaties, niet alleen op de gevallen die toevallig beschikbaar waren. Dit speelt een rol bij de goedkeuring van zelfrijdende voertuigen en bij regelgeving zoals de Europese AI-verordening, die van hoogrisicosystemen eist dat trainingsdata voldoende representatief is voor de beoogde toepassing.
Daarnaast heeft het veld een theoretisch doel: wiskundige garanties geven. Onderzoekers willen kunnen bewijzen dat een algoritme onder bepaalde dekkingsvoorwaarden gegarandeerd goed presteert, in plaats van alleen empirisch te hopen dat het wel goed zal gaan. Dat maakt distributionele dekking ook een actief onderzoeksthema binnen de statistische en wiskundige fundamenten van machine learning, niet alleen een praktisch ingenieursprobleem.
Voorbeelden uit de praktijk
Bij Waymo, het zelfrijdende-autobedrijf van Alphabet, draait al sinds het midden van de jaren 2010 een grootschalig simulatieplatform waarmee miljarden kilometers aan virtuele ritten worden gereden, aanvullend op de fysieke testkilometers op de weg. Het doel is expliciet om zeldzame en gevaarlijke situaties, zoals een voetganger die plots oversteekt achter een geparkeerde vrachtwagen, vaker en veiliger te kunnen testen dan in de echte wereld mogelijk zou zijn, en zo gaten in de dekking van hun wagenpark op te sporen.
In Duitsland liep van 2016 tot 2019 het door de overheid gefinancierde PEGASUS-project, met deelname van onder meer Audi, BMW, Daimler, Bosch en VW. Het project ontwikkelde een methode om verkeersscenario's systematisch te catalogiseren en zo de dekking van testprogramma's voor automatisch rijden objectiever te maken. Dit werk legde mede de basis voor open standaarden als OpenSCENARIO en OpenDRIVE, waarmee testscenario's uitwisselbaar werden tussen bedrijven en onderzoeksinstellingen. Een opvolgproject, VVM (Verification and Validation Methods), bouwde hier tussen 2020 en 2023 op voort.
In de medische wereld liet onderzoek van onder meer John Zech en collega's, gepubliceerd in 2018 in het tijdschrift PLOS Medicine, zien hoe gevaarlijk beperkte dekking kan zijn: AI-modellen die longfoto's beoordeelden, bleken soms niet de ziekte zelf te herkennen, maar onbedoeld kenmerken van het specifieke ziekenhuis waar de data vandaan kwam, zoals het model röntgenapparaat. Omdat de trainingsdata afkomstig was van een beperkt aantal ziekenhuizen, dekte die niet de variatie tussen apparatuur en patiëntenpopulaties elders, met onbetrouwbare voorspellingen bij nieuwe ziekenhuizen tot gevolg.
Op het gebied van taalmodellen beschrijven zowel OpenAI (in de systeemdocumentatie bij GPT-4, 2023) als Anthropic hun praktijk van red teaming: teams van mensen die doelbewust proberen een modderig, divers en vijandig scala aan vragen en manipulatiepogingen te bedenken, juist om de dekking van moeilijke en schadelijke scenario's te vergroten voordat een model breed wordt vrijgegeven.
In het academische onderzoek naar offline reinforcement learning, waarbij een systeem leert uit eerder vastgelegde ervaring in plaats van live te experimenteren, speelde de introductie van de D4RL-benchmark in 2020 een belangrijke rol: deze verzameling datasets maakte het voor het eerst mogelijk om verschillende algoritmes op een gestandaardiseerde manier te vergelijken op hoe goed ze omgaan met beperkte en ongelijk verdeelde dekking van data.
Hoe ver is de techniek?
Er bestaat geen enkele, algemeen aanvaarde maatstaf om 'dekking' in één getal uit te drukken, zeker niet voor complexe, hoogdimensionale situaties zoals verkeer of natuurlijke taal. Dit is een fundamenteel probleem: hoe meer variabelen een situatie bepalen (weer, licht, type weg, type voertuig, gedrag van andere verkeersdeelnemers, en zo verder), hoe explosiever het aantal mogelijke combinaties groeit, een verschijnsel dat wel de 'vloek van de dimensionaliteit' wordt genoemd. Volledige dekking is daardoor in de praktijk onbereikbaar; het gaat altijd om risicobeheersing, niet om garanties.
De afgelopen jaren is wel duidelijke vooruitgang geboekt in simulatietechnieken, synthetische datageneratie en algoritmes die herkennen wanneer een invoer buiten bekend terrein valt. Tegelijk blijft het zogeheten sim-to-real gap een obstakel: een simulatie dekt een scenario misschien goed, maar als de simulatie zelf niet realistisch genoeg is, vertaalt die dekking zich niet automatisch naar veiligheid in de echte wereld.
Op regelgevend vlak is de norm ISO 21448, bekend als SOTIF (Safety of the Intended Functionality), sinds het begin van de jaren 2020 een belangrijk referentiekader voor de automobielsector om juist dit soort dekkingsvraagstukken te structureren. Het Amerikaanse National Institute of Standards and Technology (NIST) publiceerde in 2023 een AI Risk Management Framework dat organisaties handvatten geeft om representativiteit van data te beoordelen. Dit zijn eerder hulpmiddelen en denkkaders dan opgeloste technische problemen: het veld ontwikkelt zich gestaag, maar het probleem van de 'onbekende onbekenden', situaties waar niemand aan gedacht heeft om te testen, blijft inherent lastig.
Wie werken eraan?
In de autosector investeren Waymo, Tesla, Cruise, Mercedes-Benz en toeleverancier Mobileye fors in scenario- en simulatiegebaseerd testen. In Duitsland is dit onderzoek sterk verankerd via door de overheid (voorheen het ministerie van Economische Zaken, BMWi, nu BMWK) gefinancierde consortia als PEGASUS en VVM, met deelname van de grote autofabrikanten en onderzoeksinstellingen als het Fraunhofer-instituut.
Op het gebied van taalmodellen en bredere AI-veiligheid werken OpenAI, Anthropic, Google DeepMind en Meta aan interne methodes om de dekking van hun testprocessen te vergroten, vaak in combinatie met externe red-teamers en academische partners. Universitaire onderzoeksgroepen, waaronder die aan UC Berkeley (bekend van werk aan offline reinforcement learning), Stanford en MIT, leveren veel van het onderliggende theoretische werk over dekkingsvoorwaarden en generalisatie.
Op beleidsniveau zijn het Amerikaanse NIST, de Europese Unie (via de AI-verordening en het Europese normalisatie-instituut CEN-CENELEC) en internationale standaardisatieorganisaties als ISO en SAE International betrokken bij het vastleggen van normen waaraan voldoende dekking zou moeten voldoen.
Verder lezen
- NIST AI Risk Management Framework
- arXiv.org — preprints van technisch onderzoek naar distributional shift en offline reinforcement learning
- Waymo — veiligheidsrapportages en simulatiebenadering
- Sutton & Barto, Reinforcement Learning: An Introduction (standaardwerk)
- OpenAI — systeemdocumentatie en red-teamingpraktijken