AI & computing › AI-gestuurde wetenschappelijke ontdekkingen
OpenAI betaalt voor data uit failliete biotechbedrijven om AI te trainen
De OpenAI Foundation gaat geld steken in het verzamelen van medische data uit bedrijven die failliet zijn gegaan. Het idee: gebruik de achtergelaten onderzoeksdossiers van deze biotechbedrijven om AI-modellen te trainen die ziektes sneller kunnen doorgronden. Het plan is bedacht door beleidsanalist Ruxandra Teslo en moet een write leemte opvullen die medische AI al jaren tegenhoudt.
Kunstmatige intelligentie heeft de belofte in zich om ziektes sneller te doorgronden en nieuwe medicijnen te ontdekken. Maar daarvoor is veel meer data nodig dan er nu beschikbaar is. Onderzoekers lopen steeds vaker tegen die grens aan: de meest waardevolle medische informatie ligt niet online, maar in de kluizen van bedrijven die failliet zijn gegaan.
Een archief van mislukte biotechbedrijven
Vorig jaar opperde beleidsanalist Ruxandra Teslo een ongewoon plan. Wanneer een biotechbedrijf failliet gaat, verdwijnen niet alleen de medicijnen die het ontwikkelde, maar ook enorme hoeveelheden onderzoeksdata: gedetailleerde dossiers voor toezichthouders, productieprocessen en veiligheidsgegevens uit klinische proeven. Die informatie wordt normaal gesproken verkocht tijdens de faillissementsprocedure, vaak aan de hoogste bieder, en verdwijnt daarna in privéarchieven. Teslo noemde dit 'biotech's lost archive': een verborgen goudmijn aan kennis die nooit is gebruikt om AI te trainen.
Deze week maakte de OpenAI Foundation, de non-profitorganisatie achter het bedrijf OpenAI, bekend dat het Teslo's idee gaat financieren. De stichting gaat geld beschikbaar stellen om deze verspreide, vaak ontoegankelijke bedrijfsdata op te kopen en om te zetten in bruikbare, hoogwaardige wetenschappelijke datasets. Die datasets moeten vervolgens dienen als trainingsdata voor AI-modellen die zich richten op biologie en geneeskunde.
Waarom medische AI meer data nodig heeft
Grote taalmodellen zoals die van OpenAI zijn getraind op enorme hoeveelheden tekst van het internet. Voor doorbraken in de geneeskunde is dat niet genoeg: veel cruciale kennis over hoe medicijnen falen, hoe productieprocessen verlopen en welke veiligheidsrisico's optreden, is nooit gepubliceerd. Bedrijven behandelen dit soort informatie vaak als bedrijfsgeheim, ook als het onderliggende medicijn nooit op de markt is gekomen. Daardoor blijft waardevolle informatie over wat wél en niet werkt in de geneeskunde onbenut voor onderzoekers en algoritmes.
Door deze data alsnog vrij te maken, hoopt de OpenAI Foundation de basis te leggen voor krachtigere foundation models die specifiek gericht zijn op biologie. Het initiatief past in een bredere trend waarin AI-bedrijven op zoek zijn naar nieuwe, unieke databronnen nu de gewone internettekst grotendeels is uitgeput. Voor de biotechsector zelf betekent het project ook dat mislukte experimenten alsnog nut kunnen krijgen, in plaats van voorgoed te verdwijnen in een archiefkast.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als het lukt om data uit failliete biotechbedrijven te ontsluiten, kunnen AI-modellen sneller leren welke medicijnen wel en niet werken, wat onderzoek naar nieuwe behandelingen kan versnellen. Het voorbeeld laat ook zien dat grote AI-bedrijven steeds actiever op zoek gaan naar nieuwe, ongebruikelijke databronnen nu gewone teksten van het internet niet meer genoeg zijn. Dat kan de manier veranderen waarop bedrijfsgeheimen in de wetenschap worden behandeld.
- Trainingsdata
- De verzameling gegevens waarmee een AI-model leert patronen te herkennen en voorspellingen te doen.
- Foundation model
- Een breed getraind AI-model dat als basis dient voor allerlei specifiekere toepassingen, zoals tekst, beeld of wetenschappelijke data.
- Bedrijfsgeheim
- Vertrouwelijke bedrijfsinformatie, zoals productieprocessen of testresultaten, die niet openbaar wordt gemaakt en niet is gepatenteerd.
- Faillissementsprocedure
- Het juridische proces waarbij de bezittingen van een failliet bedrijf, inclusief data en documenten, worden verkocht om schuldeisers te betalen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.