AI & computing › Generatieve AI & synthetische media
Anthropics veiligheidsfilter tegen bio-wapens was bijna een jaar uitgeschakeld
Bij AI-bedrijf Anthropic stond de filter die moet voorkomen dat chatbot Claude helpt bij het maken van biologische wapens bijna een jaar lang uit. In die periode deden zo'n 50.000 externe testers ruim 133 miljoen chatgesprekken zonder die bescherming.
Anthropic, het bedrijf achter chatbot Claude, meldt in een eigen veiligheidsrapport dat een cruciaal beveiligingssysteem van mei 2025 tot april 2026 buiten werking was. Het gaat om een bioveiligheidsfilter: software die moet voorkomen dat gebruikers via de AI gevaarlijke kennis over chemische of biologische wapens kunnen opvragen. Al het verkeer van externe contractors die Claude van feedback voorzagen, liep bijna een jaar lang buiten dit filter om.
50.000 testers, 133 miljoen gesprekken
Het probleem trof een grote groep mensen. Ongeveer 50.000 externe medewerkers, ingehuurd via gespecialiseerde bureaus om de antwoorden van Claude te beoordelen en te verbeteren, voerden in die periode samen circa 133 miljoen chatgesprekken met de modellen. Normaal gesproken screent Anthropic dit soort testers mede met behulp van de bioveiligheidsfilter, zodat verdachte vragen over wapens worden opgemerkt en geblokkeerd. Omdat die laag ontbrak, konden deze contractors in theorie ongehinderd gevoelige vragen stellen. De externe bureaus die de testers zelf vooraf screenden, deden dat volgens Anthropic vaak onvoldoende grondig.
Geen bewijs van misbruik, wel aangescherpt beleid
Anthropic zegt intern onderzoek te hebben gedaan naar de logs uit deze periode en geen aanwijzingen te hebben gevonden dat de storing daadwerkelijk is misbruikt om aan wapenkennis te komen. Toch trekt het bedrijf lessen uit het incident: de eisen waaraan externe contractors moeten voldoen, zijn inmiddels aangescherpt. Het voorval is opvallend omdat topman Dario Amodei van Anthropic eerder juist waarschuwde dat AI-ondersteunde ontwikkeling van chemische en biologische wapens een groter gevaar vormt dan cyberaanvallen. Zijn bedrijf presenteert zich als koploper op het gebied van AI-veiligheid, onder meer met uitgebreide AI-guardrails die risicovol gebruik moeten tegengaan.
Balanceren tussen veiligheid en bruikbaarheid
Het incident laat zien hoe lastig het is om veiligheidsfilters goed af te stellen. Te losse filters brengen risico's met zich mee, zoals nu bleek. Maar te strenge filters hebben ook nadelen: Anthropic versoepelde onlangs juist de classifiers op een recente Claude-versie, nadat wetenschappers klaagden dat de filters zo agressief waren dat ze legitiem medisch en biologisch onderzoek blokkeerden. Het bedrijf zoekt dus voortdurend naar de juiste balans tussen het tegenhouden van kwaadwillenden en het toestaan van nuttig, legaal onderzoek door bijvoorbeeld universiteiten en laboratoria.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-systemen krachtiger worden, groeit ook het risico dat ze onbedoeld helpen bij het verspreiden van gevaarlijke kennis. Dit incident toont aan dat zelfs bedrijven die veiligheid als kernwaarde uitdragen, technische fouten kunnen maken in hun beveiligingslagen. Onafhankelijke controle en transparante rapportage, zoals dit door Anthropic zelf gepubliceerde risicorapport, worden daardoor steeds belangrijker voor vertrouwen in AI-technologie.
- Bioveiligheidsfilter
- Een technisch systeem binnen een AI-model dat vragen en antwoorden controleert om te voorkomen dat de AI gebruikt wordt voor het ontwikkelen van biologische of chemische wapens.
- AI-guardrails
- De verzamelnaam voor technische en beleidsmatige maatregelen die moeten voorkomen dat een AI-systeem schadelijke of ongewenste output genereert.
- Classifier
- Een AI-onderdeel dat input of output automatisch indeelt in categorieën, bijvoorbeeld 'veilig' of 'risicovol', om schadelijk gebruik te herkennen.
- Contractor
- Een extern ingehuurde medewerker die, in dit geval, de antwoorden van een AI-model beoordeelt en van feedback voorziet om het model te verbeteren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.