AI & computing › Generatieve AI & synthetische media
Google lanceert AI-model Argon dat zelf cyberlekken dicht en code herschrijft
Google DeepMind presenteert Gemini 4 Argon, een AI-model dat urenlang aan één complexe taak kan doorwerken. Het model herschrijft zelfstandig miljoenen regels code, speurt naar beveiligingslekken en dicht die meteen. Argon is nog niet voor iedereen beschikbaar: eerst testen geselecteerde cybersecurity-experts het systeem.
Gemini 4 Argon is het nieuwste frontier-AI-model van Google DeepMind, de onderzoekstak van Google die zich bezighoudt met de meest geavanceerde kunstmatige intelligentie. Waar eerdere chatbots vooral korte vragen beantwoorden, is Argon gebouwd om dagenlang door te werken aan ingewikkelde klussen: het herschrijven van software, het opstellen van juridische documenten of het doorrekenen van financiële scenario's. Het model rolt vanaf nu uit via het zogeheten Fairwind Program, een besloten toegangsprogramma voor vertrouwde cyberbeveiligers.
Een geheugen van een miljoen tokens
De belangrijkste technische sprong zit in het contextvenster van het model: de hoeveelheid tekst die het in één keer kan verwerken en produceren. Dat venster groeit van 64.000 naar maar liefst 1 miljoen tokens, de taalbrokjes waarin AI-modellen tekst opknippen. Die ruimte gebruikt Google nu al intern. Een team liet Argon-agents de serverparken van het bedrijf doorlichten op geheugenverspilling; het resultaat was meer dan 300 terabyte vrijgemaakt geheugen, met naar schatting nog een petabyte aan besparing in het verschiet. In een ander project herschreven AI-agents stukken van de Fuchsia Zircon-kernel en de videodecoder libgav1 van de programmeertaal C++ naar het veiligere Rust. Door telkens de uitvoer van de compiler te bestuderen en bij te sturen, wist Argon 32.000 regels gespecialiseerde SIMD-code te vervangen door een versie die 2,7 keer sneller draait, zonder dat de videokwaliteit achteruitging.
Koploper op code, recht en financiën
Op de benchmark DeepSWE, die langdurige programmeertaken test, haalt Argon een score van 77,9 procent en is daarmee de best presterende AI tot nu toe. Ook op de Vals Index, die de economische impact van AI meet in sectoren als recht, belastingen en financiën, voert het model de ranglijst aan. Op AutomationBench van automatiseringsbedrijf Zapier scoort Argon 51,3 procent, goed voor de eerste plaats, en op LVBench voor het begrijpen van lange video's haalt het model 91,7 procent. Deze cijfers laten zien dat het model niet alleen goed is in programmeren, maar ook in taken die mensen normaal gesproken zelf uitvoeren, zoals het doorspitten van contracten of het analyseren van urenlange video-opnames.
Eerst de digitale verdediging, dan de rest
Google zet Argon bewust eerst in voor defensieve cybersecurity. Het model kan zelfstandig kwetsbaarheden in software opsporen, controleren of ze echt een risico vormen en vervolgens een reparatie voorstellen. Op CWE-bench, een testset voor het herstellen van bekende softwarezwaktes, scoort Argon 68 procent en deelt daarmee de koppositie. Beveiligingsbedrijf Wiz gebruikt het model al binnen zijn Scan for Good-initiatief, dat gratis kritieke lekken opspoort bij publieke instellingen. Daarbij ontdekte Argon een ernstig lek dat gevoelige patiëntgegevens blootlegde in ziekenhuissoftware wereldwijd, een risico dat eerdere AI-modellen hadden gemist. Voor vertrouwde partijen levert Google een versie zonder ingebouwde beperkingen, zodat de volledige aanvalskracht van het model ingezet kan worden om systemen te testen.
Voorzichtig uitrollen
Voordat Argon breed beschikbaar komt, werkt Google aan extra waarborgen. Het model moet bestand zijn tegen indirecte prompt-injectie, een aanvalstechniek waarbij verborgen instructies een AI-systeem proberen te kapen. Op de IPI-benchmark van Gray Swan scoort Argon volgens Google het best van alle geteste modellen. Daarnaast monitort het bedrijf de interne werking van het model om misbruik voor cyberaanvallen of chemische en biologische wapens vroegtijdig te signaleren. Wanneer het model wel beschikbaar komt voor ontwikkelaars, bedraagt de introductieprijs 2 dollar per miljoen invoertokens en 10 dollar per miljoen uitvoertokens.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Argon laat zien dat AI steeds vaker wordt ingezet voor werk dat uren of dagen duurt in plaats van één losse vraag, van het herschrijven van kritieke software tot het dichten van cyberlekken voordat criminelen ze vinden. Tegelijk groeit de noodzaak om zulke krachtige systemen goed te beveiligen tegen misbruik, iets waar Google bewust eerst mee experimenteert bij vertrouwde cyberbeveiligers.
- Token
- Een klein tekstfragment waarin AI-taalmodellen woorden opknippen om ze te kunnen verwerken; de lengte van een gesprek of document wordt vaak uitgedrukt in het aantal tokens.
- Contextvenster
- De maximale hoeveelheid tekst die een AI-model tegelijk kan 'onthouden' en gebruiken bij het geven van een antwoord.
- Frontier-AI
- De term voor de meest geavanceerde AI-modellen die op dit moment beschikbaar zijn, aan de grens van wat technisch mogelijk is.
- SIMD
- Een programmeertechniek (Single Instruction, Multiple Data) waarbij een processor dezelfde bewerking tegelijk op meerdere stukjes data uitvoert, wat software aanzienlijk sneller maakt.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergelijkbaar worden gemaakt.
- Indirecte prompt-injectie
- Een aanvalstechniek waarbij kwaadwillenden verborgen instructies verstoppen in tekst of websites, met als doel een AI-systeem ongemerkt andere opdrachten te laten uitvoeren dan de gebruiker bedoelde.
- CWE-bench
- Een testset die meet hoe goed een AI-model bekende softwarekwetsbaarheden (Common Weakness Enumerations) kan opsporen en herstellen.
- CBRN
- Afkorting voor chemische, biologische, radiologische en nucleaire dreigingen; AI-bedrijven bouwen waarborgen in om te voorkomen dat modellen hierbij helpen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.