AI & computing › Generatieve AI & synthetische media
Google lanceert compact AI-model dat tekst, beeld en geluid omzet in vectoren
Google heeft EmbeddingGemma 2 uitgebracht, een open AI-model dat tekst, afbeeldingen, video, audio en programmeercode omzet in numerieke vectoren. Met maar 740 miljoen parameters presteert het volgens Google beter dan concurrerende modellen die twee keer zo groot zijn. Het model draait lokaal, zonder internetverbinding of API-sleutel.
EmbeddingGemma 2 is wat techneuten een multimodaal AI-model noemen: het kan verschillende soorten content tegelijk verwerken. Tekst, foto's, video, geluid en code worden allemaal omgezet in dezelfde soort wiskundige representatie, waardoor een computer kan berekenen hoe sterk twee stukken content op elkaar lijken. Dat is handig voor zoekmachines, aanbevelingssystemen en chatbots die snel de juiste informatie moeten vinden.
Klein model, grote prestaties
Opvallend is de omvang van het model: met 740 miljoen parameters is het aanzienlijk compacter dan vergelijkbare systemen. Toch scoort EmbeddingGemma 2 volgens Google beter dan modellen die twee keer zo groot zijn, op benchmarks voor multimodale embeddings. Op de Massive Text Embedding Benchmark voor code haalt het model een score van 78,68 punten. Dat is een sprong van bijna 10 punten vergeleken met de voorganger, die op 68,76 punten uitkwam. Daarmee evenaart het kleine model prestaties van veel grotere concurrenten.
Voor taken waarbij alleen tekst wordt verwerkt, biedt Google ook een nog kleinere versie aan van 270 miljoen parameters. Die extra variant maakt het mogelijk om het model aan te passen aan de zwaarte van de taak: wie geen beeld of geluid nodig heeft, kan met minder rekenkracht toe.
Werkt offline, zonder data naar de cloud te sturen
Een belangrijk kenmerk van EmbeddingGemma 2 is dat het volledig lokaal draait, dus op de eigen computer of server, zonder dat er een API-sleutel of internetverbinding nodig is. Via WebGPU kan het model direct in een webbrowser werken, met een verwerkingstijd van 20 tot 70 milliseconden per zoekopdracht. Het model heeft daarbij maar ongeveer 191 megabyte aan werkgeheugen nodig, wat weinig is voor dit soort AI-toepassingen.
Dat heeft ook gevolgen voor hoeveel opslagruimte nodig is om alle vectoren te bewaren. Google claimt dat de benodigde opslag in een lokale vectordatabase tot zes keer kleiner kan uitvallen dan voorheen. In combinatie met kleine open taalmodellen zoals Gemma 4 kan EmbeddingGemma 2 worden gebruikt om volledig offline RAG-toepassingen te bouwen: systemen die eerst relevante informatie opzoeken voordat ze een antwoord formuleren, zonder dat gebruikersdata het apparaat verlaat.
Dat laatste is vooral interessant voor bedrijven en ontwikkelaars die gevoelige gegevens niet naar externe servers willen sturen, bijvoorbeeld in de zorg, juridische sector of financiële dienstverlening. De modelgewichten zijn gratis beschikbaar via de platforms Hugging Face en Kaggle, inclusief documentatie voor ontwikkelaars die ermee aan de slag willen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Compacte, lokaal draaiende AI-modellen zoals EmbeddingGemma 2 maken het mogelijk om slimme zoek- en aanbevelingssystemen te bouwen zonder afhankelijkheid van clouddiensten. Dat verlaagt de kosten, verbetert de privacy en maakt AI-toepassingen toegankelijker voor kleinere bedrijven en apparaten met beperkte rekenkracht.
- Vectorembedding
- Een numerieke representatie van tekst, beeld of geluid waarmee een computer kan berekenen hoe sterk verschillende soorten content op elkaar lijken.
- Vectordatabase
- Een database die speciaal is ingericht om deze numerieke vectoren op te slaan en snel te doorzoeken.
- Multimodaal AI-model
- Een AI-systeem dat meerdere soorten data tegelijk kan verwerken, zoals tekst, beeld, video en geluid.
- WebGPU
- Een technologie waarmee webbrowsers rechtstreeks gebruik kunnen maken van de grafische kaart van een computer, wat AI-berekeningen sneller maakt.
- RAG (Retrieval-Augmented Generation)
- Een methode waarbij een AI-model eerst relevante informatie opzoekt voordat het een antwoord genereert, voor nauwkeurigere resultaten.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen met elkaar vergeleken kunnen worden.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.