AI & computing › Generatieve AI & synthetische media
Qwen lanceert goedkoop AI-model dat video en audio tegelijk begrijpt
Het Chinese techbedrijf Alibaba heeft met Qwen3.8-Omni-Flash een nieuw AI-model uitgebracht dat beeld en geluid samen analyseert en zelfstandig taken uitvoert, zoals het bewerken van video's. Het model presteert ongeveer net zo goed als Google's Gemini 3.8 Flash, maar kost een fractie van de prijs.
Qwen, het AI-lab van de Chinese techgigant Alibaba, presenteert Qwen3.8-Omni-Flash als zijn eerste multimodale model dat speciaal is gebouwd voor agentic AI: kunstmatige intelligentie die niet alleen antwoord geeft, maar ook zelfstandig acties uitvoert. Het model kan audio en video tegelijk verwerken, daar conclusies uit trekken en vervolgens digitale gereedschappen inzetten om bijvoorbeeld vlogs te monteren, korte video's te vertalen of films samen te vatten.
Volgens Qwen presteert het nieuwe model op audio-videotaken ongeveer net zo goed als Gemini 3.8 Flash, het multimodale model van Google. Beide modellen worden getest op zogeheten benchmarks: gestandaardiseerde testen waarmee de prestaties van AI-modellen onderling vergelijkbaar worden gemaakt. Opvallend is niet de score, maar de prijs: Qwen3.8-Omni-Flash is aanzienlijk goedkoper dan de concurrent van Google.
Fors lagere prijs dan Google
Wie het model via de Qwen-API gebruikt, betaalt 0,15 dollar per miljoen tokens aan invoer en 0,47 dollar per miljoen tokens aan uitvoer. Tokens zijn de kleine tekst- of databrokjes waarin AI-modellen taal en andere informatie verwerken; hoe meer tokens nodig zijn, hoe hoger de rekenkosten. Audio-invoer kost volgens Qwen minder dan een cent per uur. Een video van 720p-kwaliteit met geluid, verwerkt op één beeld per seconde, kost ongeveer 0,20 dollar, exclusief de kosten voor het gegenereerde antwoord.
Ter vergelijking: Google rekent voor Gemini 3.8 Flash op dit moment 0,75 dollar per miljoen tokens aan invoer en 3,75 dollar per miljoen tokens aan uitvoer, tegen een introductietarief. Die prijzen verdubbelen per 1 januari 2027. Daarmee ligt Qwen3.8-Omni-Flash grofweg vijf tot acht keer lager in prijs dan het Google-model, terwijl de prestaties op audio-videotaken vergelijkbaar zijn.
Groot geheugen en losse uitbreidingen
Het model heeft een contextvenster van een miljoen tokens: het werkgeheugen waarmee een AI-model grote hoeveelheden tekst, beeld of geluid in één keer kan verwerken en onthouden tijdens een gesprek of taak. Dat maakt het geschikt voor langere video's en uitgebreide gesprekken zonder dat het model eerdere informatie kwijtraakt.
Qwen3.8-Omni-Flash is beschikbaar via Qwen Studio, Qwen Cloud en de API van het bedrijf. Daarnaast brengt Qwen open-source uitbreidingen uit, de zogeheten Qwen-MM-Plugins, die functies toevoegen zoals videobewerking, sprekerherkenning, het maken van aantekeningen bij video's van pdf-documenten en herbruikbare werkstromen. Deze plugins zijn te gebruiken binnen bestaande AI-agentomgevingen zoals Claude Code, Gemini CLI en Qwen Code. Met de Qwen-Live Harness kunnen ontwikkelaars bovendien realtime toepassingen bouwen die via een camera en microfoon met gebruikers communiceren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Doordat multimodale AI-modellen die video en audio combineren steeds goedkoper worden, komt geavanceerde automatische video- en spraakverwerking binnen bereik van kleinere bedrijven en ontwikkelaars. Dit versnelt de opmars van AI-agents die zelfstandig complexe, multimediale taken uitvoeren, en verscherpt de prijsconcurrentie tussen Amerikaanse en Chinese AI-aanbieders.
- Multimodaal AI-model
- Een AI-systeem dat meerdere soorten data tegelijk kan verwerken, zoals tekst, beeld, video en geluid, in plaats van slechts één type.
- Agentic AI
- AI die niet alleen antwoorden genereert, maar ook zelfstandig taken en acties uitvoert, bijvoorbeeld door software of digitale gereedschappen te bedienen.
- Contextvenster
- De hoeveelheid tekst, beeld of geluid die een AI-model in één keer kan verwerken en onthouden; een groter contextvenster betekent dat een model meer informatie tegelijk kan meenemen.
- Token
- Een klein tekst- of databrokje waarin AI-modellen informatie verwerken; de kosten van AI-diensten worden vaak berekend per miljoen tokens.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.