AI & computing › Generatieve AI & synthetische media
Google maakt AI-video's goedkoper en flexibeler met Gemini Omni 1.1
Google heeft zijn AI-videomodel Gemini Omni Flash bijgewerkt naar versie 1.1. De update maakt het genereren en verlengen van video's een stuk goedkoper en geeft ontwikkelaars meer controle over stijl en camerabeweging. Vooral de manier waarop bestaande scènes worden voortgezet, is flink verbeterd.
Google heeft een nieuwe versie uitgebracht van Gemini Omni Flash, het AI-model waarmee ontwikkelaars video's kunnen laten genereren. In versie 1.1 verbetert het bedrijf vooral de manier waarop het model bestaande video's kan verlengen, en verlaagt het de kosten voor lagere resoluties. Het model is via Google AI Studio en de bijbehorende ontwikkelaarsdocumentatie beschikbaar voor iedereen die er zelf mee wil bouwen.
De techniek achter dit soort modellen heet beeldfabricage: software die op basis van tekst of voorbeeldmateriaal nieuwe beelden en video's verzint. Veel van deze modellen, waaronder vermoedelijk ook Gemini Omni, bouwen voort op een diffusiemodel, waarbij een AI leert om ruis stap voor stap om te zetten in een herkenbaar beeld.
Langere scènes met meer samenhang
Een van de grootste verbeteringen zit in wat Google 'scene-extensie' noemt: het verlengen van een al bestaande videoscène. In de vorige versie keek het model daarvoor alleen naar de allerlaatste seconde van de bestaande video. Dat leverde soms wisselende resultaten op, omdat het model te weinig context had om personages, belichting en beweging consistent door te trekken. In versie 1.1 analyseert het model tot tien seconden van de bestaande video, wat tot visueel stabielere vervolgbeelden moet leiden. Scènes kunnen bovendien in stappen van tien seconden worden uitgebreid, tot een totale lengte van veertig seconden.
Stijlreferenties en gestuurde camerabewegingen
Ontwikkelaars krijgen ook meer grip op de creatieve kant van het proces. Ze kunnen tot drie seconden extern beeldmateriaal uploaden als stijlreferentie, waarmee bijvoorbeeld het uiterlijk van een personage of een specifiek bewegingspatroon in de gegenereerde video terugkomt. Daarnaast is het mogelijk om een begin- en eindbeeld op te geven, waarna het model zelf de camerabeweging tussen die twee punten invult. Deze vorm van keyframe-interpolatie maakt het makkelijker om gerichte camerabewegingen te maken zonder dat elk tussenbeeld apart hoeft te worden ontworpen.
Goedkoper dankzij lagere resolutie
Voor wie snel en goedkoop wil experimenteren, introduceert Google een 360p-conceptmodus. Die draait tot 60 procent sneller en kost een derde van wat 720p kost. Video's die in lage resolutie zijn gegenereerd, kunnen achteraf worden opgeschaald naar 1080p of zelfs 4K met video-upscaling. Qua prijs rekent Google 0,03 dollar per seconde voor 360p, 0,10 dollar voor 720p, 0,15 dollar voor 1080p en 0,30 dollar voor 4K. Daarmee ligt Gemini Omni 1.1 in dezelfde prijsklasse als Googles eigen Veo 3.1-modellen, al is de 360p-optie nieuw en uniek voor dit model. Voor bedrijven die AI-video op grote schaal willen inzetten, bijvoorbeeld voor advertenties of snelle prototypes, kan dat prijsverschil aardig oplopen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Doordat AI-video's goedkoper en preciezer te maken zijn, verlaagt dit de drempel voor bedrijven en makers om AI-gegenereerde video in te zetten voor marketing, prototyping en content. Tegelijk vergroot betere controle over stijl en camerabeweging het risico dat synthetische video's steeds moeilijker te onderscheiden zijn van echte opnames.
- Scene-extensie
- Het automatisch verlengen van een bestaande, door AI gegenereerde videoscène op basis van eerdere beelden.
- Keyframe-interpolatie
- Een techniek waarbij een AI-model zelf de tussenliggende beelden invult tussen een opgegeven begin- en eindbeeld.
- Video-upscaling
- Het verhogen van de resolutie van een video, bijvoorbeeld van 360p naar 1080p of 4K, zodat details scherper worden.
- Diffusiemodel
- Een type AI-model dat beelden of video's genereert door stap voor stap ruis om te zetten in een herkenbaar resultaat.
- Beeldfabricage
- De verzamelnaam voor AI-technieken waarmee software nieuwe foto's en video's verzint op basis van tekst of voorbeeldmateriaal.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.