Gemini väljer själv vilka delar av videon som ska granskas
Gemini kan söka i en videotidslinje och bara granska de ögonblick, bildrutor och ljudspår som frågan kräver.
Google har gett Gemini ett nytt sätt att analysera video: modellen avgör själv vilka delar av tidslinjen den behöver granska, i vilken takt och genom vilken kanal. I stället för att på förhand mata in bildrutor med en fast frekvens kan den söka efter relevanta ögonblick, växla mellan bild, ljud och transkript och gå tillbaka för en närmare kontroll.
Från fast sampling till aktivt tittande
I statisk videobearbetning samplas videon normalt med en bestämd bildfrekvens. Det är förutsägbart, men dyrt för långa inspelningar och riskerar att missa mycket korta händelser mellan de valda bildrutorna.
Med agentisk videoförståelse får Gemini i stället ett internt verktyg för att ladda utvalda delar av videon. Modellen kan först göra en grov sökning, zooma in på ett intressant tidsfönster och öka bildfrekvensen där något händer snabbt. Den kan också välja ljud eller transkript när frågan inte kräver fler bilder.

Gemini söker i tidslinjen och granskar valda bildrutor, ljud och transkript. Källa: Google DeepMind. Grafik: Debrief. Bearbetning: förenklad egen processgrafik utifrån Googles beskrivning; ingen generativ bildmodell använd.
Lägre kostnad enligt Googles tester
Google DeepMind uppger att läget minskar tokenanvändningen med upp till 88 procent och analyskostnaden med upp till 66 procent, samtidigt som kvaliteten förbättras med upp till 7 procent i bolagets videobenchmarks. Det är maxvärden från Googles egna tester, inte ett löfte för varje video eller fråga.
Funktionen finns nu för uppladdade videor och YouTube-klipp via Gemini API i Google AI Studio och Gemini Enterprise Agent Platform. Den stöds vid lanseringen av Gemini 3.7 Flash, 3.6 Flash och 3.5 Flash-Lite och använder den vanliga tokenprissättningen utan separat funktionsavgift.
Vad modellen väljer bort blir viktigt
Ett tidigare test av WIRED visade varför bättre visuell kontroll behövs. Den dåvarande Gemini-versionen kunde sammanfatta tal och transkript men missade bland annat namn som visades i bild och nyanser i ett sportklipp.
Den nya metoden är byggd för att söka efter just sådana visuella ögonblick. Men selektiviteten skapar också en ny granskningsfråga: om modellen väljer vad den ska se behöver utvecklaren kunna förstå vad den aldrig tittade på. För videoredigering, övervakning och avvikelsedetektering är den uteblivna inspektionen minst lika viktig som svaret.
Google säger att tekniken ska nå Gemini-appen snart och funktionen Ask YouTube under de kommande månaderna. De konsumentdelarna är alltså ännu inte allmänt lanserade.
Gemini kan nu söka i en video och själv välja vilka bildrutor, ljudsegment och transkriptstycken som behöver granskas.
Långa videor kan analyseras med betydligt färre tokens när modellen inte måste läsa in en fast sampling av hela tidslinjen.
Det här flyttar videoförståelse från passiv inmatning till aktiv undersökning. Nästa viktiga steg är spårbarhet: ett bra svar räcker inte om ingen kan se vilka ögonblick modellen valde bort.




