Presentazione della comprensione video agentica con Gemini
Introduzione alla comprensione video agentica
Google ha annunciato il rilascio della comprensione video agentica per i modelli Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash‑Lite. Questa funzionalità consente al modello di analizzare i video in modo dinamico, selezionando segmenti rilevanti, modulando la velocità di scansione e scegliendo la modalità più efficace (fotogrammi, audio o trascrizione). Il risultato è una maggiore precisione, un drastico risparmio di token e costi inferiori.
Principi di funzionamento
Contrariamente alla tradizionale elaborazione statica, dove il modello consuma il video a una frequenza fissa (di default 1 FPS, modificabile via API), la comprensione video agentica mette Gemini in un ciclo agentico. In questo ciclo, il modello decide autonomamente cosa osservare, a quale velocità e attraverso quale modalità, caricando solo i segmenti necessari. In pratica, Gemini invoca uno strumento interno per estrarre la parte pertinente del file, riducendo così il carico di sviluppo per gli ingegneri.
Prestazioni e benchmark
Su benchmark standard di analisi video, i modelli Gemini con comprensione video agentica hanno dimostrato:
- Riduzione dei costi di analisi fino al 66 %;
- Riduzione del consumo di token fino all'88 %;
- Miglioramento dell'accuratezza fino al 7 %.
Questi vantaggi sono particolarmente evidenti nei video di lunga durata, che vanno da guide pratiche di 10 minuti a lezioni di 90 minuti o registrazioni pluriorarie. Con l'elaborazione statica, gli sviluppatori dovevano scegliere tra costi elevati di token o sacrificare dettagli critici; la modalità agentica elimina questo compromesso.
Confronto tra i modelli supportati
Le tre versioni supportate offrono guadagni simili, ma Gemini 3.7 Flash garantisce la migliore combinazione di qualità e efficienza. In termini di rapporto precisione‑costo, si posiziona al “pareto frontier”, ovvero il punto ottimale rispetto agli altri modelli testati per la comprensione video.
Come attivare la funzionalità
Per utilizzare la comprensione video agentica, basta impostare il parametro di elaborazione su “agentic” nella configurazione API di Google AI Studio o nella Gemini Enterprise Agent Platform. La tariffazione segue il modello di token standard di Gemini, senza costi aggiuntivi per la funzionalità.
Esempio di chiamata API
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "Quali sono i 3 annunci più importanti di questo keynote?"
},
],
)
print(interaction.output_text)
Capacità e casi d'uso
La comprensione video agentica apre nuove possibilità per gli sviluppatori che lavorano con contenuti video lunghi e complessi. Tra le principali applicazioni troviamo:
- Recupero di momenti sub-secondo: individuazione di cambi di stato o tagli molto rapidi, utile per l'editing video automatizzato.
- Ricerca “ago nel fieno” in video lunghi: risposta a query complesse su contenuti pluriorari senza consumare milioni di token.
- Rilevamento di anomalie: campionamento a FPS più elevati di finestre temporali interessanti per analizzare movimenti rapidi o artefatti visivi.
- Conteggio di azioni e oggetti: tracciamento preciso di movimenti ripetuti o oggetti distinti nel tempo.
- Analisi video a basso consumo di token: dimostrazioni su LongVideoBench evidenziano riduzioni notevoli di token e miglioramenti di precisione.
Esempi pratici
Recupero di momenti sub-secondo: grazie alla possibilità di variare dinamicamente il frame rate, Gemini può identificare cambi di scena avvenuti in frazioni di secondo, rendendo possibile l'automazione di montaggi video che prima richiedevano revisione manuale.
Ricerca “needle‑in‑a‑haystack”: un'azienda di e‑learning ha interrogato un corso di 3 ore, ottenendo risposte precise a domande specifiche consumando solo il 12 % dei token rispetto al metodo tradizionale.
Analisi di azioni veloci: su un video sportivo con movimenti rapidissimi, Gemini 3.7 Flash ha aumentato il frame rate solo nei segmenti necessari, ottenendo un conteggio accurato delle ripetizioni di esercizi con un margine di errore inferiore al 2 %.
Risultati reali e testimonianze
Partner in accesso anticipato hanno confermato performance superiori. Alcuni commenti:
- “Abbiamo ridotto i costi di analisi video del 60 % mantenendo una precisione superiore al 95 %.” – Team di analytics video.
- “La capacità di saltare direttamente alle sezioni rilevanti ha accelerato il nostro flusso di lavoro di editing del 40 %.” – Studio di post‑produzione.
Prospettive future
Google prevede di estendere l'efficienza e la qualità della comprensione video agentica a miliardi di utenti attraverso i propri prodotti. Nei prossimi mesi, la funzionalità sarà integrata nell'app Gemini per tutti i modelli Flash e Flash‑Lite e alimenterà la funzione “Ask YouTube” sulla pagina di visualizzazione dei video, fornendo risposte più accurate basate sul contenuto visivo.
Ringraziamenti
Il progetto è stato possibile grazie al contributo di:
- Sergi Caelles
- Filip Pavetić
- Ahmet Iscen
- Suhas Yogin
- Team Agentic Vision
Iscrizione alle novità
Per restare aggiornati su ulteriori sviluppi, è possibile iscriversi alla newsletter di Google, che offre aggiornamenti di prodotto, informazioni su eventi, offerte speciali e molto altro. L’iscrizione è gratuita e può essere annullata in qualsiasi momento, in conformità con l’in