Home Fondamenti Storia dell'AI Reti Neurali Backpropagation Architetture Token Modelli AI Case Studies Tecniche RAG RAG Avanzato GraphRAG MCP Orchestrazione LangChain LangGraph Prompt Engineering Usare l'AI ChipsBot News

Google Research lancia co-direttore AI per video: 4 framework per generazione coerente minuti

MarkTechPost 28 settembre 2026

Google Research ha introdotto un co‑direttore AI per la generazione di video a lungo termine, una soluzione che combina quattro framework agentici per trasformare brevi clip in narrazioni video continue e coerenti. Il nuovo approccio si posiziona sopra i modelli Gemini e Veo, ma è progettato per essere model‑agnostic, consentendo l’integrazione con altri generatori video esistenti.

Perché i video AI lunghi falliscono

I modelli di diffusione riescono a generare clip ad alta fedeltà in pochi secondi, ma l’unione di queste clip in una storia coerente è ancora difficile. Le pipeline tradizionali concatenano moduli con prompt manuali indipendenti, generando due tipologie di errori:

    • Semantic drift: cambiamenti involontari di abbigliamento, ambientazione o stile tra una scena e l’altra.
    • Cascading failures: un asset difettoso nella fase iniziale compromette tutte le scene successive.

Google descrive il problema come una questione di “credit assignment”: quando il video finale è rovinato è complesso risalire al prompt responsabile.

Come funziona il co‑direttore video AI

Il sistema si colloca sopra Gemini e Veo, ereditando la marcatura SynthID dei modelli di base. La struttura è suddivisa in quattro framework, ognuno con un ruolo specifico nella catena produttiva.

1. Co‑Director: pianificazione creativa con ricerca a bandito

Presentato a COLM 2026, il Co‑Director utilizza un algoritmo multi‑armed bandit (MAB). Un Orchestrator Agent sceglie una configurazione tra Creative Strategy, Narrative Mode e Aesthetic Archetype. Un Pre‑Production Agent genera lo storyboard, mentre i sotto‑agenti Keyframe, Video e Audio realizzano rispettivamente le immagini chiave, il filmato e la colonna sonora. Un MLLM Judge valuta il montaggio e restituisce una ricompensa fattorizzata al bandito per guidare le scelte successive.

2. CANVAS: memoria visiva persistente

Accettato a EMNLP 2026, CANVAS monitora personaggi, location e stato degli oggetti man mano che la storia avanza. Quando una scena ritorna, recupera gli “anchor visuali” memorizzati per garantire continuità. Nel test del furto al museo, AutoStudio aveva perso il berretto del ladro e Gemini‑3.1‑Pro aveva cambiato il gioiello; CANVAS ha mantenuto entrambi gli elementi coerenti.

3. A²RD: generazione segmentata autoregressiva

L’architettura A²RD (Agentic Autoregressive Diffusion) è priva di addestramento aggiuntivo. Ogni segmento segue un ciclo Retrieve‑Synthesize‑Refine‑Update basato su una memoria video multimodale. L’agente alterna tra extrapolation per nuovi eventi narrativi e interpolation per entità ricorrenti. Google ha mostrato un film di 10 minuti prodotto interamente con questo metodo.

4. VQQA: affinamento dei prompt in ciclo chiuso

VQQA (Video Quality Question Answering) genera domande visive per ciascun prompt. I VLM (Vision‑Language Models) forniscono “gradienti semantici” che riscrivono il testo del prompt. Non richiede accesso agli interni del modello. Una fase di Global Selection sceglie il video migliore tra tutte le iterazioni, invece di limitarsi all’ultima versione.

Benchmark e risultati

Google ha creato tre nuovi benchmark per valutare la continuità e la coerenza:

    • GenAD‑Bench: 400 scenari pubblicitari con 200 prodotti fittizi di 50 brand.
    • HardContinuityBench: mette alla prova la ricomparsa di scene e il cambiamento di stato degli oggetti.
    • LVBench‑C: 120 scenari in cui asset chiave scompaiono per almeno 10 segmenti prima di riapparire.

Risultati principali:

    • Co‑Director: 81,4 su GenAD‑Bench e 3,96/5 in valutazioni umane.
    • CANVAS: miglioramenti del 21,6 % in continuità di sfondo, 9,6 % in coerenza dei personaggi e 7,6 % in coerenza degli oggetti.
    • A²RD: fino al 30 % di miglioramento nella coerenza e 20 % nella coerenza narrativa per video da 1 a 10 minuti.
    • VQQA: guadagni assoluti di 11,57 % su T2V‑CompBench e 8,43 % su VBench2 rispetto alla generazione vanilla.

Confronto con altre soluzioni

La tabella comparativa evidenzia le differenze chiave tra il co‑direttore di Google e le alternative più note:

    • StoryMem (ByteDance, NTU): produce video di un minuto, utilizza una memoria di keyframe, ma non segnala meccanismi di auto‑correzione.
    • MovieAgent (Show Lab, NUS): pianificazione gerarchica con personalizzazione per personaggio, ma non fornisce una memoria visiva persistente.
  • <
Leggi l'articolo originale →
← Torna alle news