Ho testato Wan 2.6: la prima volta che mi è sembrato di pianificare una scena (e non di scommettere su una clip)
- Cosa ho testato (così sai che non ho scelto solo i risultati migliori)
- Cosa c'è di nuovo in Wan 2.6 (in parole semplici)
- Tabella rapida: cosa funziona bene e cosa va ancora guidato
- I prompt che hanno funzionato meglio per me
- Il mio flusso di lavoro sul campo (come userei Wan 2.6 senza impazzire)
- Cosa non mi è piaciuto (perché niente è magia)
- Per chi è davvero Wan 2.6
- In conclusione
Quando è uscito Wan 2.6, ho dato per scontato che fosse l'ennesimo modello "bellissimo negli screenshot" che crolla appena provi a fare qualcosa di appena ambizioso.
Poi ho provato qualche prompt reale, cose che vorrei davvero per un momento narrativo breve, un teaser di prodotto o un mini sketch, e mi sono sorpresa a fare una cosa che faccio di rado con un generatore di video AI:
ho iniziato a ragionare per inquadrature.
Non "genera tre clip separate e prega che combacino". Non "un momento appariscente e basta".
Piuttosto: presenta → avvicinati → centra l'emozione → chiudi il momento.
È su questo che mi concentrerò: com'è usare Wan 2.6 sul campo, cosa fa in modo affidabile, dove inciampa ancora e come ci lavorerei davvero se dovessi pubblicare contenuti ogni settimana.
Cosa ho testato (così sai che non ho scelto solo i risultati migliori)
Ho messo Wan 2.6 alla prova con tre stress test:
- Mini scena con più inquadrature (campo lungo → piano medio → primo piano) con luce e soggetto coerenti
- Generazione guidata da un riferimento, usando una breve clip di "atmosfera" (oscillazione della camera + ritmo)
- Dialogo + suono (voce + ambiente), per vedere se audio e interpretazione restano allineati
Ho provato sia prompt "puliti e cinematografici" sia prompt volutamente disordinati (movimenti veloci, atmosfera che cambia, luci miste), perché è lì che la maggior parte dei modelli rivela la verità.
Cosa c'è di nuovo in Wan 2.6 (in parole semplici)
1) Uno storytelling su più inquadrature che non sembra un collage
La grande differenza è che Wan 2.6 è più propenso a trattare il prompt come una sequenza.
Invece di affidare tutto a una sola angolazione, puoi descrivere una breve catena di inquadrature, e spesso il modello mantiene:
- la stessa atmosfera dell'ambiente
- gli stessi tratti distintivi del soggetto
- la sensazione coerente di "un unico momento che si sviluppa"
Ecco il tipo di struttura a cui ha risposto bene nei miei test:
- Inquadratura A (presentazione): dove siamo? Che atmosfera c'è?
- Inquadratura B (azione): cosa cambia? Chi si muove?
- Inquadratura C (risoluzione): la reazione / il dettaglio / la rivelazione
Non è una grammatica cinematografica perfetta, ma è molto più vicina al "pianificato" che al "cucito insieme".
2) Un input di riferimento che conta davvero
I prompt testuali vanno bene finché non ti serve un ritmo molto specifico: il sobbalzo della camera a mano, un lento avanzamento, il ritmo da "vlog del weekend pigro" o quel montaggio serrato da spot pubblicitario.
Con Wan 2.6, usare una breve clip di riferimento non è solo un espediente. Nella pratica mi ha aiutata con:
- la cadenza del movimento (quanto velocemente "respira" la scena)
- le tendenze di inquadratura (quanto sta vicino al soggetto)
- la sensazione generale (un "tono" più coerente dall'inizio alla fine)
Ho usato un riferimento semplice: una breve clip girata camminando con il telefono (niente di speciale). Non ho chiesto a Wan 2.6 di replicare il video esatto, solo il ritmo e l'atteggiamento della camera.
Risultato: non ha ricalcato ogni singolo passo, ma l'energia era molto più vicina rispetto ai tentativi con il solo testo.
3) Output più lunghi che rendono possibili i momenti narrativi
Quei secondi in più non sono un vanto: sono pratici.
Se hai mai provato a mostrare premessa → cambiamento → reazione in una clip da 4 secondi, sai quanto è stretta. Con Wan 2.6 sono riuscita a far stare un vero micro-arco:
- presentare l'ambientazione
- introdurre l'azione del soggetto
- chiudere con una piccola svolta emotiva
È la differenza tra "un bel campione di movimento" e "qualcosa da pubblicare che sembra completo".
4) Il suono finalmente fa parte della scena, non è un ripensamento
La parte audio di Wan 2.6 (voce, ambiente, spunti musicali) non è "da studio di registrazione", ma è utile, soprattutto quando vuoi:
- un personaggio che parla in un breve sketch
- suoni d'ambiente che sostengano l'atmosfera
- tempi che sembrino voluti invece che casuali
La cosa che mi ha sorpresa: l'interpretazione a volte segue la battuta meglio di quanto mi aspettassi (pause, enfasi, piccoli movimenti del viso). È il tipo di dettaglio che fa sembrare una clip generata meno una demo.
Tabella rapida: cosa funziona bene e cosa va ancora guidato
| Ambito | Cosa ho visto nella pratica | Caso d'uso ideale |
|---|---|---|
| Prompt con più inquadrature | Spesso rispetta l'ordine delle inquadrature e tiene "unita" la scena | mini trailer, momenti narrativi, scene per i social |
| Controllo tramite riferimento | Bravo a mantenere ritmo e atteggiamento della camera | coerenza dell'atmosfera di brand, remake stilizzati |
| Coerenza dei personaggi | Migliore di molti modelli, soprattutto con tratti distintivi chiari | personaggi ricorrenti, mascotte, video brevi a episodi |
| Audio + dialoghi | "Abbastanza buono da pubblicare" per molti formati social | sketch, video esplicativi, clip narrative |
| Azione veloce | Arti e oggetti possono deformarsi nei movimenti ad alta velocità | evitala o mantieni l'azione leggibile |
| Testo a schermo | Ancora rischioso per ortografia e tipografia esatte | usa la post-produzione per i testi importanti |
I prompt che hanno funzionato meglio per me
A) La "formula semplice del regista"
Quando ho mantenuto il prompt strutturato, Wan 2.6 si è comportato in modo più prevedibile.
Formato
- Soggetto
- Azione
- Ambientazione
- Obiettivo / camera
- Atmosfera / luce
- (Facoltativo) Suono
Prompt di esempio
Un giovane chef impiatta dei noodles in una cucina calda. Il vapore sale con forza e appanna per un attimo gli occhiali. La camera parte da un piano medio e si avvicina lentamente. Luce al tungsteno morbida, atmosfera accogliente, leggera foschia sullo sfondo. Suoni naturali della cucina e una musica di sottofondo discreta.
Questo tipo di prompt dà al modello una "spina dorsale". Anche se i dettagli cambiano, la clip resta leggibile.
B) Prompt con più inquadrature (come lo scriverei davvero)
Ho evitato i termini di ripresa troppo tecnici. Ho scritto invece come una lista di inquadrature veloce.
Esempio
- [0-4s] Campo lungo: strada piovosa davanti a un piccolo minimarket, riflessi al neon sull'asfalto bagnato
- [4-9s] Piano medio: il protagonista esce, si sistema il cappuccio e guarda in fondo alla strada
- [9-15s] Primo piano: gocce di pioggia sulle ciglia, un breve sorriso mentre fuori campo arriva un taxi
Il modello non ha "obbedito" a ogni parola, ma ha mantenuto sorprendentemente bene la logica emotiva e l'identità della scena.
C) Prompt guidato da un riferimento (cosa ho imparato)
Usando una clip di riferimento, ho ottenuto i risultati migliori dicendo in modo esplicito cosa mantenere.
Esempio
Usa il riferimento per il movimento della camera e il ritmo. Ricrea la scena come un mercato notturno futuristico, con la luce calda delle lanterne e una leggera foschia. Mantieni la stessa sensazione di avanzamento. Un viaggiatore solitario attraversa l'inquadratura, calmo e attento.
Se non dici cosa mantenere, spesso otterrai qualcosa di "ispirato a" invece che di "guidato da".
Il mio flusso di lavoro sul campo (come userei Wan 2.6 senza impazzire)
Ecco il ciclo pratico che ha funzionato meglio:
- Scrivi la scena in una frase
- "Cosa succede, in parole umane?"
- Dividila in 2-3 inquadrature
- campo lungo → piano medio → primo piano basta e avanza
- Fissa i tratti distintivi
- colore dei capelli, elementi chiave dell'outfit, un oggetto unico
- Genera due varianti
- una "pulita", una con un linguaggio d'atmosfera un po' più marcato
- Scegli la base migliore
- non iterare troppo: è una trappola
- Solo a quel punto aggiungi dialoghi/audio
- tratta il suono come un secondo passaggio, non come il primo
Cosa non mi è piaciuto (perché niente è magia)
Qualche attrito, in tutta onestà:
-
I movimenti veloci possono ancora andare storti.
Se la scena si basa su interazioni fisiche complesse (mani + oggetti + velocità), rallentala o semplifica l'azione. -
I prompt troppo pieni si ritorcono contro.
Il modello va meglio quando la storia è chiara e le immagini sono controllate. Se accumuli cinque stili e tre momenti emotivi, potrebbe "farne la media" e tirarne fuori una poltiglia. -
Del testo a schermo non mi fiderei.
Per un fotogramma in stile poster con un'ortografia perfetta? Lo farei ancora altrove o lo sistemerei in post-produzione.
Niente di tutto questo è un ostacolo insormontabile. Cambia solo il modo di pianificare.
Per chi è davvero Wan 2.6
Secondo me Wan 2.6 ha più senso se:
- crei brevi clip narrative (sketch, micro-drama, momenti di storia)
- vuoi mantenere coerente un personaggio ricorrente tra un post e l'altro
- realizzi contenuti di brand in cui la "coerenza dell'atmosfera" conta più dello spettacolo fine a se stesso
- fai previsualizzazione/storyboard e vuoi qualcosa di guardabile, in fretta
Se ti serve solo un'esplosione di 3 secondi che faccia effetto, potresti non notare nemmeno la differenza.
Wan 2.6 brilla quando il risultato deve sembrare un momento completo.
In conclusione
Wan 2.6 non mi è sembrato un giochetto da festa. Mi è sembrato uno strumento che finalmente rispetta il modo in cui le persone pianificano davvero i video:
- scene, non clip isolate
- continuità, non fotogrammi fortunati
- ritmo, non solo belle texture
Non sostituisce una vera troupe e non salverà un'idea debole.
Ma se sai scrivere una scena semplice, Wan 2.6 si avvicina sorprendentemente a tradurla in qualcosa che sembra uno storytelling intenzionale.
Ed è la prima volta che lo dico di un modello video via web senza ridere un po'.



