LTX-2.5: Il Modello Audio e Video di tendre.AI
26 giugno 2026
LTX-2.5 è il modello di generazione audio e video che alimenta i video all'interno di tendre.AI. Appartiene alla famiglia LTX di modelli di diffusione video e la sua caratteristica distintiva è che genera immagine e audio insieme, in un unico modello, invece di produrre una clip silenziosa e affidare l'audio a uno strumento separato. Questo articolo è un'analisi tecnica in linguaggio semplice su come funziona e come tendre.AI lo integra.
Perché un modello audio-video congiunto è importante
Il vecchio metodo per ottenere una clip con audio era una pipeline: un modello video genera i fotogrammi, un modello audio genera la traccia, e le allinei a mano. Il problema è l'allineamento. Un audio generato senza "vedere" il movimento non si sincronizza mai perfettamente: un passo in ritardo di mezzo beat, una voce che non corrisponde alla bocca, un'ambienza che ignora la scena.
LTX-2.5 elimina quella pipeline. Poiché lo stesso modello produce i fotogrammi e l'audio, i due sono coerenti per costruzione: la colonna sonora è condizionata sullo stesso contenuto dell'immagine, quindi movimento e suono sono sincronizzati fin dalla prima generazione, non rattoppati in seguito.
L'architettura, in termini semplici
LTX-2.5 è un diffusion transformer (DiT). Due idee che vale la pena capire:
- Diffusion significa che il modello parte dal rumore e lo rimuove passo dopo passo verso una clip che corrisponde al tuo prompt. È lo stesso principio alla base dei moderni modelli di immagine come SDXL, esteso al tempo.
- Transformer significa che presta attenzione all'intera sequenza (attraverso i fotogrammi e lungo lo stream audio) invece di trattare ogni fotogramma in modo indipendente. Quella visione globale è ciò che mantiene il movimento stabile e l'audio agganciato all'azione per tutta la durata della clip.
Lavorare sull'intera clip in una volta, invece che fotogramma per fotogramma, è il motivo principale per cui l'output rimane coerente: gli oggetti mantengono la loro forma, il movimento della telecamera rimane fluido e il suono segue l'immagine.
Testo-a-video e immagine-a-video
LTX-2.5 supporta due punti di ingresso, e tendre.AI li usa entrambi:
- Testo-a-video: descrivi la scena, ottieni una clip con audio.
- Immagine-a-video: parti da un'immagine fissa che hai già generato localmente in tendre.AI e animala. Il primo fotogramma è la tua immagine, quindi il personaggio e lo stile che hai definito (con una LoRA o un seed fisso) si trasportano direttamente nel video.
L'immagine-a-video è ciò che rende reale il flusso di lavoro "un unico strumento per immagini e video": la foto che ami diventa il fotogramma iniziale della clip, stessa faccia, stesso stile.
Risoluzione: 1080p per l'iterazione, 4K per i finali
Lo stesso modello punta a risoluzioni multiple. In pratica questo offre un flusso di lavoro pulito:
- 1080p (Full HD) per l'iterazione: abbastanza veloce da provare un prompt, ascoltare il risultato, regolare, e rieseguire.
- 4K (Ultra HD) per i render finali: quattro volte i pixel, per schermi grandi o per avere margine di crop e stabilizzazione in post-produzione.
Elabori in bozza a 1080p, blocchi la scena (movimento, inquadratura, audio), poi finisci il miglior risultato in 4K, senza cambiare motore tra bozza e consegna.
L'efficienza è il punto centrale
La linea LTX è nota per essere veloce rispetto alla sua qualità. Quell'efficienza non è una metrica di facciata: è ciò che rende pratici i draft rapidi in 1080p e i finali 4K su richiesta, invece di lavori da una notte. Un modello abbastanza efficiente da consentire l'iterazione cambia il modo in cui lavori: esplori più varianti perché ognuna costa poco in termini di tempo.
Cosa ha introdotto la versione 2.5
Lightricks ha rilasciato LTX-2.5 con pesi aperti l'11 agosto 2026. Quattro dei suoi cambiamenti sono importanti per chiunque generi effettivamente clip.
Scene multi-shot native. Il modello può rendere inquadrature collegate, largo poi medio poi primo piano, in una singola generazione, mantenendo il personaggio, l'ambientazione, l'illuminazione e la voce stabili attraverso i tagli. Prima, una sequenza significava rendere ogni inquadratura separatamente e sperare che la faccia e la luce corrispondessero. Questo è il cambiamento che trasforma una clip in una scena.
Un nuovo decoder video a diffusione. Il guadagno più visibile su filmati ordinari: meno artefatti nelle scene ad alto movimento, precisamente dove le versioni precedenti sbavano. Una testa che gira velocemente, una panoramica rapida, capelli in movimento, tutto tiene meglio insieme, mentre l'elevato rapporto di compressione su cui si basa la famiglia LTX viene preservato.
Un encoder di testo migliore. La gestione dei prompt è passata a un encoder Gemma 4 12B messo a punto abbinato a un potenziatore di prompt dedicato. In pratica legge istruzioni complesse e multi-soggetto da prompt più brevi, quindi passi meno tempo a over-specificare.
Durata automatica. La lunghezza della clip viene dedotta dall'azione che descrivi invece di essere impostata a mano in fotogrammi, e il 4K HDR nativo fa ora parte della pipeline invece di essere un post-processo.
Per dare un'idea della scala: su hardware datacenter, LTX-2.5 renderizza 10 secondi di 720p in meno di 7 secondi. Quel numero è ciò che rende praticabile il rendering cloud fatturato per clip.
Queste sono le capacità del motore. Arrivano in tendre.AI progressivamente, versione dopo versione. Il changelog è il riferimento per ciò che è attivo nella versione che stai usando.
Come tendre.AI integra LTX-2.5
tendre.AI applica la sua regola abituale: prima locale, cloud solo per il lavoro pesante che scegli tu.
- Le immagini rimangono 100% locali. Ogni immagine fissa viene generata sulla tua GPU, niente viene caricato.
- Il video LTX-2.5 gira su una GPU cloud, su richiesta. L'audio sincronizzato e specialmente il 4K richiedono molta potenza di calcolo, quindi girano su una GPU remota e vengono fatturati per clip in crediti. È opt-in: se generi solo immagini, niente del tuo flusso di lavoro locale privato cambia.
- Stessi personaggi in entrambi. Poiché il video parte dalle tue immagini locali, l'identità che hai costruito si trasferisce nella clip.
Nota sulla migrazione: tendre.AI sta integrando attivamente LTX-2.5 nell'app. Video con audio, iterazione in 1080p e finitura in 4K arrivano progressivamente man mano che la migrazione si completa. Il flusso di lavoro locale per le immagini non è interessato.
Il limite sui contenuti si applica ancora
LTX-2.5 non cambia la regola ferma di tendre.AI. Tutto ciò che viene generato è 100% sintetico: nessuna persona reale viene raffigurata, e ogni soggetto è inequivocabilmente adulto. Il modello è uno strumento per contenuti fittizi, per adulti, generati dall'AI, nient'altro.
LTX-2.5 porta audio e video sincronizzati, in 1080p e 4K, sopra un flusso di lavoro per immagini 100% locale. Un unico strumento per immagini e video, senza abbonamento.








