LTX-2.5 : le modèle audio et vidéo intégré à tendre.AI
26 juin 2026
LTX-2.5 est le modèle de génération audio et vidéo qui propulse la partie vidéo de tendre.AI. Il appartient à la famille LTX des modèles de diffusion vidéo, et sa caractéristique principale est qu'il génère image et son ensemble, dans un seul modèle, plutôt que de produire un clip muet et de confier l'audio à un outil séparé. Cet article est une présentation technique accessible de son fonctionnement et de la façon dont tendre.AI l'intègre.
Pourquoi un modèle audio-vidéo conjoint change tout
L'ancienne approche pour obtenir un clip avec du son reposait sur un pipeline : un modèle vidéo génère les images, un modèle audio produit la piste, et tu les alignes à la main. Le problème, c'est précisément cet alignement. Un son généré sans "voir" le mouvement ne tombe jamais juste : un pas de pied décalé d'une demi-mesure, une voix qui ne colle pas aux lèvres, une ambiance qui ignore la scène.
LTX-2.5 supprime ce pipeline. Parce que le même modèle produit les images et l'audio, les deux sont cohérents par construction : la bande-son est conditionnée par le même contenu que l'image, si bien que le mouvement et le son sont synchronisés dès la première génération, sans rafistolage après coup.
L'architecture, en termes simples
LTX-2.5 est un diffusion transformer (DiT). Deux notions à comprendre :
- Diffusion signifie que le modèle part du bruit et le supprime étape par étape pour aboutir à un clip correspondant à ton prompt. C'est le même principe que les modèles d'image modernes comme SDXL, étendu à la dimension temporelle.
- Transformer signifie qu'il parcourt la séquence entière (sur l'ensemble des images et du flux audio) plutôt que de traiter chaque frame indépendamment. Cette vue globale est ce qui maintient le mouvement stable et l'audio verrouillé sur l'action tout au long du clip.
Travailler sur l'intégralité du clip en une passe, plutôt qu'image par image, est la raison principale pour laquelle le résultat reste cohérent : les objets gardent leur forme, le mouvement de caméra reste fluide, et le son suit l'image.
Texte vers vidéo et image vers vidéo
LTX-2.5 propose deux points d'entrée, et tendre.AI les utilise tous les deux :
- Texte vers vidéo : décris le plan, obtiens un clip avec son.
- Image vers vidéo : pars d'une image fixe que tu as déjà générée localement dans tendre.AI et anime-la. La première frame est ton image, donc le personnage et le style que tu as fixés (avec un LoRA ou une graine fixe) passent directement dans la vidéo.
L'image vers vidéo est ce qui rend réel le workflow "un seul outil pour image et vidéo" : la photo que tu adores devient la première frame du clip, même visage, même look.
Résolution : 1080p pour itérer, 4K pour les rendus finaux
Le même modèle cible plusieurs résolutions. En pratique, cela offre un workflow clair :
- 1080p (Full HD) pour itérer : assez rapide pour tester un prompt, écouter le résultat, ajuster et relancer.
- 4K (Ultra HD) pour les rendus finaux : quatre fois plus de pixels, pour les grands écrans ou pour avoir de la marge en recadrage et stabilisation en post-production.
Tu prépares en 1080p, tu valides le plan (mouvement, cadrage, audio), puis tu finalises le plan retenu en 4K, sans changer de moteur entre l'ébauche et la livraison.
L'efficacité, c'est l'essentiel
La famille LTX est connue pour être rapide pour sa qualité. Cette efficacité n'est pas une métrique de façade : c'est ce qui rend les ébauches 1080p rapides et les rendus 4K à la demande vraiment pratiques, plutôt que des tâches qui tournent toute la nuit. Un modèle suffisamment efficace pour itérer transforme ta façon de travailler : tu explores plus de prises parce que chacune coûte peu en temps.
Ce qu'apporte la version 2.5
Lightricks a publié LTX-2.5 avec des poids ouverts le 11 août 2026. Quatre de ses évolutions comptent pour quiconque génère vraiment des clips.
Scènes multi-plans natives. Le modèle peut rendre des plans enchaînés, large puis medium puis gros plan, en une seule génération, en maintenant le personnage, le décor, l'éclairage et la voix constants à travers les coupes. Avant, une séquence impliquait de rendre chaque plan séparément en espérant que le visage et la lumière se correspondent. C'est ce changement qui transforme un clip en une scène.
Un nouveau décodeur vidéo par diffusion. Le gain le plus visible sur les séquences ordinaires : moins d'artefacts dans les scènes à fort mouvement, là précisément où les versions précédentes bavaient. Une tête qui tourne vite, un panoramique rapide, des cheveux en mouvement, tout reste cohérent, tout en préservant le taux de compression élevé sur lequel la famille LTX repose.
Un meilleur encodeur de texte. La gestion des prompts passe à un encodeur Gemma 4 12B affiné, associé à un améliorateur de prompt dédié. En pratique, il lit des instructions complexes à plusieurs sujets à partir de prompts plus courts, ce qui te permet de moins surspécifier.
Durée automatique. La durée du clip est déduite de l'action décrite plutôt que définie manuellement en nombre de frames, et le 4K HDR natif fait maintenant partie du pipeline au lieu d'être un post-traitement.
Pour donner un ordre de grandeur : sur du matériel de datacenter, LTX-2.5 rend 10 secondes de 720p en moins de 7 secondes. C'est ce chiffre qui rend viable un rendu cloud facturé par clip.
Ce sont des capacités du moteur. Elles arrivent dans tendre.AI progressivement, version après version. Le changelog est la référence pour savoir ce qui est disponible dans la version que tu utilises.
Comment tendre.AI intègre LTX-2.5
tendre.AI applique sa règle habituelle : local en priorité, cloud uniquement pour les tâches lourdes que tu choisis.
- Les images restent 100% locales. Chaque image fixe est générée sur ton propre GPU, rien n'est envoyé.
- La vidéo LTX-2.5 tourne sur un GPU cloud, à la demande. L'audio synchronisé et surtout le 4K sont gourmands en calcul, ils sont donc exécutés sur un GPU distant et facturés par clip en crédits. C'est opt-in : si tu ne génères que des images, rien dans ton workflow local privé ne change.
- Les mêmes personnages dans les deux modes. Parce que la vidéo part de tes images locales, l'identité que tu as construite se retrouve dans le clip.
Note de migration : tendre.AI intègre activement LTX-2.5 dans l'application. La vidéo avec son, l'itération en 1080p et la finition en 4K arrivent progressivement au fur et à mesure de la migration. Le workflow d'image local n'est pas affecté.
La limite de contenu s'applique toujours
LTX-2.5 ne modifie pas la règle ferme de tendre.AI. Tout ce qui est généré est 100% synthétique : aucune personne réelle n'est représentée, et chaque sujet est clairement un adulte. Le modèle est un outil pour du contenu fictif, adulte et généré par IA, rien d'autre.
LTX-2.5 apporte audio et vidéo synchronisés, en 1080p et 4K, par-dessus un workflow d'image 100% local. Un seul outil pour l'image et la vidéo, sans abonnement.








