Comment écrire un bon prompt LTX-2.5 (vidéo avec son)
2 juillet 2026
Prompter un modèle vidéo, ce n'est pas comme prompter un modèle d'image. Avec SDXL tu décris un instant figé. Avec LTX-2.5 tu décris un plan en mouvement avec du son, donc deux choses que tu n'avais jamais à écrire auparavant deviennent soudain essentielles : le mouvement et l'audio. Maîtrise-les et tes clips semblent intentionnels ; ignore-les et tu obtiens un diaporama raide et silencieux. Ce guide te montre comment écrire des prompts LTX-2.5 qui bougent et sonnent vraiment bien.
L'erreur à éviter absolument : prompter comme une image
L'erreur la plus courante pour les débutants est de décrire une scène plutôt qu'un plan. "Une femme en robe rouge dans un café" est un prompt d'image. LTX-2.5 va générer quelque chose, mais sans indication de mouvement il doit deviner, et il devine généralement petit (un léger mouvement de tête, un scintillement). Tu te retrouves avec un clip presque immobile.
Corrige ça en répondant toujours à trois questions que le modèle ne peut pas déduire d'une description statique :
- Qu'est-ce qui bouge ? (le sujet, la caméra, ou les deux)
- Comment la caméra se comporte-t-elle ? (statique, panoramique, travelling, caméra portée)
- Qu'est-ce qu'on entend ? (ambiance, voix, effets)
Une formule de prompt qui fonctionne
Pense à un prompt LTX-2.5 comme six cases à remplir. Tu n'as pas besoin de toutes les six à chaque fois, mais plus tu en remplis, plus tu as de contrôle :
Sujet + Action/Mouvement + Caméra + Décor/Lumière + Style + Audio
Exemple, case par case :
Une jeune femme en robe rouge (sujet) se tourne vers la caméra et sourit (action), lent travelling avant (caméra), lumière chaude de fin d'après-midi à travers une fenêtre (décor/lumière), cinématographique, faible profondeur de champ (style), son de pièce doux avec un léger craquement de vinyle (audio).
Cette seule phrase dit à LTX-2.5 ce qui se passe, comment c'est filmé et à quoi ça ressemble. C'est tout ce qu'il faut.
Décris le mouvement avec des verbes
Le mouvement vit dans les verbes. Les prompts faibles sont remplis de noms et d'adjectifs ; les prompts forts ajoutent des mots d'action : se tourne, marche, se penche, tend la main, incline la tête, jette un regard, respire, se balance, dérive. Limite-toi à une action claire par clip court. Un plan de 5 secondes ne peut pas montrer "elle se lève, marche jusqu'à la fenêtre, l'ouvre et allume une cigarette", ce sont quatre plans. Demande un seul moment, réussis-le, puis génère le suivant.
Parle le langage de la caméra
LTX-2.5 comprend les termes cinématographiques. Utilise-les pour contrôler le cadre :
- Taille du plan : gros plan, plan moyen, plan large.
- Mouvement de caméra : plan fixe, lent panoramique gauche, travelling avant, plan de suivi, caméra portée.
- Sensation : stable et verrouillé, ou légère oscillation de caméra portée pour plus de réalisme.
"Plan fixe, gros plan" donne un clip complètement différent de "travelling de suivi caméra portée, plan large", même avec le même sujet. Choisis la caméra délibérément.
Prompts le son, c'est le superpouvoir de LTX-2.5
Parce que LTX-2.5 génère l'image et le son ensemble, tu peux écrire l'audio directement, et tu devrais. Trois couches à considérer :
- Ambiance / son de la pièce : "son de pièce calme", "pluie sur une fenêtre", "circulation urbaine lointaine", "vagues".
- Voix / dialogue : décris le rendu ("un doux murmure", "un rire chaleureux") plutôt que les mots exacts si tu veux quelque chose de naturel.
- Effets : "pas sur du bois", "une porte qui grince", "craquement de vinyle", "une légère brise".
Si tu ne dis rien sur l'audio, LTX-2.5 le remplit à sa façon, et il ne correspondra peut-être pas à l'ambiance souhaitée. Une courte phrase audio suffit généralement à l'orienter.
Ce qui a changé avec la version 2.5, et comment ça modifie tes prompts
La version 2.5 a fait évoluer trois choses qui affectent directement la façon dont tu écris.
Tu peux prompter une séquence, pas seulement un plan. LTX-2.5 génère des scènes multi-plans natifs : plan large, puis moyen, puis gros plan, en une seule génération, avec le personnage, la lumière et la voix maintenus de façon cohérente à travers les coupes. Décris donc la séquence plutôt que de générer trois clips séparément en essayant de les faire correspondre. "Plan large d'elle sur la terrasse au crépuscule, puis plan moyen quand elle se tourne vers la porte, puis gros plan de son visage quand elle parle."
Les prompts courts fonctionnent mieux maintenant. La gestion des prompts est passée à un encodeur Gemma 4 12B fine-tuné avec un optimiseur de prompt dédié, qui lit des instructions complexes à plusieurs sujets avec moins de mots. L'ancien réflexe d'empiler vingt qualificatifs pour forcer un résultat est désormais contre-productif : ça contraint le modèle plus que ça ne le guide. Dis ce qui compte, supprime le remplissage.
Arrête de compter les frames. La durée est déduite de l'action que tu décris. Écris l'action à sa longueur naturelle, "elle verse le café, lève les yeux et sourit", et laisse le modèle dimensionner le clip. Fixer une durée à la main puis décrire une action qui ne lui correspond pas, c'est comme ça qu'on obtient une fin qui semble coupée trop tôt.
Texte vers vidéo vs image vers vidéo
Les deux points d'entrée demandent des prompts légèrement différents :
- Texte vers vidéo : tu décris tout, y compris le sujet. Utilise la formule complète en six cases.
- Image vers vidéo (recommandé dans tendre.AI) : ta photo fixe définit déjà le sujet, l'apparence et le cadrage. Garde donc la description du sujet légère et consacre tes mots au mouvement et à l'audio que tu veux ajouter. Exemple sur un portrait existant : "elle incline doucement la tête, les cheveux qui bougent dans une légère brise, sourire subtil, caméra fixe, douce respiration et ambiance urbaine lointaine". Tu animes, tu ne re-décris pas.
L'image vers vidéo est le point idéal : le personnage que tu as verrouillé localement (avec un LoRA ou une graine fixe) passe directement dans le clip, même visage, même style.
Itère en 1080p, finalise en 4K
Les prompts se trouvent, ils ne s'écrivent pas d'un coup. Travaille en 1080p pour que chaque prise soit rapide : lance, regarde et écoute, change une seule chose (un mouvement de caméra plus fort, une indication audio plus claire), relance. Quand le plan est réussi, re-génère le meilleur en 4K. Change une variable à la fois pour savoir ce qui a vraiment aidé.
Deux exemples à adapter
Texte vers vidéo, cinématographique :
Plan moyen d'une femme près d'une fenêtre striée de pluie, elle tourne lentement la tête vers la caméra et sourit, lent travelling avant, lumière bleue et mélancolique du soir, grain de film cinématographique, douce pluie sur le verre et un léger bourdonnement ambiant.
Image vers vidéo, depuis une photo locale :
Elle respire doucement et cligne des yeux, quelques mèches de cheveux dérivent dans une légère brise, caméra fixe verrouillée, faible profondeur de champ préservée, son de pièce calme avec un léger tic-tac d'horloge.
Les deux sont courts, nomment une action claire, définissent la caméra et donnent au son une seule instruction. C'est le schéma à suivre.
À faire et à ne pas faire
- Fais nommer une action, un comportement de caméra, une idée audio.
- Fais utiliser des termes cinématographiques (gros plan, travelling avant, caméra portée).
- Ne fais pas empiler quatre actions dans un clip de 5 secondes.
- Ne fais pas laisser l'audio vide si l'ambiance compte.
- Ne fais pas re-décrire le sujet en image vers vidéo, anime-le.
Comment ça s'intègre dans tendre.AI
Dans tendre.AI, les images restent 100% locales sur ton propre GPU. La vidéo LTX-2.5 tourne sur un GPU cloud à la demande, facturé par clip en crédits, donc tu travailles tes images en privé et tu ne dépenses des crédits que quand tu animes un résultat réussi. Parce que la vidéo démarre depuis ta photo locale, le personnage que tu as créé passe dans le clip, même visage, même look, maintenant avec du mouvement et du son.
Tout ce qui est généré est 100% synthétique : aucune personne réelle n'est représentée, et chaque sujet est indéniablement un adulte.
Écris le mouvement, écris le son, et laisse LTX-2.5 animer la photo que tu as générée localement. 1080p pour itérer, 4K pour finaliser, sans abonnement.








