Hur skriver man en bra LTX-2.5-prompt (video med ljud)
2 juli 2026
Att prompta en videomodell är inte samma sak som att prompta en bildmodell. Med SDXL beskriver du ett fryst ögonblick. Med LTX-2.5 beskriver du ett rörligt klipp med ljud, vilket gör att två saker du aldrig behövt skriva om tidigare plötsligt spelar roll: rörelse och ljud. Får du dem rätt känns dina klipp genomtänkta; ignorerar du dem får du ett stelt, tyst bildspel. Den här guiden visar dig hur du skriver LTX-2.5-promptar som faktiskt rör sig och låter rätt.
Det enda misstaget du måste undvika: att prompta som ett bildverktyg
Det vanligaste nybörjarmisstaget är att beskriva en scen i stället för ett tagningsupplägg. "En kvinna i en röd klänning på ett kafé" är en bildprompt. LTX-2.5 renderar något, men utan rörelseinstruktion måste modellen gissa, och den gissar oftast litet (en liten huvudrörelse, en flimring). Resultatet blir ett nästan stillastående klipp.
Rätta till det genom att alltid svara på tre frågor som modellen inte kan härleda från en statisk beskrivning:
- Vad rör sig? (motivet, kameran eller båda)
- Hur beter sig kameran? (statisk, panorering, dolly, handhållen)
- Vad hör vi? (omgivningsljud, röst, effekter)
En promptformel som fungerar
Se en LTX-2.5-prompt som sex platser. Du behöver inte fylla alla sex varje gång, men ju fler du fyller i, desto mer kontroll får du:
Motiv + Handling/Rörelse + Kamera + Miljö/Ljussättning + Stil + Ljud
Exempel, plats för plats:
En ung kvinna i röd klänning (motiv) vänder sig mot kameran och ler (handling), långsam dolly-in (kamera), varmt gyllene timme-ljus genom ett fönster (miljö/ljussättning), cinematiskt, grunt skärpedjup (stil), mjukt rumsljud med ett svagt vinylknaster (ljud).
Den enda meningen berättar för LTX-2.5 vad som händer, hur det är filmat och hur det låter. Det är hela uppgiften.
Beskriv rörelse med verb
Rörelse lever i verb. Svaga promptar är fulla av substantiv och adjektiv; starka promptar lägger till handlingsord: vänder sig, går, lutar sig, sträcker sig, tippar, glänsar, andas, svajar, driver. Håll dig till en tydlig handling per kort klipp. Ett 5-sekunders klipp kan inte visa "hon reser sig, går till fönstret, öppnar det och tänder en cigarett", det är fyra tagningar. Be om ett ögonblick, landa det, generera sedan nästa.
Tala kamerans språk
LTX-2.5 förstår cinematografiska termer. Använd dem för att styra bilden:
- Bildstorlek: närbild, halvbild, halvfigur, totalbild.
- Kamerarörelse: statisk tagning, långsam panorering vänster, dolly-in, tracking shot, handhållen.
- Känsla: fast och stabil, eller subtil handhållen svajning för realism.
"Statisk tagning, närbild" är ett helt annat klipp än "handhållen tracking shot, totalbild", även med samma motiv. Bestäm kameran med avsikt.
Prompta ljudet, det är LTX-2.5:s superkraft
Eftersom LTX-2.5 genererar bild och ljud tillsammans kan du skriva ljudet direkt, och det bör du göra. Tre lager att tänka på:
- Omgivningsljud / rumsljud: "tyst rumsljud", "regn mot ett fönster", "avlägset stadsbuller", "vågor".
- Röst / dialog: beskriv framförandet ("en mjuk viskning", "ett varmt skratt") snarare än exakta ord om du vill ha det naturligt.
- Effekter: "fotsteg på trägolv", "en dörr knarrar", "vinylknaster", "en lätt bris".
Säger du ingenting om ljud fyller LTX-2.5 i det på egen hand, och det kanske inte stämmer med den stämning du ville ha. En kort ljudfras räcker oftast för att styra det.
Vad som förändrades med 2.5, och hur det påverkar dina promptar
Version 2.5 förändrade tre saker som direkt påverkar hur du skriver.
Du kan prompta en sekvens, inte bara en tagning. LTX-2.5 genererar inbyggda scener med flera tagningar: total, sedan halvbild, sedan närbild, i en enda generation, med karaktären, ljussättningen och rösten bibehållen över klippen. Beskriv alltså sekvensen i stället för att rendera tre klipp och försöka matcha dem. "Totalbild av henne på terrassen i skymningen, sedan halvbild när hon vänder sig mot dörren, sedan närbild på hennes ansikte när hon talar."
Kortare promptar fungerar nu bättre. Prompthanteringen har flyttats till en finjusterad Gemma 4 12B-enkodare med en dedikerad promptförbättrare, som läser komplexa instruktioner med flera motiv från färre ord. Den gamla reflexen att stapla tjugo kvalificerare för att tvinga fram ett resultat är nu kontraproduktiv: det begränsar modellen mer än det vägleder den. Säg det som spelar roll och droppa utfyllnaden.
Sluta räkna frames. Längden härleds från handlingen du beskriver. Skriv handlingen i sin naturliga längd, "hon häller upp kaffet, ser upp och ler", och låt modellen bestämma klippets längd. Att ange en längd för hand och sedan beskriva en handling som inte passar är hur du får ett slut som känns avhugget.
Text till video kontra bild till video
De två startpunkterna vill ha lite olika promptar:
- Text till video: du beskriver allt, inklusive motivet. Använd hela sexplatsformeln.
- Bild till video (rekommenderas i tendre.AI): din stillbild definierar redan motivet, utseendet och inramningen. Håll motivbeskrivningen lätt och lägg dina ord på rörelsen och ljudet du vill lägga till. Exempel ovanpå ett befintligt porträtt: "she slowly tilts her head, hair moving in a light breeze, subtle smile, static camera, soft breathing and distant city ambience". Du animerar, du omskriver inte.
Bild till video är den optimala startpunkten: karaktären du låste in lokalt (med en LoRA eller ett fast seed) följer direkt med in i klippet, samma ansikte, samma stil.
Iterera i 1080p, färdigställ i 4K
Promptar hittas, de skrivs inte. Drafta i 1080p så att varje tagning går snabbt: kör det, se och lyssna, ändra en sak (en tydligare kamerarörelse, ett tydligare ljudstöd), kör igen. När tagningen landar, rendera den slutgiltiga versionen i 4K. Ändra en variabel i taget så att du vet vad som faktiskt hjälpte.
Två exempel du kan anpassa
Text till video, cinematiskt:
Medium shot of a woman by a rain-streaked window, she turns her head slowly toward the camera and smiles, slow dolly-in, moody blue evening light, cinematic film grain, soft rain on glass and a low ambient hum.
Bild till video, från en lokal stillbild:
She breathes gently and blinks, a few strands of hair drift in a light breeze, static locked-off camera, shallow depth of field preserved, quiet room tone with a faint clock ticking.
Båda är korta, namnger en tydlig handling, ställer in kameran och ger ljudet en instruktion. Det är mönstret.
Gör och gör inte
- Gör namnge en handling, ett kamerabeteende och en ljudidé.
- Gör använda cinematografiska ord (närbild, dolly-in, handhållen).
- Gör inte stapla fyra handlingar i ett 5-sekunders klipp.
- Gör inte lämna ljudet tomt om stämningen spelar roll.
- Gör inte ombeskriv motivet i bild till video, animera det.
Hur det passar in i tendre.AI
I tendre.AI stannar bilder 100% lokalt på din egen GPU. LTX-2.5-video körs på en moln-GPU på begäran, fakturerat per klipp i credits, så du draftar bilder privat och spenderar bara credits när du animerar en bild du vill behålla. Eftersom videon startar från din lokala stillbild följer karaktären du byggt med in i klippet, samma ansikte, samma utseende, nu med rörelse och ljud.
Allt som genereras är 100% syntetiskt: ingen verklig person avbildas, och varje motiv är otvetydigt en vuxen.
Skriv rörelsen, skriv ljudet och låt LTX-2.5 animera stillbilden du genererade lokalt. 1080p för att iterera, 4K för att färdigställa, ingen prenumeration.








