Sådan skriver du et godt LTX-2.5-prompt (video med lyd)
2. juli 2026
At skrive prompts til en videomodel er ikke det samme som at skrive dem til en billedmodel. Med SDXL beskriver du et frossent øjeblik. Med LTX-2.5 beskriver du et bevægeligt shot med lyd, så to ting, du aldrig har skrevet om før, pludselig spiller en rolle: bevægelse og lyd. Får du dem rigtige, føles dine klip intentionelle. Ignorerer du dem, ender du med et stift, lydløst diasshow. Denne guide viser dig, hvordan du skriver LTX-2.5-prompts, der rent faktisk bevæger sig og lyder rigtigt.
Den ene fejl du skal undgå: at prompte som til et billede
Den mest almindelige begynderfejl er at beskrive en scene i stedet for et shot. "En kvinde i en rød kjole på en café" er et image-prompt. LTX-2.5 renderer noget, men uden et bevægelsessignal må den gætte, og den gætter typisk småt (en lille hovedbevægelse, et glimt). Du ender med et næsten stående klip.
Ret det ved altid at besvare tre spørgsmål, som modellen ikke kan udlede af en statisk beskrivelse:
- Hvad bevæger sig? (motivet, kameraet eller begge)
- Hvordan opfører kameraet sig? (statisk, pan, dolly, håndholdt)
- Hvad hører vi? (stemning, stemme, effekter)
En prompt-formel der virker
Tænk på et LTX-2.5-prompt som seks pladser. Du behøver ikke fylde alle seks hver gang, men jo flere du udfylder, jo mere kontrol får du:
Motiv + Handling/Bevægelse + Kamera + Setting/Lys + Stil + Lyd
Eksempel, plads for plads:
En ung kvinde i en rød kjole (motiv) vender sig mod kameraet og smiler (handling), langsom dolly-in (kamera), varmt guldtimeslys gennem et vindue (setting/lys), cinematisk, lavt skarphedsdybde (stil), blød rumklang med en svag vinylknitren (lyd).
Den ene sætning fortæller LTX-2.5, hvad der sker, hvordan det er filmet, og hvad det lyder som. Det er hele jobbet.
Beskriv bevægelse med verber
Bevægelse lever i verber. Svage prompts er fulde af substantiver og adjektiver. Stærke prompts tilføjer handlingsord: vender sig, går, læner sig, rækker ud, vipper, kigger, vejrtræker, svinger, driver. Hold dig til én tydelig handling per kort klip. Et 5-sekunders shot kan ikke vise "hun rejser sig, går hen til vinduet, åbner det og tænder en cigaret", det er fire shots. Bed om én beat, land den, og generer så den næste.
Tal kameraets sprog
LTX-2.5 forstår cinematografiske termer. Brug dem til at styre billedet:
- Shotsstørrelse: close-up, medium shot, wide shot.
- Kamerabevægelse: statisk shot, langsom pan til venstre, dolly-in, tracking shot, håndholdt.
- Fornemmelse: låst og stabilt, eller subtil håndholdt svaj for realisme.
"Statisk shot, close-up" er et helt andet klip end "håndholdt tracking shot, wide", selv med det samme motiv. Beslut kameraet med vilje.
Prompt lyden, det er LTX-2.5's superpower
Fordi LTX-2.5 genererer billede og lyd sammen, kan du skrive lyden direkte, og det bør du. Tre lag at tænke over:
- Stemning / rumklang: "stille rumklang", "regn mod et vindue", "fjern bytrafik", "bølger".
- Stemme / dialog: beskriv leveringen ("en blød hvisken", "en varm latter") frem for præcise ord, hvis du vil have det naturligt.
- Effekter: "fodtrin på træ", "en dør knirker", "vinylknitren", "en blid brise".
Siger du ingenting om lyden, fylder LTX-2.5 selv, og det matcher måske ikke den stemning, du ønskede. En kort lydsætning er som regel nok til at styre den.
Hvad der ændrede sig med 2.5, og hvordan det påvirker dine prompts
Version 2.5 har rykket tre ting, der direkte påvirker, hvordan du skriver.
Du kan prompte en sekvens, ikke bare et shot. LTX-2.5 genererer native multi-shot-scener: wide, så medium, så close-up, i én enkelt generering, med karakteren, lyset og stemmen holdt stabil på tværs af klipper. Så beskriv sekvensen frem for at rendere tre klip og forsøge at matche dem. "Wide shot af hende på terrassen i skumringen, så medium da hun vender sig mod døren, så close på hendes ansigt mens hun taler."
Kortere prompts virker nu bedre. Prompt-håndtering er flyttet til en finjusteret Gemma 4 12B-encoder med en dedikeret prompt-forbedrer, der læser komplekse, multi-subject-instruktioner ud af færre ord. Den gamle refleks med at stable tyve kvalifikatorer oven på hinanden for at tvinge et resultat er nu kontraproduktiv: det begrænser modellen mere, end det guider den. Sig det, der betyder noget, og drop fyldet.
Stop med at tælle frames. Varighed udledes af den handling, du beskriver. Skriv handlingen i dens naturlige længde, "hun hælder kaffen op, ser op og smiler", og lad modellen dimensionere klippet. Sætter du en længde manuelt og beskriver så en handling, der ikke passer til den, ender du med en slutning, der føles afskåret.
Tekst-til-video vs. billede-til-video
De to indgange vil have lidt forskellige prompts:
- Tekst-til-video: du beskriver alt, herunder motivet. Brug den fulde seks-plads-formel.
- Billede-til-video (anbefalet i tendre.AI): dit stillbillede definerer allerede motivet, looket og indramningen. Hold motivbeskrivelsen kort og brug dine ord på den bevægelse og lyd, du vil tilføje. Eksempel oven på et eksisterende portræt: "hun vipper langsomt hovedet, håret bevæger sig i en let brise, subtilt smil, statisk kamera, blid vejrtrækning og fjern byambiance". Du animerer, du genbeskriver ikke.
Billede-til-video er det søde punkt: den karakter, du har låst lokalt (med en LoRA eller et fast seed), bæres direkte over i klippet, samme ansigt, samme stil.
Iterer ved 1080p, færdiggør ved 4K
Prompts finder man, de skrives ikke. Draft ved 1080p, så hvert forsøg er hurtigt: kør det, se og lyt, skift én ting (en stærkere kamerabevægelse, et tydeligere lydsignal), kør igen. Når shottet lander, re-render keeperen i 4K. Skift én variabel ad gangen, så du ved, hvad der faktisk hjalp.
To eksempler du kan tilpasse
Tekst-til-video, cinematisk:
Medium shot af en kvinde ved et regnvådt vindue, hun drejer langsomt hovedet mod kameraet og smiler, langsom dolly-in, mørk blå aftenlys, cinematisk filmkorn, blød regn mod glas og en lav ambient summen.
Billede-til-video, fra et lokalt stillbillede:
Hun vejrtrækker blidt og blinker, et par hårstråde driver i en let brise, statisk låst kamera, lavt skarphedsdybde bevaret, stille rumklang med en svag tikken fra et ur.
Begge er korte, navngiver én tydelig handling, sætter kameraet og giver lyden én instruktion. Det er mønsteret.
Gør og gør ikke
- Gør navngiv én handling, én kameraopførsel, én lydidé.
- Gør brug cinematografiske ord (close-up, dolly-in, håndholdt).
- Gør ikke stabel fire handlinger ind i ét 5-sekunders klip.
- Gør ikke lad lyden stå blank, hvis stemningen har betydning.
- Gør ikke genbeskrive motivet i billede-til-video, animer det.
Sådan passer det ind i tendre.AI
I tendre.AI forbliver billeder 100% lokale på din egen GPU. LTX-2.5-video kører på en cloud GPU on demand, faktureret per klip i credits, så du drafter billeder privat og bruger kun credits, når du animerer en keeper. Fordi video starter fra dit lokale stillbillede, bæres den karakter, du har bygget, over i klippet, samme ansigt, samme look, nu med bevægelse og lyd.
Alt genereret er 100% syntetisk: ingen rigtig person er afbildet, og hvert motiv er umiskendeligt en voksen.
Skriv bevægelsen, skriv lyden, og lad LTX-2.5 animere det stillbillede, du genererede lokalt. 1080p til at iterere, 4K til at færdiggøre, intet abonnement.








