Slik skriver du et godt LTX-2.5-prompt (video med lyd)

2. juli 2026

Å prompte en videomodell er ikke det samme som å prompte en bildemodell. Med SDXL beskriver du et fryst øyeblikk. Med LTX-2.5 beskriver du et bevegelig opptak med lyd, så to ting du aldri trengte å skrive før plutselig betyr noe: bevegelse og lyd. Får du disse riktig, føles klippene dine gjennomtenkte. Ignorerer du dem, ender du opp med et stivt, stille lysbildeshow. Denne guiden viser deg hvordan du skriver LTX-2.5-prompter som faktisk beveger seg og høres riktig ut.

Den ene feilen du må unngå: prompte som om det var et bilde

Den vanligste begynnerfeilen er å beskrive en scene i stedet for et opptak. "En kvinne i rød kjole på en kafé" er et bildeprompt. LTX-2.5 vil rendre noe, men uten noen bevegelsesanvisning må modellen gjette, og den gjetter vanligvis smått (en liten hodebevegelse, en flimring). Du ender opp med et nesten stillestående klipp.

Fiks det ved alltid å svare på tre spørsmål modellen ikke kan utlede fra en statisk beskrivelse:

  • Hva beveger seg? (motivet, kameraet eller begge)
  • Hvordan oppfører kameraet seg? (statisk, panorering, dolly, håndholdt)
  • Hva hører vi? (stemning, stemme, effekter)

En promptformel som fungerer

Tenk på et LTX-2.5-prompt som seks spor. Du trenger ikke alle seks hver gang, men jo flere du fyller ut, jo mer kontroll får du:

Motiv + Handling/Bevegelse + Kamera + Omgivelser/Lys + Stil + Lyd

Eksempel, spor for spor:

En ung kvinne i rød kjole (motiv) snur seg mot kameraet og smiler (handling), sakte dolly innover (kamera), varm gyllent timeslys gjennom et vindu (omgivelser/lys), filmaktig, grunt skarphetsdyp (stil), myk romklang med svak vinylknitring (lyd).

Den ene setningen forteller LTX-2.5 hva som skjer, hvordan det er filmet, og hvordan det høres ut. Det er hele jobben.

Beskriv bevegelse med verb

Bevegelse lever i verb. Svake prompter er fulle av substantiver og adjektiver. Sterke prompter legger til handlingsord: snur seg, går, lener seg, rekker ut, tilter, kikker, puster, svaier, driver. Hold det til én klar handling per kort klipp. Et 5-sekunders opptak kan ikke vise "hun reiser seg, går til vinduet, åpner det og tenner en sigarett", det er fire opptak. Be om ett øyeblikk, land det, og generer det neste.

Snakk kameraets språk

LTX-2.5 forstår kinematografiske begreper. Bruk dem til å styre bildet:

  • Billedutsnitt: nærbildet, halvtotal, total.
  • Kamerabevegelse: statisk opptak, sakte panorering til venstre, dolly innover, følgebevegelse, håndholdt.
  • Følelse: låst og stabilt, eller subtil håndholdt svaing for realisme.

"Statisk opptak, nærbilde" er et helt annet klipp enn "håndholdt følgekamera, total", selv med samme motiv. Bestem kameraet med vilje.

Prompt lyden, dette er LTX-2.5s superevne

Fordi LTX-2.5 genererer bilde og lyd sammen, kan du skrive lyden direkte, og det bør du. Tre lag å tenke på:

  • Stemning / romklang: "stille romklang", "regn mot et vindu", "fjern bytrafikk", "bølger".
  • Stemme / dialog: beskriv leveringen ("en myk hvisking", "en varm latter") heller enn eksakte ord hvis du vil ha det naturlig.
  • Effekter: "skritt på tre", "en dør knirker", "vinylknitring", "en mild bris".

Sier du ingenting om lyd, fyller LTX-2.5 det inn på egen hånd, og det passer kanskje ikke stemningen du ønsket. En kort lydbeskrivelse er vanligvis nok til å styre det.

Hva som endret seg med 2.5, og hvordan det påvirker promptene dine

Versjon 2.5 flyttet tre ting som direkte påvirker måten du skriver på.

Du kan prompte en sekvens, ikke bare ett opptak. LTX-2.5 genererer native fleropptak-scener: total, deretter halvtotal, deretter nærbilde, i én enkelt generering, med karakteren, lyset og stemmen holdt stabil på tvers av klippene. Beskriv sekvensen i stedet for å rendre tre klipp og prøve å matche dem. "Total av henne på terrassen i skumringen, deretter halvtotal når hun snur seg mot døren, deretter nærbilde av ansiktet hennes mens hun snakker."

Kortere prompter fungerer nå bedre. Prompthåndtering er flyttet til en finjustert Gemma 4 12B-enkoder med en dedikert promptforbedrer, som leser komplekse instruksjoner med flere motiver fra færre ord. Den gamle refleksen med å stable tjue kvalifikatorer for å tvinge frem et resultat er nå kontraproduktivt: det begrenser modellen mer enn det veileder den. Si det som betyr noe, dropp utfyllingen.

Slutt å telle frames. Varigheten utledes av handlingen du beskriver. Skriv handlingen i dens naturlige lengde, "hun heller kaffen, ser opp og smiler", og la modellen bestemme klippets størrelse. Å sette en lengde manuelt og deretter beskrive en handling som ikke passer, er hvordan du ender opp med en avslutning som føles avkuttet.

Tekst-til-video vs. bilde-til-video

De to inngangspunktene vil ha litt forskjellige prompter:

  • Tekst-til-video: du beskriver alt, inkludert motivet. Bruk den fullstendige sekspotsformelen.
  • Bilde-til-video (anbefalt i tendre.AI): stillbildet ditt definerer allerede motivet, utseendet og innrammingen. Hold motivbeskrivelsen lett og bruk ordene på bevegelsen og lyden du vil legge til. Eksempel på toppen av et eksisterende portrett: "she slowly tilts her head, hair moving in a light breeze, subtle smile, static camera, soft breathing and distant city ambience". Du animerer, ikke beskriver på nytt.

Bilde-til-video er søtpunktet: karakteren du låste inn lokalt (med en LoRA eller et fast seed) overføres direkte til klippet, samme ansikt, samme stil.

Iterer på 1080p, fullfør på 4K

Prompter finnes, ikke skrives. Utkast på 1080p så hvert forsøk går raskt: kjør det, se og lytt, endre én ting (en sterkere kamerabevegelse, et tydeligere lydspor), kjør igjen. Når opptaket lander, gjengir du det ferdige resultatet i 4K. Endre én variabel om gangen så du vet hva som faktisk hjalp.

To eksempler du kan tilpasse

Tekst-til-video, filmaktig:

Medium shot of a woman by a rain-streaked window, she turns her head slowly toward the camera and smiles, slow dolly-in, moody blue evening light, cinematic film grain, soft rain on glass and a low ambient hum.

Bilde-til-video, fra et lokalt stillbilde:

She breathes gently and blinks, a few strands of hair drift in a light breeze, static locked-off camera, shallow depth of field preserved, quiet room tone with a faint clock ticking.

Begge er korte, navngir én klar handling, setter kameraet og gir lyden én instruksjon. Det er mønsteret.

Gjør og gjør ikke

  • Gjør navngi én handling, én kameraoppførsel, én lydidé.
  • Gjør bruk kinematografiske ord (nærbilde, dolly innover, håndholdt).
  • Gjør ikke stable fire handlinger inn i ett 5-sekunders klipp.
  • Gjør ikke la lyden stå tom hvis stemningen betyr noe.
  • Gjør ikke beskriv motivet på nytt i bilde-til-video, animer det.

Hvordan dette passer inn i tendre.AI

I tendre.AI forblir bilder 100% lokale på din egen GPU. LTX-2.5-video kjører på en cloud-GPU på forespørsel, fakturert per klipp i credits, så du lager bilder privat og bruker bare credits når du animerer et ferdig resultat. Fordi video starter fra ditt lokale stillbilde, overføres karakteren du bygde til klippet, samme ansikt, samme utseende, nå med bevegelse og lyd.

Alt som genereres er 100% syntetisk: ingen virkelig person er avbildet, og hvert motiv er utvetydig en voksen.

Gjør om bildene dine til video med lyd

Skriv bevegelsen, skriv lyden, og la LTX-2.5 animere stillbildet du genererte lokalt. 1080p for å iterere, 4K for å fullføre, uten abonnement.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)