Kuinka kirjoittaa hyvä LTX-2.5-prompti (video äänellä)
2. heinäkuuta 2026
Videomallin promptittaminen ei ole sama asia kuin kuvamallin promptittaminen. SDXL:llä kuvailet pysähtyneen hetken. LTX-2.5:llä kuvailet liikkuvan kuvan äänellä, joten kaksi asiaa, joita et ole koskaan aiemmin kirjoittanut, nousevat yhtäkkiä tärkeiksi: liike ja ääni. Saat ne oikein, niin klippisi tuntuvat harkituilta. Jos jätät ne huomiotta, saat jäykän ja äänettömän diaesityksen. Tässä oppaassa näytän, kuinka kirjoittaa LTX-2.5-prompteja, jotka todella liikkuvat ja kuulostavat oikeilta.
Yksi virhe, jota kannattaa välttää: promptittaminen kuten kuvaa tehdessä
Yleisin aloittelijan virhe on kuvailla kohtausta eikä kuvaa. "Punapukuinen nainen kahvilassa" on kuvaprompt. LTX-2.5 renderöi jotain, mutta ilman liikevihjausta sen täytyy arvata, ja se yleensä arvaa pienen (pieni pään liike, välähdys). Tuloksena on lähes paikallaan pysyvä klippi.
Korjaa tämä vastaamalla aina kolmeen kysymykseen, joita malli ei osaa päätellä staattisesta kuvauksesta:
- Mikä liikkuu? (kohde, kamera vai molemmat)
- Miten kamera käyttäytyy? (staattinen, panorointi, dolly, käsivarakamera)
- Mitä kuulemme? (ambienssit, ääni, efektit)
Promptikaava, joka toimii
Ajattele LTX-2.5-promptia kuutena paikkana. Sinun ei tarvitse täyttää kaikkia kuutta joka kerta, mutta mitä enemmän täytät, sitä enemmän hallintaa saat:
Kohde + Toiminta/Liike + Kamera + Ympäristö/Valaistus + Tyyli + Ääni
Esimerkki paikka paikalta:
Nuori nainen punaisessa mekossa (kohde) kääntyy kameraa kohti ja hymyilee (toiminta), hidas dolly-in (kamera), lämmin kultaisen tunnin valo ikkunan läpi (ympäristö/valaistus), elokuvallinen, matala syväterävyys (tyyli), pehmeä huoneen ambienssit ja heikko vinyylin rätkintä (ääni).
Tuo yksi lause kertoo LTX-2.5:lle mitä tapahtuu, miten se kuvataan ja miltä se kuulostaa. Se on koko tehtävä.
Kuvaile liikettä verbeillä
Liike elää verbeissä. Heikot promptit ovat täynnä substantiiveja ja adjektiiveja. Vahvat promptit lisäävät toimintasanoja: kääntyy, kävelee, nojaa, kurottaa, kallistaa, vilkaisee, hengittää, huojuu, ajelehtii. Pidä se yhtenä selkeänä toimintona per lyhyt klippi. 5 sekunnin kuva ei voi näyttää "hän nousee ylös, kävelee ikkunalle, avaa sen ja sytyttää savukkeen" (se on neljä kuvaa). Pyydä yhtä kohtaa, toteuta se, sitten generoi seuraava.
Puhu kameran kieltä
LTX-2.5 ymmärtää elokuvauksen termejä. Käytä niitä kuvan hallintaan:
- Kuvan koko: lähikuva, puolikuva, laaja kuva.
- Kameran liike: staattinen kuva, hidas panorointi vasemmalle, dolly-in, seurantakuva, käsivarakamera.
- Tuntu: lukittu ja vakaa, tai hienovarainen käsivarahuojunta realismin lisäämiseksi.
"Staattinen kuva, lähikuva" on täysin erilainen klippi kuin "käsivaraseurantakuva, laaja", vaikka kohde olisi sama. Päätä kamera tarkoituksella.
Promptita ääni, tämä on LTX-2.5:n supervoimaa
Koska LTX-2.5 generoi kuvan ja äänen yhdessä, voit kirjoittaa äänen suoraan (ja sinun kannattaa). Kolme kerrosta mielessä pidettäväksi:
- Ambienssi / huoneääni: "hiljainen huoneäänimaisema", "sade ikkunaa vasten", "kaukainen kaupunkiliikenne", "aallot".
- Ääni / dialogi: kuvaile esitystapaa ("pehmeä kuiskaus", "lämmin nauru") eikä tarkkoja sanoja, jos haluat sen luonnolliseksi.
- Efektit: "askeleet puulla", "ovi narisee", "vinyylin rätkintä", "kevyt tuulenvire".
Jos et sano mitään äänestä, LTX-2.5 täyttää sen omillaan, eikä se välttämättä vastaa haluamaasi tunnelmaa. Yksi lyhyt äänilause riittää yleensä ohjaamaan sitä.
Mitä muuttui versiossa 2.5 ja miten se vaikuttaa prompteihisi
Versio 2.5 muutti kolmea asiaa, jotka vaikuttavat suoraan kirjoittamiseesi.
Voit promptittaa sekvenssin, ei vain yksittäistä kuvaa. LTX-2.5 generoi natiiveja moniottoiskohtauksia: laaja, sitten puolikuva, sitten lähikuva yhdessä generoinnissa, ja hahmo, valaistus ja ääni pysyvät yhtenäisinä leikkausten yli. Kuvaile siis sekvenssi sen sijaan, että renderöit kolme klippiä ja yrität sovittaa ne yhteen. "Laaja kuva hänestä terassilla hämärässä, sitten puolikuva kun hän kääntyy ovea kohti, sitten lähikuva hänen kasvoistaan kun hän puhuu."
Lyhyemmät promptit toimivat nyt paremmin. Promptin käsittely siirtyi hienosäädettyyn Gemma 4 12B -enkooderiin, jossa on omistettu prompttien parantaja. Se lukee monimutkaisia, moniaiheiset ohjeet vähemmistä sanoista. Vanha refleksi pinota kaksikymmentä täydennystä lopputuloksen pakottamiseksi on nyt haitallista: se rajoittaa mallia enemmän kuin ohjaa sitä. Sano se mikä on tärkeää, jätä täytteet pois.
Lopeta ruutujen laskeminen. Kesto johdetaan kuvailemastasi toiminnasta. Kirjoita toiminto sen luonnollisessa pituudessa, "hän kaataa kahvin, katsoo ylös ja hymyilee", ja anna mallin määrittää klipin koko. Jos asetat keston käsin ja kuvailet sitten toiminnon, joka ei sovi siihen, saat lopetuksen, joka tuntuu katkaistulta.
Teksti videoksi vs. kuva videoksi
Nämä kaksi lähtöpistettä haluavat hieman erilaisia prompteja:
- Teksti videoksi: kuvailet kaiken, myös kohteen. Käytä täyttä kuusipaikkaista kaavaa.
- Kuva videoksi (suositeltu tendre.AI:ssa): still-kuvasi määrittelee jo kohteen, ulkonäön ja rajauksen. Pidä kohteen kuvaus kevyenä ja käytä sanat haluamasi liikkeen ja äänen kuvailemiseen. Esimerkki olemassa olevan muotokuvan päälle: "hän kallistaa päätään hitaasti, hiukset liikkuvat kevyessä tuulessa, hienovarainen hymy, staattinen kamera, pehmeä hengitys ja kaukainen kaupunkiambienssi". Animoit, et kuvaa uudelleen.
Kuva videoksi on paras vaihtoehto: hahmo, jonka lukitsit paikallisesti (LoRA:lla tai kiinteällä siemenellä), siirtyy suoraan klippiin, sama kasvot, sama tyyli.
Iteroi 1080p:ssä, viimeistele 4K:ssa
Promptit löydetään, ei kirjoiteta. Luonnostele 1080p:ssä niin jokainen otto on nopea: aja se, katso ja kuuntele, muuta yhtä asiaa (vahvempi kameran liike, selkeämpi äänivihje), aja uudelleen. Kun kuva onnistuu, renderöi se uudelleen 4K:ssa. Muuta yhtä muuttujaa kerrallaan, niin tiedät mikä todella auttoi.
Kaksi esimerkkiä, joita voit mukauttaa
Teksti videoksi, elokuvallinen:
Puolikuva naisesta sateenpisaroiden peittämän ikkunan vieressä, hän kääntää päätään hitaasti kameraa kohti ja hymyilee, hidas dolly-in, alakuloinen sininen iltavalo, elokuvallinen filmiräke, pehmeä sade lasia vasten ja matala ympäristöhumina.
Kuva videoksi, paikallisesta still-kuvasta:
Hän hengittää kevyesti ja räpäyttää silmiään, muutama hiussuortu liukuu kevyessä tuulessa, staattinen lukittu kamera, matala syväterävyys säilytettynä, hiljainen huoneäänimaisema ja heikko kellon tikitys.
Molemmat ovat lyhyitä, nimeävät yhden selkeän toiminnon, asettavat kameran ja antavat äänelle yhden ohjeen. Se on kaava.
Tee ja älä tee
- Tee nimeä yksi toiminto, yksi kamerakäyttäytyminen, yksi äänidea.
- Tee käytä elokuvauksen sanoja (lähikuva, dolly-in, käsivarakamera).
- Älä pinoa neljää toimintoa yhteen 5 sekunnin klippiin.
- Älä jätä ääntä tyhjäksi jos tunnelma on tärkeä.
- Älä kuvaa kohdetta uudelleen kuva videoksi -tilassa, animoi se.
Kuinka tämä sopii tendre.AI:hin
tendre.AI:ssa kuvat pysyvät 100% paikallisesti omalla GPU:llasi. LTX-2.5-video pyörii pilvessä GPU:lla tarvittaessa, laskutetaan per klippi krediteissä, joten luonnostelet kuvat yksityisesti ja käytät kredittejä vain kun animoit valmiin kuvan. Koska video alkaa paikallisesta still-kuvastasi, rakentamasi hahmo siirtyy klippiin, sama kasvot, sama ulkonäkö, nyt liikkeellä ja äänellä.
Kaikki generoitu on 100% synteettistä: yhtään oikeaa henkilöä ei esitetä, ja jokainen hahmo on kiistatta aikuinen.
Kirjoita liike, kirjoita ääni, ja anna LTX-2.5:n animoida paikallisesti generoimasi still-kuva. 1080p iterointiin, 4K viimeistelyyn, ei tilausta.








