LTX-2.5: Lyd- og videomodellen i tendre.AI

26. juni 2026

LTX-2.5 er den lyd- og videogenereringsmodel, der driver video i tendre.AI. Den tilhører LTX-familien af video-diffusionsmodeller, og dens afgørende egenskab er, at den genererer billede og lyd sammen, i én model, i stedet for at producere et lydløst klip og overlade lyden til et separat værktøj. Denne artikel er et teknisk, letforståeligt kig på, hvordan den fungerer, og hvordan tendre.AI integrerer den.

Hvorfor en samlet lyd- og videomodel er vigtig

Den gamle måde at få et klip med lyd på var en pipeline: en videomodel laver billederne, en lydmodel laver et spor, og du justerer dem manuelt. Problemet er synkronisering. Lyd, der er genereret uden at "se" bevægelsen, passer aldrig helt præcist: et fodtrin et halvt beat for sent, en stemme der ikke matcher munden, en baggrundslyd der ignorerer scenen.

LTX-2.5 fjerner den pipeline. Fordi den samme model producerer både billeder og lyd, er de to sammenhængende fra start: lydsporet er betinget af det samme indhold som billedet, så bevægelse og lyd er synkroniseret fra første generering og behøver ikke lappes bagefter.

Arkitekturen i klare termer

LTX-2.5 er en diffusion transformer (DiT). To begreber, der er værd at forstå:

  • Diffusion betyder, at modellen starter fra støj og fjerner støj trin for trin hen imod et klip, der matcher dit prompt. Det er det samme princip som bag moderne billedmodeller som SDXL, bare udvidet til tid.
  • Transformer betyder, at den arbejder over hele sekvensen (på tværs af billeder og lydstrøm) i stedet for at behandle hvert billede uafhængigt. Det globale overblik er det, der holder bevægelsen stabil og lyden låst til handlingen gennem hele klippets varighed.

At arbejde over hele klippet på én gang, frem for billede for billede, er den grundlæggende årsag til, at outputtet forbliver sammenhængende: objekter bevarer deres form, kamerabevægelsen forbliver jævn, og lyden følger billedet.

Tekst-til-video og billede-til-video

LTX-2.5 understøtter to indgangspunkter, og tendre.AI bruger begge:

  • Tekst-til-video: beskriv scenen, og få et klip med lyd.
  • Billede-til-video: start fra et stilbillede, du allerede har genereret lokalt i tendre.AI, og animer det. Det første billede er dit eget, så den karakter og stil, du har fastlåst (med en LoRA eller et fast seed), går direkte videre i videoen.

Billede-til-video er det, der gør "ét værktøj til billede og video"-arbejdsgangen reel: det billede, du elsker, bliver åbningsbilledet i klippet, samme ansigt, samme udtryk.

Opløsning: 1080p til iteration, 4K til det færdige produkt

Den samme model understøtter flere opløsninger. I praksis giver det en klar arbejdsgang:

  • 1080p (Full HD) til iteration: hurtigt nok til at afprøve et prompt, høre resultatet, justere og køre det igen.
  • 4K (Ultra HD) til endelige renderinger: fire gange så mange pixels, til store skærme eller plads til at beskære og stabilisere i post-produktion.

Du udkaster i 1080p, låser scenen fast (bevægelse, billedudsnit, lyd), og afslutter det endelige klip i 4K, uden at skifte motor mellem udkast og levering.

Effektivitet er pointen

LTX-linjen er kendt for at være hurtig i forhold til sin kvalitet. Den effektivitet er ikke et tomt tal: det er det, der gør hurtige 1080p-udkast og 4K-renderinger på forespørgsel praktiske i stedet for nattejobs. En model, der er effektiv nok til at iterere med, ændrer måden, du arbejder på. Du prøver flere varianter, fordi hver enkelt koster lidt tid.

Hvad version 2.5 bragte med sig

Lightricks udgav LTX-2.5 med åbne vægte den 11. august 2026. Fire af ændringerne er vigtige for alle, der faktisk genererer klip.

Native multi-shot-scener. Modellen kan rendere sammenhængende klip, bredt billede, derefter mellemplan, derefter nærbillede, i én enkelt generering, og holder karakter, miljø, belysning og stemme stabilt på tværs af klippene. Tidligere betød en sekvens, at man renderede hvert klip separat og håbede, at ansigt og lys matchede. Det er den ændring, der forvandler et klip til en scene.

En ny diffusion video decoder. Den mest synlige forbedring i almindelige optagelser: færre artefakter i scener med hurtig bevægelse, præcis der hvor tidligere versioner slørede. Et hoved, der drejer sig hurtigt, en hurtig panorering, hår i bevægelse, alt hænger bedre sammen, mens den høje kompressionskompression, som LTX-familien er afhængig af, bevares.

En bedre tekstencoder. Prompt-håndtering er flyttet til en finjusteret Gemma 4 12B-encoder parret med en dedikeret prompt enhancer. I praksis forstår den komplekse instruktioner med flere subjekter fra kortere prompts, så du bruger mindre tid på at over-specificere.

Automatisk varighed. Klippets længde udledes fra den handling, du beskriver, frem for at blive sat manuelt i antal billeder, og native 4K HDR er nu en del af pipelinen i stedet for en efterbehandling.

Som perspektiv: på datacenterhardware renderer LTX-2.5 10 sekunders 720p på under 7 sekunder. Det tal er det, der overhovedet gør cloud-rendering faktureret pr. klip levedygtigt.

Dette er egenskaber ved motoren. De kommer til tendre.AI løbende, release efter release. Changeloggen er referencen for, hvad der er aktivt i den version, du kører.

Sådan integrerer tendre.AI LTX-2.5

tendre.AI følger sin sædvanlige regel: lokalt først, cloud kun til den tunge del, du selv vælger.

  • Billeder forbliver 100% lokale. Alle stilbilleder genereres på din egen GPU, intet uploades.
  • LTX-2.5-video kører på en cloud-GPU efter behov. Synkroniseret lyd og især 4K kræver meget regnekraft, så de kører på en ekstern GPU og faktureres pr. klip i credits. Det er valgfrit: genererer du kun billeder, ændres der intet ved din private, lokale arbejdsgang.
  • Samme karakterer i begge dele. Fordi video starter fra dine lokale stilbilleder, følger den identitet, du har bygget op, med ind i klippet.

Migrationsnote: tendre.AI er i gang med at rulle LTX-2.5 ud i appen. Video med lyd, 1080p-iteration og 4K-afslutning kommer løbende, efterhånden som migrationen er færdig. Den lokale billedarbejdsgang er upåvirket.

Indholdsgrænsen gælder stadig

LTX-2.5 ændrer ikke tendre.AIs faste regel. Alt, der genereres, er 100% syntetisk: ingen rigtig person afbildes, og alle motiver er utvetydigt voksne. Modellen er et værktøj til fiktivt, voksent, AI-genereret indhold, intet andet.

Generer video med lyd i tendre.AI

LTX-2.5 bringer synkroniseret lyd og video, i 1080p og 4K, oven på en 100% lokal billedarbejdsgang. Ét værktøj til billede og video, intet abonnement.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)