LTX-2.5: Ljud- och videomodellen i tendre.AI

26 juni 2026

LTX-2.5 är ljud- och videogenereringsmodellen som driver video i tendre.AI. Den tillhör LTX-familjen av videodiffusionsmodeller och dess utmärkande egenskap är att den genererar bild och ljud tillsammans, i en och samma modell, i stället för att producera ett tyst klipp och lämna ljudet till ett separat verktyg. Den här artikeln är en teknisk genomgång på vanlig svenska av hur det fungerar och hur tendre.AI integrerar det.

Varför en gemensam ljud- och videomodell spelar roll

Det gamla sättet att få ett klipp med ljud var en pipeline: en videomodell skapar bildrutorna, en ljudmodell skapar ett spår, och du justerar dem manuellt. Problemet är synkroniseringen. Ljud som genererades utan att "se" rörelsen landar aldrig exakt rätt: ett fotsteg en halvtakt för sent, en röst som inte matchar munnen, bakgrundsljud som ignorerar scenen.

LTX-2.5 tar bort den pipelinen. Eftersom samma modell producerar bildrutorna och ljudet är de två delarna sammanhängande från grunden: ljudspåret är konditionerat på samma innehåll som bilden, så rörelse och ljud är synkroniserade från den första genereringen, inte ihoplappade i efterhand.

Arkitekturen, förklarat på vanliga ord

LTX-2.5 är en diffusion transformer (DiT). Två idéer värda att förstå:

  • Diffusion innebär att modellen börjar från brus och avbrusrar steg för steg mot ett klipp som matchar din prompt. Det är samma princip som ligger bakom moderna bildmodeller som SDXL, utökad till tid.
  • Transformer innebär att den uppmärksammar hela sekvensen (över bildrutor och över ljudströmmen) i stället för att behandla varje bildruta för sig. Det globala perspektivet är det som håller rörelsen stabil och ljudet låst till handlingen under hela klippets längd.

Att arbeta över hela klippet på en gång, i stället för bildruta för bildruta, är den grundläggande anledningen till att resultatet förblir sammanhängande: objekt behåller sin form, kamerarörelser förblir mjuka, och ljudet följer bilden.

Text till video och bild till video

LTX-2.5 stöder två ingångspunkter, och tendre.AI använder båda:

  • Text till video: beskriv tagningen, få ett klipp med ljud.
  • Bild till video: börja från en stillbild du redan genererat lokalt i tendre.AI och animera den. Den första bildrutan är din bild, så den karaktär och stil du låst in (med en LoRA eller ett fast seed) förs direkt in i videon.

Bild till video är det som gör arbetsflödet "ett verktyg för bild och video" verkligt: bilden du älskar blir den inledande bildrutan i klippet, samma ansikte, samma look.

Upplösning: 1080p för iteration, 4K för slutresultat

Samma modell riktar in sig på flera upplösningar. I praktiken ger det ett tydligt arbetsflöde:

  • 1080p (Full HD) för iteration: tillräckligt snabbt för att testa en prompt, höra resultatet, justera och köra igen.
  • 4K (Ultra HD) för slutrenderingar: fyra gånger så många pixlar, för stora skärmar eller utrymme att beskära och stabilisera i efterbehandling.

Du skissar i 1080p, låser tagningen (rörelse, bildkomposition, ljud) och slutför sedan det bästa klippet i 4K, utan att byta motor mellan skiss och leverans.

Effektivitet är poängen

LTX-linjen är känd för att vara snabb för sin kvalitet. Den effektiviteten är inget fåfängt mätvärde: det är det som gör snabba 1080p-skisser och 4K-slutresultat på begäran praktiska i stället för projekt som tar natten i anspråk. En modell som är effektiv nog att iterera med förändrar hur du arbetar, du utforskar fler tagningar eftersom varje tagning kostar lite tid.

Vad version 2.5 tillförde

Lightricks släppte LTX-2.5 med öppna vikter den 11 augusti 2026. Fyra av förändringarna är viktiga för alla som faktiskt genererar klipp.

Inbyggda scener med flera tagningar. Modellen kan rendera sammanlänkade tagningar, bred, mellannära och närbild, i en enda generering, och håller karaktären, miljön, belysningen och rösten stabil mellan klippen. Tidigare innebar en sekvens att rendera varje tagning separat och hoppas att ansiktet och ljuset matchade. Det är den förändring som förvandlar ett klipp till en scen.

En ny diffusionsvideodekoder. Den mest synliga förbättringen på vanliga klipp: färre artefakter i scener med snabb rörelse, precis där tidigare versioner smetade ut bilden. Ett huvud som snabbt vänder sig, en snabb panorering, hår som rör sig, allt håller ihop bättre, samtidigt som det höga kompressionsförhållande som LTX-familjen förlitar sig på bevaras.

En bättre textenkodare. Prompthanteringen flyttades till en finjusterad Gemma 4 12B-enkodare parad med en dedikerad promptförbättrare. I praktiken läser den komplexa instruktioner med flera motiv från kortare promptar, så du behöver lägga mindre tid på att överspecificera.

Automatisk längd. Klipplängden härleds från den handling du beskriver i stället för att anges manuellt i bildrutor, och inbyggd 4K HDR är nu en del av pipelinen i stället för en efterbehandling.

För att ge skala: på datacenter-hårdvara renderar LTX-2.5 10 sekunder av 720p på under 7 sekunder. Det är det talet som gör molnrendering debiterad per klipp möjlig överhuvudtaget.

Det här är motorns kapaciteter. De når tendre.AI successivt, version för version. Ändringsloggen är referensen för vad som är aktivt i den version du kör.

Hur tendre.AI integrerar LTX-2.5

tendre.AI tillämpar sin vanliga regel: lokalt först, molnet bara för den tunga lyften du väljer.

  • Bilder stannar 100% lokalt. Varje stillbild genereras på ditt eget GPU, ingenting laddas upp.
  • LTX-2.5-video körs på ett moln-GPU, på begäran. Synkroniserat ljud och framför allt 4K är beräkningsintensivt, så de körs på ett fjärr-GPU och debiteras per klipp i krediter. Det är frivilligt: om du bara genererar bilder ändras ingenting i ditt privata lokala arbetsflöde.
  • Samma karaktärer i båda. Eftersom video börjar från dina lokala stillbilder bär den identitet du byggt upp med in i klippet.

Migreringsnotering: tendre.AI rullar aktivt ut LTX-2.5 i appen. Video med ljud, 1080p-iteration och 4K-slutbehandling landar successivt när migreringen slutförs. Det lokala bildarbetsflödet påverkas inte.

Innehållsgränsen gäller fortfarande

LTX-2.5 ändrar inte tendre.AIs fasta regel. Allt som genereras är 100% syntetiskt: ingen verklig person avbildas, och varje motiv är otvetydigt en vuxen. Modellen är ett verktyg för fiktivt, vuxet, AI-genererat innehåll, inget annat.

Generera video med ljud i tendre.AI

LTX-2.5 ger synkroniserat ljud och video, i 1080p och 4K, ovanpå ett 100% lokalt bildarbetsflöde. Ett verktyg för bild och video, utan prenumeration.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)