LTX-2.5: El modelo de audio y vídeo de tendre.AI
26 de junio de 2026
LTX-2.5 es el modelo de generación de audio y vídeo que impulsa los clips dentro de tendre.AI. Pertenece a la familia LTX de modelos de difusión de vídeo y su característica definitoria es que genera imagen y sonido a la vez, en un solo modelo, en lugar de producir un clip mudo y dejar el audio para una herramienta aparte. Este artículo es una mirada técnica en lenguaje sencillo a cómo funciona y cómo lo integra tendre.AI.
Por qué importa un modelo conjunto de audio y vídeo
La forma antigua de obtener un clip con sonido era un proceso en cadena: un modelo de vídeo genera los fotogramas, un modelo de audio genera la pista, y tú los alineas a mano. El problema es la sincronización. El sonido que se genera sin "ver" el movimiento nunca encaja del todo: un paso medio tiempo tarde, una voz que no coincide con la boca, un ambiente que ignora la escena.
LTX-2.5 elimina ese proceso en cadena. Como el mismo modelo produce los fotogramas y el audio, los dos son coherentes desde el principio: la banda sonora está condicionada por el mismo contenido que la imagen, de modo que movimiento y sonido están sincronizados desde la primera generación, no parcheados a posteriori.
La arquitectura, en términos sencillos
LTX-2.5 es un diffusion transformer (DiT). Dos ideas que merece la pena entender:
- Difusión significa que el modelo parte del ruido y lo elimina paso a paso hasta obtener un clip que coincide con tu prompt. Es el mismo principio que hay detrás de los modelos de imagen modernos como SDXL, extendido al tiempo.
- Transformer significa que atiende a la secuencia completa (a través de fotogramas y a través de la pista de audio) en lugar de tratar cada fotograma de forma independiente. Esa visión global es lo que mantiene el movimiento estable y el audio sincronizado con la acción durante toda la duración del clip.
Trabajar sobre el clip completo de una vez, en lugar de fotograma a fotograma, es la razón principal por la que el resultado se mantiene coherente: los objetos conservan su forma, el movimiento de cámara sigue siendo fluido y el sonido sigue a la imagen.
Texto a vídeo e imagen a vídeo
LTX-2.5 admite dos puntos de entrada, y tendre.AI usa ambos:
- Texto a vídeo: describe el plano, obtén un clip con sonido.
- Imagen a vídeo: parte de una imagen estática que ya generaste localmente en tendre.AI y anímala. El primer fotograma es tu imagen, de modo que el personaje y el estilo que estableciste (con un LoRA o una seed fija) pasan directamente al vídeo.
Imagen a vídeo es lo que hace real el flujo de trabajo de "una herramienta para imagen y vídeo": la foto que te encanta se convierte en el fotograma inicial del clip, mismo rostro, mismo aspecto.
Resolución: 1080p para iterar, 4K para el resultado final
El mismo modelo trabaja con varias resoluciones. En la práctica eso da un flujo de trabajo limpio:
- 1080p (Full HD) para iterar: lo suficientemente rápido para probar un prompt, escuchar el resultado, ajustarlo y volver a ejecutarlo.
- 4K (Ultra HD) para renders finales: cuatro veces los píxeles, para pantallas grandes o para tener margen de recorte y estabilización en posproducción.
Haces el borrador en 1080p, ajustas el plano (movimiento, encuadre, audio) y terminas el definitivo en 4K, sin cambiar de motor entre el borrador y la entrega.
La eficiencia es lo que importa
La línea LTX es conocida por ser rápida para su calidad. Esa eficiencia no es una métrica de vanidad: es lo que hace que los borradores rápidos en 1080p y los renders finales en 4K bajo demanda sean prácticos en lugar de trabajos de toda la noche. Un modelo lo suficientemente eficiente para iterar cambia cómo trabajas: exploras más tomas porque cada una es barata en tiempo.
Lo que trajo la versión 2.5
Lightricks publicó LTX-2.5 con pesos abiertos el 11 de agosto de 2026. Cuatro de sus cambios son relevantes para cualquiera que esté generando clips de verdad.
Escenas multi-plano nativas. El modelo puede renderizar planos conectados, de general a medio a primer plano, en una sola generación, manteniendo el personaje, el escenario, la iluminación y la voz estables a través de los cortes. Antes, una secuencia implicaba renderizar cada plano por separado y esperar que el rostro y la luz coincidieran. Este cambio es el que convierte un clip en una escena.
Un nuevo decodificador de vídeo por difusión. La ganancia más visible en metraje ordinario: menos artefactos en escenas de mucho movimiento, justo donde las versiones anteriores fallaban. Una cabeza que gira rápidamente, un paneo veloz, el cabello en movimiento, todo se mantiene mejor, mientras se conserva la alta tasa de compresión en la que se basa la familia LTX.
Un codificador de texto mejorado. El manejo de prompts pasó a un codificador Gemma 4 12B ajustado fino junto con un potenciador de prompts dedicado. En la práctica, lee instrucciones complejas con varios sujetos a partir de prompts más cortos, así que pasas menos tiempo especificando en exceso.
Duración automática. La duración del clip se infiere de la acción que describes en lugar de establecerse a mano en fotogramas, y el 4K HDR nativo ahora forma parte del proceso en lugar de ser un post-proceso.
Para hacerse una idea de la escala: en hardware de datacenter, LTX-2.5 renderiza 10 segundos de 720p en menos de 7 segundos. Ese número es lo que hace viable el renderizado en la nube facturado por clip.
Estas son capacidades del motor. Llegan a tendre.AI de forma progresiva, versión tras versión. El changelog es la referencia de lo que está activo en la versión que tienes instalada.
Cómo integra tendre.AI LTX-2.5
tendre.AI aplica su regla habitual: local primero, nube solo para el trabajo pesado que tú eliges.
- Las imágenes son 100% locales. Cada imagen estática se genera en tu propia GPU, nada se sube.
- El vídeo con LTX-2.5 se ejecuta en una GPU en la nube, bajo demanda. El audio sincronizado y especialmente el 4K requieren mucha potencia de cálculo, de modo que se ejecutan en una GPU remota y se facturan por clip en créditos. Es opcional: si solo generas imágenes, nada de tu flujo de trabajo local privado cambia.
- Los mismos personajes en ambos. Como el vídeo parte de tus imágenes locales, la identidad que construiste pasa al clip.
Nota de migración: tendre.AI está integrando activamente LTX-2.5 en la app. El vídeo con sonido, la iteración en 1080p y el acabado en 4K llegan de forma progresiva conforme avanza la migración. El flujo de trabajo local de imagen no se ve afectado.
El límite de contenido sigue vigente
LTX-2.5 no cambia la regla firme de tendre.AI. Todo lo que se genera es 100% sintético: no se representa a ninguna persona real, y todos los sujetos son inconfundiblemente adultos. El modelo es una herramienta para contenido ficticio, adulto y generado por IA, nada más.
LTX-2.5 ofrece audio y vídeo sincronizados, en 1080p y 4K, sobre un flujo de trabajo de imagen 100% local. Una sola herramienta para imagen y vídeo, sin suscripción.








