Cómo escribir un buen prompt para LTX-2.5 (vídeo con sonido)

2 de julio de 2026

Escribir prompts para un modelo de vídeo no es lo mismo que hacerlo para un modelo de imagen. Con SDXL describes un momento congelado. Con LTX-2.5 describes un plano en movimiento con sonido, así que dos cosas que nunca habías escrito antes cobran importancia de repente: el movimiento y el audio. Domínalos y tus clips parecerán intencionales; ignóralos y obtendrás un pase de diapositivas rígido y silencioso. Esta guía te muestra cómo escribir prompts para LTX-2.5 que de verdad se muevan y suenen bien.

El error que debes evitar: prompts de imagen para vídeo

El error más habitual entre quienes empiezan es describir una escena en lugar de un plano. "Una mujer con vestido rojo en una cafetería" es un prompt de imagen. LTX-2.5 generará algo, pero sin ninguna indicación de movimiento tendrá que adivinar, y casi siempre adivina poco (un pequeño movimiento de cabeza, un parpadeo). El resultado es un clip casi estático.

Solúcionalo respondiendo siempre tres preguntas que el modelo no puede inferir de una descripción estática:

  • ¿Qué se mueve? (el sujeto, la cámara o ambos)
  • ¿Cómo se comporta la cámara? (estática, panorámica, travelling, cámara en mano)
  • ¿Qué se escucha? (ambiente, voz, efectos)

Una fórmula de prompt que funciona

Piensa en un prompt de LTX-2.5 como seis bloques. No necesitas rellenarlos todos cada vez, pero cuantos más completes, mayor control tendrás:

Sujeto + Acción/Movimiento + Cámara + Escenario/Iluminación + Estilo + Audio

Ejemplo, bloque a bloque:

Una mujer joven con vestido rojo (sujeto) se gira hacia la cámara y sonríe (acción), travelling lento hacia adelante (cámara), luz cálida de hora dorada entrando por una ventana (escenario/iluminación), cinematográfico, poca profundidad de campo (estilo), tono de sala suave con un leve crujido de vinilo (audio).

Esa sola frase le dice a LTX-2.5 qué ocurre, cómo está filmado y cómo suena. Eso es todo lo que necesita.

Describe el movimiento con verbos

El movimiento vive en los verbos. Los prompts débiles están llenos de sustantivos y adjetivos; los prompts fuertes añaden palabras de acción: se gira, camina, se inclina, alcanza, ladea, mira de reojo, respira, se mece, flota. Limítate a una acción clara por clip corto. Un plano de 5 segundos no puede mostrar "ella se levanta, camina hasta la ventana, la abre y enciende un cigarrillo", eso son cuatro planos. Pide un solo momento, resuélvelo y luego genera el siguiente.

Habla el idioma de la cámara

LTX-2.5 entiende términos cinematográficos. Úsalos para controlar el encuadre:

  • Tamaño del plano: primer plano, plano medio, plano general.
  • Movimiento de cámara: plano estático, panorámica lenta a la izquierda, travelling de acercamiento, plano de seguimiento, cámara en mano.
  • Sensación: fija y estable, o ligero vaivén de cámara en mano para mayor realismo.

"Plano estático, primer plano" es un clip completamente distinto a "cámara en mano en travelling, plano general", aunque el sujeto sea el mismo. Decide la cámara de forma consciente.

Escribe el sonido: el superpoder de LTX-2.5

Como LTX-2.5 genera imagen y sonido a la vez, puedes escribir el audio directamente, y deberías hacerlo. Tres capas a tener en cuenta:

  • Ambiente/tono de sala: "tono de sala silencioso", "lluvia en una ventana", "tráfico urbano a lo lejos", "olas".
  • Voz/diálogo: describe la forma de hablar ("un susurro suave", "una carcajada cálida") en lugar de palabras exactas si quieres que suene natural.
  • Efectos: "pasos sobre madera", "una puerta que cruje", "crujido de vinilo", "una brisa suave".

Si no dices nada sobre el audio, LTX-2.5 lo rellena por su cuenta, y puede que no encaje con el ambiente que querías. Una frase corta de audio suele ser suficiente para orientarlo.

Qué cambió con la versión 2.5 y cómo afecta a tus prompts

La versión 2.5 introdujo tres cambios que afectan directamente a cómo escribes.

Puedes describir una secuencia, no solo un plano. LTX-2.5 genera escenas multiplano nativas: general, luego medio, luego primer plano, en una sola generación, manteniendo al personaje, la iluminación y la voz constantes entre los cortes. Así que describe la secuencia en lugar de renderizar tres clips e intentar combinarlos. "Plano general de ella en la terraza al atardecer, luego plano medio cuando se gira hacia la puerta, luego primer plano de su cara mientras habla."

Los prompts cortos funcionan mejor ahora. El procesamiento de prompts pasó a un codificador Gemma 4 12B ajustado con un potenciador de prompts dedicado, que lee instrucciones complejas con varios sujetos a partir de menos palabras. El viejo reflejo de apilar veinte calificadores para forzar un resultado es ahora contraproducente: restringe el modelo más de lo que lo guía. Di lo que importa y elimina el relleno.

Deja de contar fotogramas. La duración se infiere a partir de la acción que describes. Escribe la acción con su duración natural, "ella sirve el café, levanta la vista y sonríe", y deja que el modelo ajuste el clip. Establecer una duración a mano y luego describir una acción que no encaja es la receta para un final que parece cortado.

Texto a vídeo vs. imagen a vídeo

Los dos puntos de entrada requieren prompts ligeramente distintos:

  • Texto a vídeo: describes todo, incluido el sujeto. Usa la fórmula completa de seis bloques.
  • Imagen a vídeo (recomendado en tendre.AI): tu imagen fija ya define el sujeto, el aspecto y el encuadre. Así que mantén la descripción del sujeto ligera y dedica tus palabras al movimiento y el audio que quieres añadir. Ejemplo sobre un retrato existente: "ella ladea lentamente la cabeza, el pelo se mueve con una suave brisa, sonrisa discreta, cámara estática, respiración suave y ambiente urbano a lo lejos". Estás animando, no redescribiendo.

La imagen a vídeo es el punto óptimo: el personaje que definiste localmente (con un LoRA o una semilla fija) pasa directamente al clip, misma cara, mismo estilo.

Itera en 1080p, termina en 4K

Los prompts se encuentran, no se escriben. Trabaja en borrador a 1080p para que cada toma sea rápida: ejecútala, mírala y escúchala, cambia una cosa (un movimiento de cámara más marcado, una indicación de audio más clara), vuélvela a ejecutar. Cuando el plano funcione, renderiza la versión definitiva en 4K. Cambia una variable cada vez para saber qué fue lo que realmente ayudó.

Dos ejemplos que puedes adaptar

Texto a vídeo, cinematográfico:

Plano medio de una mujer junto a una ventana empañada por la lluvia, gira la cabeza lentamente hacia la cámara y sonríe, travelling lento de acercamiento, luz azul y melancólica de tarde, grano de película cinematográfico, lluvia suave sobre el cristal y un zumbido ambiente grave.

Imagen a vídeo, desde una imagen local:

Ella respira con suavidad y parpadea, algunos mechones de pelo se mueven con una brisa ligera, cámara estática y fija, poca profundidad de campo conservada, tono de sala silencioso con un leve tictac de reloj.

Ambos son cortos, nombran una acción clara, establecen la cámara y dan al sonido una sola instrucción. Ese es el patrón.

Lo que sí y lo que no

  • nombra una acción, un comportamiento de cámara y una idea de audio.
  • usa términos cinematográficos (primer plano, travelling de acercamiento, cámara en mano).
  • No apiles cuatro acciones en un clip de 5 segundos.
  • No dejes el audio en blanco si el ambiente importa.
  • No redescribas el sujeto en imagen a vídeo: anímalo.

Cómo encaja esto con tendre.AI

En tendre.AI, las imágenes se generan 100% localmente en tu propia GPU. El vídeo con LTX-2.5 funciona en una GPU en la nube bajo demanda, facturada por clip en créditos, así que generas imágenes de forma privada y solo gastas créditos cuando animas una imagen que vale la pena. Como el vídeo parte de tu imagen local, el personaje que creaste pasa al clip tal cual, misma cara, mismo aspecto, ahora con movimiento y sonido.

Todo lo generado es 100% sintético: no se representa a ninguna persona real, y todos los sujetos son claramente adultos.

Convierte tus imágenes en vídeo con sonido

Escribe el movimiento, escribe el sonido y deja que LTX-2.5 anime la imagen que generaste localmente. En 1080p para iterar, en 4K para el resultado final, sin suscripción.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)