Como Escrever um Bom Prompt para LTX-2.5 (Vídeo com Som)

2 de julho de 2026

Escrever prompts para um modelo de vídeo não é o mesmo que escrever prompts para um modelo de imagem. Com o SDXL descreves um momento congelado. Com o LTX-2.5 descreves um plano em movimento com som, por isso duas coisas que nunca tinhas escrito antes passam a ser essenciais: movimento e áudio. Acerta nesses dois pontos e os teus clips parecem intencionais; ignora-os e ficas com um slideshow rígido e silencioso. Este guia mostra-te como escrever prompts para LTX-2.5 que realmente se movem e soam bem.

O erro que tens de evitar: fazer prompts como se fosse uma imagem

O erro mais comum entre iniciantes é descrever uma cena em vez de um plano. "Uma mulher de vestido vermelho num café" é um prompt de imagem. O LTX-2.5 vai renderizar alguma coisa, mas sem uma indicação de movimento tem de adivinhar, e geralmente adivinha pouco (um ligeiro movimento de cabeça, um piscar). O resultado é um clip quase estático.

Resolve isso respondendo sempre a três perguntas que o modelo não consegue inferir a partir de uma descrição estática:

  • O que se move? (o sujeito, a câmara, ou ambos)
  • Como se comporta a câmara? (estática, panorâmica, dolly, câmara na mão)
  • O que se ouve? (ambiente, voz, efeitos)

Uma fórmula de prompt que funciona

Pensa num prompt para LTX-2.5 como tendo seis partes. Não precisas de preencher as seis de cada vez, mas quanto mais preencheres, mais controlo tens:

Sujeito + Ação/Movimento + Câmara + Cenário/Iluminação + Estilo + Áudio

Exemplo, parte por parte:

Uma jovem de vestido vermelho (sujeito) vira-se para a câmara e sorri (ação), dolly-in lento (câmara), luz quente de hora dourada através de uma janela (cenário/iluminação), cinematográfico, profundidade de campo reduzida (estilo), tom de sala suave com um leve crepitar de vinil (áudio).

Essa única frase diz ao LTX-2.5 o que acontece, como é filmado e como soa. É tudo o que precisas.

Descreve o movimento com verbos

O movimento vive nos verbos. Prompts fracos são cheios de substantivos e adjetivos; prompts fortes acrescentam palavras de ação: vira-se, caminha, inclina-se, estende a mão, inclina a cabeça, olha de relance, respira, balança, desliza. Fica com uma ação clara por clip curto. Um plano de 5 segundos não consegue mostrar "ela levanta-se, vai à janela, abre-a e acende um cigarro", isso são quatro planos. Pede um único momento, consegue-o, e depois gera o próximo.

Fala a linguagem da câmara

O LTX-2.5 entende termos cinematográficos. Usa-os para controlar o enquadramento:

  • Tamanho do plano: grande plano, plano médio, plano geral.
  • Movimento de câmara: plano estático, panorâmica lenta para a esquerda, dolly-in, plano de seguimento, câmara na mão.
  • Sensação: estático e estável, ou ligeiro balanço de câmara na mão para realismo.

"Plano estático, grande plano" é um clip completamente diferente de "plano de seguimento com câmara na mão, plano geral", mesmo com o mesmo sujeito. Decide a câmara de forma consciente.

Faz o prompt do som, este é o superpoder do LTX-2.5

Como o LTX-2.5 gera imagem e som em conjunto, podes escrever o áudio diretamente, e deves fazê-lo. Três camadas a considerar:

  • Ambiente / tom de sala: "tom de sala silencioso", "chuva numa janela", "trânsito da cidade ao longe", "ondas".
  • Voz / diálogo: descreve a forma de falar ("um sussurro suave", "uma gargalhada calorosa") em vez de palavras exatas, se quiseres algo natural.
  • Efeitos: "passos em madeira", "uma porta range", "crepitar de vinil", "uma brisa suave".

Se não disseres nada sobre o áudio, o LTX-2.5 preenche por conta própria, e pode não corresponder ao ambiente que querias. Uma curta frase de áudio é normalmente suficiente para o orientar.

O que mudou com a versão 2.5 e como isso muda os teus prompts

A versão 2.5 alterou três coisas que afetam diretamente a forma como escreves.

Podes fazer o prompt de uma sequência, não apenas de um plano. O LTX-2.5 gera cenas com múltiplos planos nativos: geral, depois médio, depois grande plano, numa única geração, com a personagem, a iluminação e a voz mantidas constantes ao longo dos cortes. Por isso, descreve a sequência em vez de renderizares três clips e tentares combiná-los. "Plano geral dela no terraço ao anoitecer, depois plano médio à medida que se vira para a porta, depois grande plano do rosto enquanto fala."

Prompts mais curtos funcionam melhor agora. O processamento de prompts passou para um encoder Gemma 4 12B ajustado com um melhorador de prompts dedicado, que lê instruções complexas com múltiplos sujeitos a partir de menos palavras. O velho reflexo de acumular vinte qualificadores para forçar um resultado é agora contraproducente: limita o modelo mais do que o orienta. Diz o que é importante e elimina o que é supérfluo.

Pára de contar fotogramas. A duração é inferida a partir da ação que descreves. Escreve a ação com a sua duração natural, "ela serve o café, olha para cima e sorri", e deixa o modelo dimensionar o clip. Definir uma duração manualmente e depois descrever uma ação que não cabe nela é a receita para um final que parece cortado.

Texto para vídeo vs imagem para vídeo

Os dois pontos de entrada pedem prompts ligeiramente diferentes:

  • Texto para vídeo: descreves tudo, incluindo o sujeito. Usa a fórmula completa de seis partes.
  • Imagem para vídeo (recomendado no tendre.AI): a tua imagem estática já define o sujeito, o aspeto visual e o enquadramento. Por isso, mantém a descrição do sujeito simples e usa as tuas palavras para o movimento e o áudio que queres acrescentar. Exemplo sobre um retrato existente: "ela inclina lentamente a cabeça, o cabelo a mover-se com uma brisa suave, sorriso subtil, câmara estática, respiração suave e ambiente urbano distante". Estás a animar, não a voltar a descrever.

A imagem para vídeo é o ponto ideal: a personagem que definiste localmente (com um LoRA ou uma seed fixa) passa diretamente para o clip, o mesmo rosto, o mesmo estilo.

Itera a 1080p, termina a 4K

Os prompts encontram-se, não se escrevem de uma vez. Faz os rascunhos a 1080p para que cada tentativa seja rápida: executa, vê e ouve, muda uma coisa (um movimento de câmara mais forte, uma indicação de áudio mais clara), executa de novo. Quando o plano estiver certo, volta a renderizá-lo a 4K. Muda uma variável de cada vez para saberes o que realmente ajudou.

Dois exemplos que podes adaptar

Texto para vídeo, cinematográfico:

Plano médio de uma mulher junto a uma janela com chuva, vira lentamente a cabeça para a câmara e sorri, dolly-in lento, luz azul e sombria de fim de tarde, grão de filme cinematográfico, chuva suave no vidro e um zumbido ambiente baixo.

Imagem para vídeo, a partir de uma imagem local:

Ela respira suavemente e pisca os olhos, algumas madeixas de cabelo flutuam com uma brisa suave, câmara estática e travada, profundidade de campo reduzida preservada, tom de sala silencioso com um leve tique-taque de relógio.

Ambos são curtos, nomeiam uma ação clara, definem a câmara e dão uma instrução ao som. É esse o padrão.

O que fazer e o que não fazer

  • Faz menção a uma ação, um comportamento de câmara e uma ideia de áudio.
  • Usa palavras cinematográficas (grande plano, dolly-in, câmara na mão).
  • Não acumules quatro ações num único clip de 5 segundos.
  • Não deixes o áudio em branco se o ambiente for importante.
  • Não voltes a descrever o sujeito na imagem para vídeo, anima-o.

Como isto se encaixa no tendre.AI

No tendre.AI, as imagens ficam 100% locais no teu próprio GPU. O vídeo LTX-2.5 corre num GPU cloud a pedido, cobrado por clip em créditos, por isso podes fazer rascunhos de imagens de forma privada e só gastas créditos quando animares uma imagem que vale a pena. Como o vídeo começa a partir da tua imagem local, a personagem que criaste passa para o clip, o mesmo rosto, o mesmo aspeto, agora com movimento e som.

Tudo o que é gerado é 100% sintético: nenhuma pessoa real é retratada, e todos os sujeitos são claramente adultos.

Transforma as tuas imagens em vídeo com som

Escreve o movimento, escreve o som e deixa o LTX-2.5 animar a imagem que geraste localmente. 1080p para iterar, 4K para terminar, sem subscrição.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)