LTX-2.5: O Modelo de Áudio e Vídeo dentro do tendre.AI
26 de junho de 2026
O LTX-2.5 é o modelo de geração de áudio e vídeo que alimenta o vídeo dentro do tendre.AI. Pertence à família LTX de modelos de difusão de vídeo, e a sua característica distintiva é que gera imagem e som em conjunto, num único modelo, em vez de produzir um clip sem som e deixar o áudio para uma ferramenta separada. Este artigo é uma análise técnica em linguagem acessível sobre como funciona e como o tendre.AI o integra.
Porque é que um modelo conjunto de áudio e vídeo faz diferença
A forma antiga de obter um clip com som era uma pipeline: um modelo de vídeo gera os fotogramas, um modelo de áudio gera a faixa, e alinhas tudo à mão. O problema é o alinhamento. O som gerado sem "ver" o movimento nunca encaixa com precisão: um passo meio tempo atrasado, uma voz que não corresponde à boca, uma ambiência que ignora a cena.
O LTX-2.5 elimina essa pipeline. Como o mesmo modelo produz os fotogramas e o áudio, os dois são coerentes por construção: a banda sonora é condicionada pelo mesmo conteúdo que a imagem, por isso o movimento e o som ficam sincronizados desde a primeira geração, sem correções posteriores.
A arquitetura, em termos simples
O LTX-2.5 é um diffusion transformer (DiT). Duas ideias que vale a pena compreender:
- Difusão significa que o modelo parte do ruído e vai eliminando-o passo a passo até chegar a um clip que corresponde ao teu prompt. É o mesmo princípio dos modelos de imagem modernos como o SDXL, aplicado ao tempo.
- Transformer significa que o modelo atende à sequência completa (entre fotogramas e ao longo da faixa de áudio) em vez de tratar cada fotograma de forma independente. Essa visão global é o que mantém o movimento estável e o áudio sincronizado com a ação ao longo de todo o clip.
Trabalhar sobre o clip completo de uma só vez, em vez de fotograma a fotograma, é a razão fundamental pela qual o resultado se mantém coerente: os objetos conservam a sua forma, o movimento de câmara fica suave, e o som acompanha a imagem.
Texto-para-vídeo e imagem-para-vídeo
O LTX-2.5 suporta dois pontos de entrada, e o tendre.AI usa ambos:
- Texto-para-vídeo: descreves o plano e recebes um clip com som.
- Imagem-para-vídeo: partes de uma imagem fixa que já geraste localmente no tendre.AI e animas-a. O primeiro fotograma é a tua imagem, por isso a personagem e o estilo que definiste (com uma LoRA ou uma seed fixa) passam diretamente para o vídeo.
A imagem-para-vídeo é o que torna real o fluxo de trabalho de "uma ferramenta para imagem e vídeo": a imagem que gostas torna-se o fotograma inicial do clip, com a mesma cara e o mesmo aspeto.
Resolução: 1080p para iteração, 4K para finais
O mesmo modelo suporta várias resoluções. Na prática, isso oferece um fluxo de trabalho limpo:
- 1080p (Full HD) para iteração: rápido o suficiente para experimentar um prompt, ouvir o resultado, ajustar e correr novamente.
- 4K (Ultra HD) para renderizações finais: quatro vezes mais píxeis, para grandes ecrãs ou para ter margem para cortar e estabilizar em pós-produção.
Fazes o rascunho em 1080p, defines o plano (movimento, enquadramento, áudio), e depois finalizas o que queres guardar em 4K, sem mudar de motor entre o rascunho e a entrega.
A eficiência é o ponto central
A linha LTX é conhecida por ser rápida para a qualidade que oferece. Essa eficiência não é uma métrica de vaidade: é o que torna os rascunhos rápidos em 1080p e os finais em 4K a pedido uma realidade, em vez de trabalhos para a noite. Um modelo eficiente o suficiente para iterar muda a forma como trabalhas, exploras mais versões porque cada uma custa pouco tempo.
O que a versão 2.5 trouxe
A Lightricks lançou o LTX-2.5 com pesos abertos a 11 de agosto de 2026. Quatro das suas novidades importam para quem está a gerar clips.
Cenas multi-plano nativas. O modelo consegue renderizar planos encadeados, de grande plano para médio e depois para close-up, numa única geração, mantendo a personagem, o cenário, a iluminação e a voz estáveis ao longo dos cortes. Antes, uma sequência significava renderizar cada plano separadamente e torcer para que a cara e a luz correspondessem. É esta mudança que transforma um clip numa cena.
Um novo decoder de vídeo por difusão. O ganho mais visível em filmagens normais: menos artefactos em cenas com muito movimento, precisamente onde as versões anteriores apresentavam problemas. Uma cabeça a virar rapidamente, uma panorâmica rápida, cabelo a mover-se, tudo se mantém mais coeso, enquanto a alta taxa de compressão em que a família LTX assenta é preservada.
Um encoder de texto melhorado. O processamento de prompts passou para um encoder Gemma 4 12B com fine-tuning, acompanhado de um melhorador de prompts dedicado. Na prática, interpreta instruções complexas e com múltiplos sujeitos a partir de prompts mais curtos, por isso passas menos tempo a sobre-especificar.
Duração automática. A duração do clip é inferida a partir da ação que descreves, em vez de ser definida manualmente em fotogramas, e o 4K HDR nativo passou a fazer parte da pipeline em vez de ser um pós-processamento.
Para ter noção da escala: em hardware de datacenter, o LTX-2.5 renderiza 10 segundos de 720p em menos de 7 segundos. É esse número que torna viável a renderização na nuvem faturada por clip.
Estas são capacidades do motor. Chegam ao tendre.AI progressivamente, lançamento após lançamento. O changelog é a referência para o que está disponível na versão que estás a usar.
Como o tendre.AI integra o LTX-2.5
O tendre.AI aplica a sua regra habitual: local em primeiro lugar, nuvem apenas para o processamento pesado que escolhes.
- As imagens ficam 100% locais. Cada imagem fixa é gerada na tua própria GPU, nada é enviado.
- O vídeo LTX-2.5 corre numa GPU na nuvem, a pedido. O áudio sincronizado e sobretudo o 4K exigem muito processamento, por isso correm numa GPU remota e são faturados por clip em créditos. É opt-in: se gerares apenas imagens, nada no teu fluxo de trabalho local e privado muda.
- As mesmas personagens em ambos. Como o vídeo parte das tuas imagens locais, a identidade que construíste passa para o clip.
Nota de migração: o tendre.AI está a integrar ativamente o LTX-2.5 na aplicação. O vídeo com som, a iteração em 1080p e o acabamento em 4K chegam progressivamente à medida que a migração é concluída. O fluxo de trabalho local de imagens não é afetado.
A fronteira de conteúdo continua a aplicar-se
O LTX-2.5 não altera a regra firme do tendre.AI. Tudo o que é gerado é 100% sintético: nenhuma pessoa real é representada, e todos os sujeitos são inconfundivelmente adultos. O modelo é uma ferramenta para conteúdo fictício, adulto e gerado por IA, nada mais.
O LTX-2.5 traz áudio e vídeo sincronizados, em 1080p e 4K, por cima de um fluxo de trabalho de imagens 100% local. Uma ferramenta para imagem e vídeo, sem subscrição.








