LTX-2.5: модель аудио и видео внутри tendre.AI

26 июня 2026 г.

LTX-2.5 — это модель генерации аудио и видео, которая работает за кулисами видео в tendre.AI. Она принадлежит к семейству диффузионных видеомоделей LTX, а её главная особенность в том, что она генерирует картинку и звук вместе, в рамках одной модели, а не создаёт немой клип, оставляя аудио отдельному инструменту. В этой статье — доступное техническое объяснение того, как всё это устроено и как tendre.AI это интегрирует.

Почему объединённая модель аудио-видео так важна

Старый способ получить клип со звуком — это конвейер: видеомодель делает кадры, аудиомодель делает дорожку, и ты вручную их выравниваешь. Проблема — в синхронизации. Звук, сгенерированный без «просмотра» движения, никогда не попадает точно: шаг запаздывает на полтакта, голос не совпадает с движением губ, окружающий звук игнорирует происходящее в кадре.

LTX-2.5 убирает этот конвейер. Поскольку одна и та же модель производит и кадры, и аудио, они согласованы изначально: саундтрек обусловлен тем же контентом, что и картинка, поэтому движение и звук синхронизированы с первой генерации, а не склеиваются потом.

Архитектура — простыми словами

LTX-2.5 — это диффузионный трансформер (DiT). Два ключевых понятия, которые стоит понять:

  • Диффузия означает, что модель начинает с шума и шаг за шагом убирает его, двигаясь к клипу, соответствующему твоему промпту. Это тот же принцип, что лежит в основе современных моделей изображений вроде SDXL, только расширенный на временну́ю ось.
  • Трансформер означает, что модель учитывает всю последовательность (по кадрам и по аудиопотоку) вместо того, чтобы обрабатывать каждый кадр по отдельности. Этот глобальный охват — то, что делает движение стабильным, а аудио привязанным к действию на протяжении всего клипа.

Работа над полным клипом целиком, а не покадрово, — это основная причина того, что результат остаётся цельным: объекты сохраняют форму, движение камеры плавное, а звук следует за картинкой.

Текст в видео и изображение в видео

LTX-2.5 поддерживает две точки входа, и tendre.AI использует обе:

  • Текст в видео: описываешь кадр — получаешь клип со звуком.
  • Изображение в видео: берёшь стоп-кадр, который ты уже сгенерировал локально в tendre.AI, и анимируешь его. Первый кадр — это твоё изображение, поэтому персонаж и стиль, которые ты зафиксировал (с помощью LoRA или фиксированного сида), переносятся прямо в видео.

Именно изображение в видео делает рабочий процесс «один инструмент для фото и видео» реальным: картинка, которая тебе нравится, становится начальным кадром клипа — то же лицо, тот же стиль.

Разрешение: 1080p для итераций, 4K для финала

Одна и та же модель работает с несколькими разрешениями. На практике это даёт чистый рабочий процесс:

  • 1080p (Full HD) для итераций: достаточно быстро, чтобы попробовать промпт, услышать результат, поправить и запустить снова.
  • 4K (Ultra HD) для финального рендера: в четыре раза больше пикселей — для больших экранов или когда нужен запас для кадрирования и стабилизации при постобработке.

Ты набрасываешь вариант в 1080p, фиксируешь кадр (движение, компоновку, аудио), а затем рендеришь финальную версию в 4K, не переключая движок между черновиком и готовым результатом.

Эффективность — это главное

Линейка LTX известна тем, что она быстрая при своём качестве. Эта эффективность — не ради хвастовства: именно она делает быстрые черновики в 1080p и финальные рендеры 4K по запросу практичными, а не задачами на ночь. Модель, с которой удобно итерировать, меняет подход к работе: ты пробуешь больше вариантов, потому что каждый стоит мало времени.

Что принесла версия 2.5

Lightricks выпустила LTX-2.5 с открытыми весами 11 августа 2026 года. Четыре изменения важны для тех, кто реально генерирует клипы.

Нативные многопланные сцены. Модель умеет рендерить связанные планы — общий, средний, крупный — в одной генерации, сохраняя персонажа, локацию, освещение и голос стабильными на протяжении всех склеек. Раньше снять сцену означало рендерить каждый план отдельно и надеяться, что лицо и свет совпадут. Это то изменение, которое превращает клип в сцену.

Новый диффузионный декодер видео. Самый заметный выигрыш на обычных материалах: меньше артефактов в динамичных сценах — именно там, где предыдущие версии давали смазывание. Быстрый поворот головы, резкая панорама, движение волос — всё держится лучше, при этом высокая степень сжатия, на которую опирается семейство LTX, сохранена.

Улучшенный текстовый энкодер. Обработка промптов перешла к дообученному энкодеру Gemma 4 12B в паре с выделенным улучшителем промптов. На практике это означает, что модель считывает сложные, многосубъектные инструкции из коротких промптов, и тебе приходится меньше переуточнять.

Автоматическая длительность. Продолжительность клипа выводится из описанного действия, а не задаётся вручную в кадрах, а нативный 4K HDR теперь встроен в конвейер, а не является постпроцессом.

Для понимания масштаба: на дата-центровом железе LTX-2.5 рендерит 10 секунд 720p менее чем за 7 секунд. Именно этот показатель делает облачный рендеринг с оплатой за клип вообще жизнеспособным.

Это возможности движка. В tendre.AI они появляются постепенно, от релиза к релизу. Список изменений — главный источник информации о том, что доступно в версии, которую ты используешь.

Как tendre.AI интегрирует LTX-2.5

tendre.AI следует своему обычному правилу: локально прежде всего, облако только для тяжёлых задач, которые ты сам выбираешь.

  • Изображения остаются 100% локальными. Каждый стоп-кадр генерируется на твоём собственном GPU, ничего не загружается.
  • Видео на LTX-2.5 работает на облачном GPU по запросу. Синхронизированное аудио и особенно 4K — вычислительно тяжёлые задачи, поэтому они выполняются на удалённом GPU и списываются по кредитам за клип. Это опционально: если ты генерируешь только изображения, твой приватный локальный процесс никак не меняется.
  • Одни и те же персонажи в обоих режимах. Поскольку видео начинается с твоих локальных изображений, идентичность, которую ты создал, переносится в клип.

Примечание о миграции: tendre.AI активно внедряет LTX-2.5 в приложение. Видео со звуком, итерации в 1080p и финальный рендер в 4K появляются постепенно по мере завершения миграции. Локальный процесс работы с изображениями остаётся неизменным.

Контентные ограничения по-прежнему действуют

LTX-2.5 не отменяет жёсткое правило tendre.AI. Всё сгенерированное является 100% синтетическим: ни один реальный человек не изображается, а каждый персонаж однозначно является взрослым. Модель — это инструмент для вымышленного, взрослого, ИИ-сгенерированного контента, и только для него.

Генерируй видео со звуком в tendre.AI

LTX-2.5 обеспечивает синхронизированные аудио и видео в 1080p и 4K поверх 100% локального процесса работы с изображениями. Один инструмент для фото и видео, без подписки.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)