Как написать хороший промпт для LTX-2.5 (видео со звуком)

2 июля 2026 г.

Работа с видеомоделью — это не то же самое, что работа с моделью для генерации изображений. В SDXL ты описываешь застывший момент. В LTX-2.5 ты описываешь движущийся кадр со звуком, поэтому две вещи, о которых раньше не нужно было думать, становятся ключевыми: движение и аудио. Сделай их правильно — и клипы будут выглядеть осмысленно; проигнорируй — получишь жёсткое, беззвучное слайд-шоу. Это руководство покажет, как писать промпты для LTX-2.5, чтобы они действительно двигались и звучали как надо.

Главная ошибка, которую нужно избегать: промптить как для изображения

Самая распространённая ошибка новичка — описывать сцену вместо кадра. "Женщина в красном платье в кафе" — это промпт для изображения. LTX-2.5 что-то сгенерирует, но без указания движения ему придётся угадывать, и обычно он угадывает по минимуму (небольшое движение головы, мерцание). В итоге получается почти статичный клип.

Исправь это, всегда отвечая на три вопроса, которые модель не может вывести из статичного описания:

  • Что движется? (объект, камера или оба)
  • Как ведёт себя камера? (статично, панорама, долли, ручная съёмка)
  • Что мы слышим? (атмосфера, голос, эффекты)

Формула промпта, которая работает

Представь промпт для LTX-2.5 как шесть слотов. Не обязательно заполнять все шесть каждый раз, но чем больше заполнено, тем больше контроля у тебя:

Объект + Действие/Движение + Камера + Обстановка/Освещение + Стиль + Аудио

Пример по слотам:

A young woman in a red dress (subject) turns toward the camera and smiles (action), slow dolly-in (camera), warm golden-hour light through a window (setting/lighting), cinematic, shallow depth of field (style), soft room tone with a faint vinyl crackle (audio).

Одно предложение говорит LTX-2.5, что происходит, как это снято и как это звучит. Вот и вся задача.

Описывай движение глаголами

Движение живёт в глаголах. Слабые промпты полны существительных и прилагательных; сильные добавляют слова действия: turns, walks, leans, reaches, tilts, glances, breathes, sways, drifts. Оставляй одно чёткое действие на короткий клип. Пятисекундный кадр не может показать "она встаёт, подходит к окну, открывает его и закуривает" — это четыре кадра. Проси одно действие, добейся его, затем генерируй следующее.

Говори на языке камеры

LTX-2.5 понимает терминологию кинематографии. Используй её для управления кадром:

  • Размер кадра: крупный план, средний план, общий план.
  • Движение камеры: статичный кадр, медленная панорама влево, долли-ин, тревеллинг, ручная съёмка.
  • Ощущение: зафиксированная и стабильная камера или лёгкое покачивание ручной камеры для реализма.

"Статичный кадр, крупный план" — это совершенно другой клип, чем "ручная съёмка, тревеллинг, общий план", даже с тем же объектом. Выбирай положение камеры осознанно.

Задавай звук — это суперсила LTX-2.5

Поскольку LTX-2.5 генерирует изображение и звук вместе, ты можешь прописать аудио напрямую — и должен это делать. Три слоя, о которых стоит подумать:

  • Атмосфера / окружающий звук: "тихая комнатная атмосфера", "дождь на стекле", "далёкий городской шум", "волны".
  • Голос / диалог: описывай подачу ("тихий шёпот", "тёплый смех"), а не точные слова, если хочешь естественности.
  • Эффекты: "шаги по деревянному полу", "скрип двери", "треск винила", "лёгкий ветерок".

Если ты ничего не говоришь об аудио, LTX-2.5 заполнит его самостоятельно, и оно может не совпасть с нужным настроением. Обычно достаточно одной короткой фразы про звук, чтобы направить модель.

Что изменилось в 2.5 и как это влияет на твои промпты

Версия 2.5 изменила три вещи, которые напрямую влияют на то, как ты пишешь.

Теперь можно задавать последовательность, а не только кадр. LTX-2.5 генерирует нативные многокадровые сцены: общий, затем средний, затем крупный план — в одной генерации, с сохранением персонажа, освещения и голоса на всех монтажных переходах. Поэтому описывай последовательность, а не рендери три клипа и не пытайся их сшить. "Общий план на террасе в сумерках, затем средний, когда она поворачивается к двери, затем крупный на её лице, пока она говорит."

Более короткие промпты теперь работают лучше. Обработка промптов перешла к точно настроенному энкодеру Gemma 4 12B с выделенным усилителем промптов, который считывает сложные многообъектные инструкции из меньшего количества слов. Старая привычка громоздить двадцать уточнений, чтобы добиться нужного результата, теперь контрпродуктивна: это ограничивает модель больше, чем направляет. Говори о главном, убирай лишнее.

Перестань считать кадры. Длительность выводится из описанного действия. Пиши действие в его естественном темпе, "она наливает кофе, смотрит вверх и улыбается", и позволь модели подобрать длину клипа. Задавать длину вручную, а затем описывать действие, которое в неё не вписывается, — верный способ получить концовку, которая ощущается оборванной.

Текст в видео vs изображение в видео

Два режима требуют слегка разных промптов:

  • Текст в видео: ты описываешь всё, включая объект. Используй полную формулу из шести слотов.
  • Изображение в видео (рекомендуется в tendre.AI): твой стоп-кадр уже задаёт объект, внешний вид и кадрирование. Поэтому держи описание объекта лёгким и трать слова на движение и аудио, которые хочешь добавить. Пример поверх готового портрета: "she slowly tilts her head, hair moving in a light breeze, subtle smile, static camera, soft breathing and distant city ambience". Ты анимируешь, а не описываешь заново.

Режим изображение в видео — это золотая середина: персонаж, которого ты зафиксировал локально (с помощью LoRA или фиксированного сида), переходит прямо в клип с тем же лицом и тем же стилем.

Итерируй в 1080p, финализируй в 4K

Промпты находят, а не пишут. Работай в черновике при 1080p, чтобы каждый дубль был быстрым: запускай, смотри и слушай, меняй одну вещь (более выраженное движение камеры, более чёткое аудио), запускай снова. Когда кадр получился, перерендери готовый в 4K. Меняй одну переменную за раз, чтобы понимать, что именно помогло.

Два примера, которые можно адаптировать

Текст в видео, кинематографический стиль:

Medium shot of a woman by a rain-streaked window, she turns her head slowly toward the camera and smiles, slow dolly-in, moody blue evening light, cinematic film grain, soft rain on glass and a low ambient hum.

Изображение в видео, из локального стоп-кадра:

She breathes gently and blinks, a few strands of hair drift in a light breeze, static locked-off camera, shallow depth of field preserved, quiet room tone with a faint clock ticking.

Оба промпта короткие, называют одно чёткое действие, задают положение камеры и дают звуку одну инструкцию. Это и есть паттерн.

Что делать и чего не делать

  • Делай: называй одно действие, одно поведение камеры, одну идею для звука.
  • Делай: используй слова из кинематографии (крупный план, долли-ин, ручная съёмка).
  • Не делай: не пихай четыре действия в один пятисекундный клип.
  • Не делай: не оставляй аудио пустым, если настроение важно.
  • Не делай: не описывай объект заново в режиме изображение в видео — анимируй его.

Как это вписывается в tendre.AI

В tendre.AI изображения остаются на 100% локально на твоём GPU. LTX-2.5 для видео работает на облачном GPU по запросу, оплата за клип в кредитах, так что ты создаёшь изображения приватно и тратишь кредиты только тогда, когда анимируешь готовый кадр. Поскольку видео начинается из твоего локального стоп-кадра, созданный тобой персонаж переходит в клип с тем же лицом, тем же стилем — теперь с движением и звуком.

Всё сгенерированное является на 100% синтетическим: ни один реальный человек не изображён, и каждый персонаж однозначно является взрослым.

Превращай свои изображения в видео со звуком

Опиши движение, опиши звук и позволь LTX-2.5 анимировать стоп-кадр, созданный локально. 1080p для итераций, 4K для финала, без подписки.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)