Как написать хороший промпт для LTX-2.5 (видео со звуком)
2 июля 2026 г.
Работа с видеомоделью — это не то же самое, что работа с моделью для генерации изображений. В SDXL ты описываешь застывший момент. В LTX-2.5 ты описываешь движущийся кадр со звуком, поэтому две вещи, о которых раньше не нужно было думать, становятся ключевыми: движение и аудио. Сделай их правильно — и клипы будут выглядеть осмысленно; проигнорируй — получишь жёсткое, беззвучное слайд-шоу. Это руководство покажет, как писать промпты для LTX-2.5, чтобы они действительно двигались и звучали как надо.
Главная ошибка, которую нужно избегать: промптить как для изображения
Самая распространённая ошибка новичка — описывать сцену вместо кадра. "Женщина в красном платье в кафе" — это промпт для изображения. LTX-2.5 что-то сгенерирует, но без указания движения ему придётся угадывать, и обычно он угадывает по минимуму (небольшое движение головы, мерцание). В итоге получается почти статичный клип.
Исправь это, всегда отвечая на три вопроса, которые модель не может вывести из статичного описания:
- Что движется? (объект, камера или оба)
- Как ведёт себя камера? (статично, панорама, долли, ручная съёмка)
- Что мы слышим? (атмосфера, голос, эффекты)
Формула промпта, которая работает
Представь промпт для LTX-2.5 как шесть слотов. Не обязательно заполнять все шесть каждый раз, но чем больше заполнено, тем больше контроля у тебя:
Объект + Действие/Движение + Камера + Обстановка/Освещение + Стиль + Аудио
Пример по слотам:
A young woman in a red dress (subject) turns toward the camera and smiles (action), slow dolly-in (camera), warm golden-hour light through a window (setting/lighting), cinematic, shallow depth of field (style), soft room tone with a faint vinyl crackle (audio).
Одно предложение говорит LTX-2.5, что происходит, как это снято и как это звучит. Вот и вся задача.
Описывай движение глаголами
Движение живёт в глаголах. Слабые промпты полны существительных и прилагательных; сильные добавляют слова действия: turns, walks, leans, reaches, tilts, glances, breathes, sways, drifts. Оставляй одно чёткое действие на короткий клип. Пятисекундный кадр не может показать "она встаёт, подходит к окну, открывает его и закуривает" — это четыре кадра. Проси одно действие, добейся его, затем генерируй следующее.
Говори на языке камеры
LTX-2.5 понимает терминологию кинематографии. Используй её для управления кадром:
- Размер кадра: крупный план, средний план, общий план.
- Движение камеры: статичный кадр, медленная панорама влево, долли-ин, тревеллинг, ручная съёмка.
- Ощущение: зафиксированная и стабильная камера или лёгкое покачивание ручной камеры для реализма.
"Статичный кадр, крупный план" — это совершенно другой клип, чем "ручная съёмка, тревеллинг, общий план", даже с тем же объектом. Выбирай положение камеры осознанно.
Задавай звук — это суперсила LTX-2.5
Поскольку LTX-2.5 генерирует изображение и звук вместе, ты можешь прописать аудио напрямую — и должен это делать. Три слоя, о которых стоит подумать:
- Атмосфера / окружающий звук: "тихая комнатная атмосфера", "дождь на стекле", "далёкий городской шум", "волны".
- Голос / диалог: описывай подачу ("тихий шёпот", "тёплый смех"), а не точные слова, если хочешь естественности.
- Эффекты: "шаги по деревянному полу", "скрип двери", "треск винила", "лёгкий ветерок".
Если ты ничего не говоришь об аудио, LTX-2.5 заполнит его самостоятельно, и оно может не совпасть с нужным настроением. Обычно достаточно одной короткой фразы про звук, чтобы направить модель.
Что изменилось в 2.5 и как это влияет на твои промпты
Версия 2.5 изменила три вещи, которые напрямую влияют на то, как ты пишешь.
Теперь можно задавать последовательность, а не только кадр. LTX-2.5 генерирует нативные многокадровые сцены: общий, затем средний, затем крупный план — в одной генерации, с сохранением персонажа, освещения и голоса на всех монтажных переходах. Поэтому описывай последовательность, а не рендери три клипа и не пытайся их сшить. "Общий план на террасе в сумерках, затем средний, когда она поворачивается к двери, затем крупный на её лице, пока она говорит."
Более короткие промпты теперь работают лучше. Обработка промптов перешла к точно настроенному энкодеру Gemma 4 12B с выделенным усилителем промптов, который считывает сложные многообъектные инструкции из меньшего количества слов. Старая привычка громоздить двадцать уточнений, чтобы добиться нужного результата, теперь контрпродуктивна: это ограничивает модель больше, чем направляет. Говори о главном, убирай лишнее.
Перестань считать кадры. Длительность выводится из описанного действия. Пиши действие в его естественном темпе, "она наливает кофе, смотрит вверх и улыбается", и позволь модели подобрать длину клипа. Задавать длину вручную, а затем описывать действие, которое в неё не вписывается, — верный способ получить концовку, которая ощущается оборванной.
Текст в видео vs изображение в видео
Два режима требуют слегка разных промптов:
- Текст в видео: ты описываешь всё, включая объект. Используй полную формулу из шести слотов.
- Изображение в видео (рекомендуется в tendre.AI): твой стоп-кадр уже задаёт объект, внешний вид и кадрирование. Поэтому держи описание объекта лёгким и трать слова на движение и аудио, которые хочешь добавить. Пример поверх готового портрета: "she slowly tilts her head, hair moving in a light breeze, subtle smile, static camera, soft breathing and distant city ambience". Ты анимируешь, а не описываешь заново.
Режим изображение в видео — это золотая середина: персонаж, которого ты зафиксировал локально (с помощью LoRA или фиксированного сида), переходит прямо в клип с тем же лицом и тем же стилем.
Итерируй в 1080p, финализируй в 4K
Промпты находят, а не пишут. Работай в черновике при 1080p, чтобы каждый дубль был быстрым: запускай, смотри и слушай, меняй одну вещь (более выраженное движение камеры, более чёткое аудио), запускай снова. Когда кадр получился, перерендери готовый в 4K. Меняй одну переменную за раз, чтобы понимать, что именно помогло.
Два примера, которые можно адаптировать
Текст в видео, кинематографический стиль:
Medium shot of a woman by a rain-streaked window, she turns her head slowly toward the camera and smiles, slow dolly-in, moody blue evening light, cinematic film grain, soft rain on glass and a low ambient hum.
Изображение в видео, из локального стоп-кадра:
She breathes gently and blinks, a few strands of hair drift in a light breeze, static locked-off camera, shallow depth of field preserved, quiet room tone with a faint clock ticking.
Оба промпта короткие, называют одно чёткое действие, задают положение камеры и дают звуку одну инструкцию. Это и есть паттерн.
Что делать и чего не делать
- Делай: называй одно действие, одно поведение камеры, одну идею для звука.
- Делай: используй слова из кинематографии (крупный план, долли-ин, ручная съёмка).
- Не делай: не пихай четыре действия в один пятисекундный клип.
- Не делай: не оставляй аудио пустым, если настроение важно.
- Не делай: не описывай объект заново в режиме изображение в видео — анимируй его.
Как это вписывается в tendre.AI
В tendre.AI изображения остаются на 100% локально на твоём GPU. LTX-2.5 для видео работает на облачном GPU по запросу, оплата за клип в кредитах, так что ты создаёшь изображения приватно и тратишь кредиты только тогда, когда анимируешь готовый кадр. Поскольку видео начинается из твоего локального стоп-кадра, созданный тобой персонаж переходит в клип с тем же лицом, тем же стилем — теперь с движением и звуком.
Всё сгенерированное является на 100% синтетическим: ни один реальный человек не изображён, и каждый персонаж однозначно является взрослым.
Опиши движение, опиши звук и позволь LTX-2.5 анимировать стоп-кадр, созданный локально. 1080p для итераций, 4K для финала, без подписки.








