LTX-2.5プロンプトの書き方(音声付き動画)

2026年7月2日

動画モデルへのプロンプトは、画像モデルへのプロンプトとは異なります。SDXLでは静止した瞬間を描写しますが、LTX-2.5では音声付きの動くショットを描写します。そのため、これまで書く必要がなかったモーションオーディオという2つの要素が突然重要になります。この2つをうまく扱えば、クリップに意図が宿ります。無視すると、硬直した無音のスライドショーになってしまいます。このガイドでは、実際に動いて聴こえるLTX-2.5プロンプトの書き方を解説します。

避けるべき唯一のミス:画像のようにプロンプトを書くこと

初心者が最もよく犯すミスは、ショットではなくシーンを描写することです。「カフェにいる赤いドレスの女性」は画像プロンプトです。LTX-2.5は何かを生成しますが、モーションの手がかりがなければ推測するしかなく、たいてい小さな動き(わずかな頭の動きやちらつき)に留まります。結果として、ほぼ静止したクリップができあがります。

静的な描写からはモデルが推測できない、次の3つの質問に常に答えることで改善できます。

  • 何が動くのか?(被写体、カメラ、またはその両方)
  • カメラはどう動くのか?(静止、パン、ドリー、手持ち)
  • 何が聴こえるのか?(環境音、声、効果音)

機能するプロンプトの公式

LTX-2.5のプロンプトは6つのスロットで構成されていると考えてください。毎回すべてを埋める必要はありませんが、多く埋めるほどコントロールが高まります。

被写体 + アクション/モーション + カメラ + 設定/ライティング + スタイル + オーディオ

スロットごとの例:

赤いドレスの若い女性が(被写体)カメラの方を向いてほほえむ(アクション)、ゆっくりとしたドリーイン(カメラ)、窓から差し込む暖かいゴールデンアワーの光(設定/ライティング)、シネマティック、浅い被写界深度(スタイル)、かすかなビニールのパチパチという音を伴う柔らかい室内音(オーディオ)。

この一文だけで、LTX-2.5に何が起き、どのように撮影され、どんな音がするかを伝えられます。それがすべてです。

動詞でモーションを描写する

モーションは動詞の中に宿ります。弱いプロンプトは名詞と形容詞で溢れていますが、強いプロンプトにはアクションワードが加わります。振り向く、歩く、身を傾ける、手を伸ばす、傾ける、ちらりと見る、呼吸する、揺れる、漂うなど。短いクリップではひとつの明確なアクションに絞りましょう。5秒のショットで「立ち上がって窓まで歩き、開けてタバコに火をつける」は表現できません。それは4つのショットです。ひとつの動作を求め、それを完成させてから次を生成しましょう。

カメラの言葉を使う

LTX-2.5は映画撮影の専門用語を理解します。それを使ってフレームをコントロールしましょう。

  • ショットサイズ: クローズアップ、ミディアムショット、ワイドショット。
  • カメラの動き: スタティックショット、ゆっくりとした左パン、ドリーイン、トラッキングショット、手持ち撮影。
  • 雰囲気: 固定されて安定した感じ、またはリアリティのための微妙な手持ちの揺れ。

同じ被写体でも、「スタティックショット、クローズアップ」と「手持ちトラッキングショット、ワイド」では全く異なるクリップになります。カメラは意図的に決めましょう。

音声をプロンプトに書く、これがLTX-2.5の真骨頂

LTX-2.5は映像と音声を一緒に生成するため、オーディオを直接書き込むことができますし、書くべきです。考慮すべき3つの層があります。

  • 環境音/室内音:「静かな室内音」「窓を打つ雨」「遠くの街の騒音」「波音」。
  • 声/セリフ: 自然に聴こえるよう、正確な言葉ではなく話し方を描写します(「柔らかいささやき」「温かい笑い声」など)。
  • 効果音:「木の床の足音」「ドアがきしむ音」「ビニールのパチパチ音」「そよ風」。

オーディオについて何も指定しないと、LTX-2.5が独自に補完しますが、求めていたムードとは合わないことがあります。短いオーディオフレーズひとつで大抵は十分に方向付けできます。

2.5での変更点と、プロンプトへの影響

バージョン2.5では、プロンプトの書き方に直接影響する3つの変更がありました。

ショットだけでなく、シーケンスをプロンプトに書けるようになりました。 LTX-2.5はネイティブのマルチショットシーンを生成します。ワイド、ミディアム、クローズアップを、カット間でキャラクター・ライティング・声を一定に保ちながら、1回の生成で作り出せます。そのため、3つのクリップを個別に生成して合わせようとするのではなく、シーケンスとして描写しましょう。「夕暮れ時のテラスにいる彼女のワイドショット、ドアの方に振り向くミディアムショット、話す彼女の顔のクローズアップ。」

短いプロンプトの方が効果的になりました。 プロンプト処理は専用のプロンプトエンハンサーを備えたファインチューニング済みのGemma 4 12Bエンコーダーに移行し、より少ない言葉で複雑なマルチ被写体の指示を読み取れるようになりました。結果を強制するために20個の修飾語を重ねるという古い習慣は、もはや逆効果です。モデルを導くよりも制約してしまいます。重要なことを伝え、余分な言葉は省きましょう。

フレーム数を数えるのをやめましょう。 尺は描写したアクションから推測されます。アクションを自然な長さで書いてください。*「コーヒーを注いで、顔を上げてほほえむ」*という具合に、モデルがクリップのサイズを決めます。手動で長さを設定し、それに合わないアクションを描写すると、唐突に終わるような結末になってしまいます。

テキストから動画と画像から動画の違い

2つの入力方法は、少し異なるプロンプトを求めます。

  • テキストから動画: 被写体も含めてすべてを描写します。6スロットの公式をフル活用してください。
  • 画像から動画(tendre.AIで推奨): すでにスチール画像が被写体・見た目・フレーミングを定義しています。そのため被写体の描写は軽くして、追加したいモーションとオーディオに言葉を使いましょう。既存のポートレートへの適用例:「彼女はゆっくりと頭を傾け、髪が軽いそよ風に揺れ、かすかにほほえむ、スタティックカメラ、柔らかな呼吸音と遠くの街の環境音」。再描写ではなく、アニメーション化しているのです。

画像から動画はまさにスイートスポットです。ローカルで固定したキャラクター(LoRAまたは固定シードを使用)が、同じ顔・同じスタイルのままクリップに引き継がれます。

1080pで反復し、4Kで仕上げる

プロンプトは書くものではなく、見つけるものです。1080pでドラフトすることで各テイクが速くなります。実行して視聴・試聴し、ひとつの要素を変え(より強いカメラムーブ、より明確なオーディオの手がかり)、また実行します。ショットが決まったら、キープする素材を4Kで再レンダリングしましょう。何が実際に効いたかわかるよう、一度に変える変数はひとつだけにしてください。

応用できる2つの例

テキストから動画、シネマティック:

雨に濡れた窓のそばに立つ女性のミディアムショット。ゆっくりとカメラに向かって頭を向け、ほほえむ。ゆっくりとしたドリーイン。ムーディーな青みがかった夕方の光。シネマティックなフィルムグレイン。ガラスに当たる柔らかい雨音と低い環境音のハム。

画像から動画、ローカルのスチールから:

彼女はゆっくりと呼吸してまばたきし、数本の髪の毛が軽いそよ風に揺れる。スタティックな固定カメラ。浅い被写界深度はそのまま維持。かすかな時計の刻む音を伴う静かな室内音。

どちらも短く、ひとつの明確なアクションを示し、カメラを設定し、音声にひとつの指示を与えています。これがパターンです。

すべきこととすべきでないこと

  • すべき: アクションひとつ、カメラの動きひとつ、オーディオのアイデアひとつを明記する。
  • すべき: 映画撮影の用語を使う(クローズアップ、ドリーイン、手持ち撮影)。
  • すべきでない: 5秒のクリップに4つのアクションを詰め込む。
  • すべきでない: ムードが重要な場合にオーディオを空白のままにする。
  • すべきでない: 画像から動画で被写体を再描写する。アニメーション化しましょう。

tendre.AIとの関係

tendre.AIでは、画像はあなた自身のGPU上で100%ローカルに保存されます。LTX-2.5の動画はオンデマンドのクラウドGPU上で動作し、クレジットでクリップごとに課金されます。そのためプライベートに画像をドラフトし、アニメーション化したい素材が決まったときだけクレジットを使います。動画はあなたのローカルのスチールから始まるため、構築したキャラクターが同じ顔・同じ見た目でクリップに引き継がれ、動きと音声が加わります。

生成されるものはすべて100%シンセティックです。実在する人物は描写されておらず、すべての被写体は明らかに成人しています。

画像を音声付き動画に変換しよう

モーションを書き、音声を書いて、ローカルで生成したスチールをLTX-2.5にアニメーション化させましょう。反復には1080p、仕上げには4K。サブスクリプション不要。

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)
Windows・クラウドまたはNVIDIA

プライベートに生成しましょう。今夜から。

tendre.AIをダウンロードして一度だけ認証すれば、完全オフラインで、自分のGPUを使ってずっと使い続けられます。

Windows版をダウンロードAndroid版をダウンロード(.apk)
Mac版をダウンロードMac版は近日公開予定です!
OS Windows 10/11GPU NVIDIA 8GB以上VRAM 12GB推奨ディスク容量 20GB

NVIDIA GPUをお持ちでない方も、100%クラウドで始められます。毎日10枚まで無料、それ以降は1枚につき1クレジットです。NVIDIAカード(8GB以上)があれば、無制限のローカル生成も利用できます。