LTX-2.5:tendre.AIに搭載された音声・動画モデル
2026年6月26日
LTX-2.5 は、tendre.AI の動画生成を支える音声・映像統合モデルです。LTX ファミリーの動画拡散モデルに属しており、最大の特徴は映像と音声を同一モデルで同時に生成する点にあります。無音のクリップを作成して別ツールで音声を付け足すのではなく、最初から音と映像が一体となって出力されます。本記事では、その仕組みと tendre.AI への統合方法をわかりやすく解説します。
音声・映像統合モデルが重要な理由
これまでの方法は、動画モデルでフレームを生成し、音声モデルでトラックを作り、手動でタイミングを合わせるパイプライン方式でした。問題は同期です。映像を「見ずに」生成された音声は、ぴったり合うことがありません。足音が半拍遅れたり、口の動きと声がずれたり、シーンの雰囲気を無視したアンビエンス音が付いてきたりします。
LTX-2.5 はそのパイプラインを一本化します。同じモデルがフレームと音声の両方を生成するため、両者は構造的に一貫しています。サウンドトラックは映像と同じコンテンツを条件として生成されるので、動きと音は最初の生成から同期しており、後から修正する必要がありません。
アーキテクチャをわかりやすく説明すると
LTX-2.5 は**拡散トランスフォーマー(DiT)**です。理解しておくべき2つの概念があります。
- **拡散(Diffusion)**とは、モデルがノイズからスタートし、プロンプトに合ったクリップに向けて段階的にノイズを除去していく手法です。SDXL などの最新画像モデルと同じ原理を、時間軸方向へ拡張したものです。
- **トランスフォーマー(Transformer)**とは、各フレームを個別に処理するのではなく、シーケンス全体(フレームをまたいで、さらに音声ストリームをまたいで)に注意を向ける仕組みです。このグローバルな視野こそが、クリップ全体を通して映像の安定性と音声の同期を維持する鍵です。
フレームごとではなくクリップ全体を一度に処理することが、出力の一貫性を保つ核心的な理由です。オブジェクトの形状が保たれ、カメラの動きが滑らかになり、音が映像に追従します。
テキストから動画、画像から動画
LTX-2.5 は2つの入力方式をサポートしており、tendre.AI はその両方を活用しています。
- テキストから動画(Text-to-video): ショットを文章で説明すると、音声付きのクリップが生成されます。
- 画像から動画(Image-to-video): tendre.AI でローカルに生成したスチル画像をスタートポイントにしてアニメーション化します。最初のフレームがあなたの画像になるので、LoRA や固定シードで仕上げたキャラクターとスタイルがそのまま動画に引き継がれます。
「画像も動画も一つのツールで」というワークフローを実現するのが Image-to-video です。気に入った画像がクリップのオープニングフレームになり、同じ顔、同じルックが保たれます。
解像度:反復作業には1080p、最終出力には4K
同一モデルが複数の解像度に対応しており、実用的なワークフローが成り立ちます。
- 1080p(Full HD) は反復作業用:プロンプトを試して結果を確認し、調整してまた実行するサイクルを素早くこなせます。
- 4K(Ultra HD) は最終レンダリング用:大画面への出力や、ポスプロでのクロップ・スタビライズに十分なピクセル数を確保します。
1080p でドラフトを作り、ショット(動き、構図、音声)を確定させてから、キープするものを4Kで仕上げる。エンジンを切り替える必要はありません。
効率性こそが本質
LTX ラインはその品質に対する処理速度の速さで知られています。これは単なるスペック上の数値ではありません。素早い1080pドラフト作成やオンデマンドの4K最終出力を、一晩待つジョブではなく現実的な作業として可能にする要素です。反復できるほど速いモデルは、作業スタイルそのものを変えます。1回あたりのコストが小さいので、より多くのテイクを試せるようになります。
バージョン2.5で加わった変更点
Lightricks は2026年8月11日に LTX-2.5 をオープンウェイトとしてリリースしました。実際にクリップを生成するユーザーにとって重要な変更点が4つあります。
ネイティブのマルチショットシーン生成。 ワイド、ミディアム、クローズアップといった連続したショットを1回の生成でレンダリングできるようになりました。キャラクター、背景、照明、声がカット間で一定に保たれます。以前は各ショットを個別にレンダリングして顔や照明が合うことを祈るしかありませんでした。これが1本のクリップをシーンに変える変更です。
新しい拡散ビデオデコーダー。 通常の映像で最も目に見える改善点は、高速な動きのシーンでのアーティファクトの減少です。以前のバージョンでは崩れやすかった部分が改善されました。素早い頭の向き変え、速いパン、髪の動きなど、どれもより正確に再現されます。LTX ファミリーが採用する高圧縮率は維持されたままです。
テキストエンコーダーの改善。 プロンプト処理が、専用プロンプトエンハンサーと組み合わせたファインチューニング済みGemma 4 12Bエンコーダーに移行しました。実際の使用感としては、より短いプロンプトから複雑な複数被写体の指示を読み取れるようになったため、細かく指定しすぎる手間が減ります。
自動デュレーション。 クリップの長さはフレーム数で手動設定するのではなく、説明した動作から推論されるようになりました。また、ネイティブ4K HDRがポストプロセスではなくパイプラインの一部として組み込まれています。
規模感として、データセンターのハードウェアでは LTX-2.5 は720pの10秒間を7秒未満でレンダリングします。この数値こそが、クリップ単位の課金によるクラウドレンダリングを現実的に成立させる根拠です。
これらはエンジンの機能です。tendre.AI にはリリースごとに段階的に反映されます。現在実行しているバージョンで利用可能な機能については、変更履歴を参照してください。
tendre.AI における LTX-2.5 の統合方法
tendre.AI は通常のルールを適用しています。基本はローカル処理、負荷の高い処理だけ選択的にクラウドへ。
- 画像は100%ローカルで生成。 すべてのスチル画像はあなた自身の GPU 上で生成され、アップロードは発生しません。
- LTX-2.5 の動画生成はクラウド GPU 上で動作します(オンデマンド)。同期音声、特に4Kはコンピューティング負荷が高いため、リモート GPU で処理され、クリップ単位でクレジットが消費されます。これはオプトイン方式です。画像だけを生成する場合、プライベートなローカルワークフローに変更はありません。
- 両方で同じキャラクターを使用。 動画はローカルのスチル画像から始まるため、構築したアイデンティティがクリップに引き継がれます。
移行に関する注記:tendre.AI は現在 LTX-2.5 をアプリに積極的に展開中です。音声付き動画、1080pによる反復生成、4Kによる仕上げは、移行完了に伴い段階的に利用可能になります。ローカルの画像生成ワークフローへの影響はありません。
コンテンツの境界は変わりません
LTX-2.5 は tendre.AI の明確なルールを変えるものではありません。生成されるすべてのコンテンツは100%合成物です。実在の人物は描写されず、すべての被写体は明確に成人です。このモデルは、フィクションの成人向けAI生成コンテンツのためのツールです。それ以外の用途はありません。
LTX-2.5は、100%ローカルの画像ワークフローの上に、1080pと4Kで同期した音声・映像生成をもたらします。画像も動画も一つのツールで、サブスクリプション不要。








