LTX-2.5: Das Audio- und Videomodell in tendre.AI

26. Juni 2026

LTX-2.5 ist das Audio-und-Video-Generierungsmodell, das die Videofunktion in tendre.AI antreibt. Es gehört zur LTX-Familie der Video-Diffusionsmodelle und sein wesentliches Merkmal ist, dass es Bild und Ton gemeinsam in einem einzigen Modell erzeugt, anstatt einen stummen Clip zu produzieren und den Ton einem separaten Tool zu überlassen. Dieser Artikel bietet eine verständliche technische Betrachtung der Funktionsweise und der Integration in tendre.AI.

Warum ein gemeinsames Audio-Video-Modell wichtig ist

Der alte Weg zu einem Clip mit Ton war eine Pipeline: Ein Videomodell erstellt die Frames, ein Audiomodell erstellt einen Track, und du richtest beides manuell aus. Das Problem ist die Synchronisation. Ton, der ohne „Sicht" auf die Bewegung erzeugt wurde, trifft nie genau: ein Schritt einen halben Beat zu spät, eine Stimme, die nicht zum Mund passt, Ambiente, das die Szene ignoriert.

LTX-2.5 löst diese Pipeline auf. Weil dasselbe Modell die Frames und das Audio erzeugt, sind beide von Natur aus kohärent: Der Soundtrack ist auf denselben Inhalt wie das Bild konditioniert, sodass Bewegung und Ton von der ersten Generierung an synchron sind und nicht nachträglich angepasst werden müssen.

Die Architektur, einfach erklärt

LTX-2.5 ist ein Diffusion Transformer (DiT). Zwei Konzepte sind dabei wichtig:

  • Diffusion bedeutet, dass das Modell bei Rauschen beginnt und Schritt für Schritt entrauscht, bis ein Clip entsteht, der zu deinem Prompt passt. Es ist dasselbe Prinzip wie bei modernen Bildmodellen wie SDXL, nur auf die Zeit ausgedehnt.
  • Transformer bedeutet, dass es die gesamte Sequenz überblickt (über alle Frames und den gesamten Audiostream hinweg), anstatt jeden Frame einzeln zu verarbeiten. Diese globale Sicht sorgt dafür, dass die Bewegung stabil bleibt und das Audio über die gesamte Länge des Clips mit dem Bild synchron ist.

Die Verarbeitung des gesamten Clips auf einmal, statt Frame für Frame, ist der Kerngrund dafür, dass die Ausgabe kohärent bleibt: Objekte behalten ihre Form, Kamerabewegungen bleiben fließend, und der Ton folgt dem Bild.

Text-zu-Video und Bild-zu-Video

LTX-2.5 unterstützt zwei Einstiegspunkte, und tendre.AI nutzt beide:

  • Text-zu-Video: Beschreibe die Aufnahme und erhalte einen Clip mit Ton.
  • Bild-zu-Video: Starte mit einem Still, das du bereits lokal in tendre.AI generiert hast, und animiere es. Der erste Frame ist dein Bild, sodass der Charakter und der Stil, den du festgelegt hast (mit einer LoRA oder einem festen Seed), direkt ins Video übernommen werden.

Bild-zu-Video macht den „ein Tool für Bild und Video"-Workflow erst möglich: Das Bild, das du liebst, wird zum ersten Frame des Clips, mit demselben Gesicht und demselben Look.

Auflösung: 1080p für die Iteration, 4K für das Finale

Dasselbe Modell zielt auf mehrere Auflösungen ab. In der Praxis ergibt das einen klaren Workflow:

  • 1080p (Full HD) für die Iteration: schnell genug, um einen Prompt auszuprobieren, das Ergebnis anzuhören, anzupassen und erneut zu generieren.
  • 4K (Ultra HD) für finale Render: viermal so viele Pixel, für große Bildschirme oder um in der Nachbearbeitung zu schneiden und zu stabilisieren.

Du entwirfst bei 1080p, legst die Aufnahme fest (Bewegung, Bildausschnitt, Audio) und renderst den Favoriten dann in 4K fertig, ohne zwischen Entwurf und finaler Ausgabe das Werkzeug wechseln zu müssen.

Effizienz ist das Ziel

Die LTX-Linie ist bekannt dafür, schnell für ihre Qualität zu sein. Diese Effizienz ist kein Selbstzweck: Sie macht schnelle 1080p-Entwürfe und 4K-Finals auf Abruf praktisch, statt zu Projekten über Nacht. Ein Modell, das effizient genug ist, um damit zu iterieren, verändert die Arbeitsweise: Du probierst mehr Varianten aus, weil jede zeitlich günstig ist.

Was Version 2.5 gebracht hat

Lightricks hat LTX-2.5 am 11. August 2026 mit offenen Gewichten veröffentlicht. Vier Neuerungen sind für alle relevant, die tatsächlich Clips generieren.

Nativer Multi-Shot-Szenen. Das Modell kann zusammenhängende Einstellungen, von weit bis nah, in einer einzigen Generierung rendern und dabei Charakter, Umgebung, Beleuchtung und Stimme über die Schnitte hinweg konstant halten. Vorher bedeutete eine Sequenz, jede Einstellung separat zu rendern und zu hoffen, dass Gesicht und Licht übereinstimmen. Diese Änderung verwandelt einen Clip in eine echte Szene.

Ein neuer Diffusions-Video-Decoder. Der sichtbarste Gewinn bei normalem Footage: weniger Artefakte in Szenen mit starker Bewegung, genau dort, wo frühere Versionen verwischten. Ein sich schnell drehender Kopf, ein schneller Schwenk, wehende Haare, all das bleibt besser zusammen, während das hohe Kompressionsverhältnis der LTX-Familie erhalten bleibt.

Ein besserer Text-Encoder. Die Prompt-Verarbeitung wurde auf einen feinabgestimmten Gemma 4 12B-Encoder in Kombination mit einem dedizierten Prompt-Enhancer umgestellt. In der Praxis liest er komplexe Anweisungen mit mehreren Motiven aus kürzeren Prompts, sodass du weniger Zeit mit Überdetaillierung verbringst.

Automatische Dauer. Die Länge des Clips wird aus der beschriebenen Aktion abgeleitet, statt manuell in Frames festgelegt zu werden, und natives 4K HDR ist jetzt Teil der Pipeline statt eines Nachbearbeitungsschritts.

Zur Einordnung: Auf Rechenzentrums-Hardware rendert LTX-2.5 10 Sekunden 720p in unter 7 Sekunden. Diese Zahl ist es, die Cloud-Rendering per Clip überhaupt erst wirtschaftlich macht.

Das sind Fähigkeiten der Engine. Sie landen schrittweise, Release für Release, in tendre.AI. Das Changelog ist die Referenz dafür, was in der Version, die du verwendest, bereits verfügbar ist.

Wie tendre.AI LTX-2.5 integriert

tendre.AI wendet seine übliche Regel an: lokal zuerst, Cloud nur für das schwere Heben, das du selbst wählst.

  • Bilder bleiben 100% lokal. Jedes Still wird auf deiner eigenen GPU generiert, nichts wird hochgeladen.
  • LTX-2.5-Video läuft auf einer Cloud-GPU, auf Abruf. Synchronisiertes Audio und insbesondere 4K sind rechenintensiv, daher laufen sie auf einer Remote-GPU und werden pro Clip in Credits abgerechnet. Das ist optional: Wenn du nur Bilder generierst, ändert sich nichts an deinem privaten lokalen Workflow.
  • Dieselben Charaktere in beiden Modi. Weil Video von deinen lokalen Stills ausgeht, fließt die Identität, die du aufgebaut hast, in den Clip ein.

Migrationshinweis: tendre.AI integriert LTX-2.5 aktiv in die App. Video mit Ton, 1080p-Iteration und 4K-Finishing landen schrittweise, wenn die Migration abgeschlossen ist. Der lokale Bild-Workflow ist davon nicht betroffen.

Die Inhaltsgrenze gilt weiterhin

LTX-2.5 ändert nichts an tendre.AIs fester Regel. Alles Generierte ist 100% synthetisch: Es wird keine reale Person dargestellt, und jedes Motiv ist eindeutig volljährig. Das Modell ist ein Werkzeug für fiktionale, erwachsene, KI-generierte Inhalte, und nichts anderes.

Video mit Ton in tendre.AI generieren

LTX-2.5 bringt synchronisiertes Audio und Video, in 1080p und 4K, ergänzt durch einen 100% lokalen Bild-Workflow. Ein Tool für Bild und Video, kein Abonnement.

AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Cyberpunk Universe)AI-generated portrait by tendre.AI (Fantasy Universe)AI-generated portrait by tendre.AI (Exterior)AI-generated portrait by tendre.AI (Library)AI-generated portrait by tendre.AI (At work)AI-generated portrait by tendre.AI (FarWest)AI-generated portrait by tendre.AI (Cyberpunk UNIVERSE)AI-generated portrait by tendre.AI (Exterior)
Windows · Cloud oder NVIDIA

Privat generieren. Noch heute Abend.

Lade tendre.AI herunter, aktiviere einmal und nutze es für immer, vollständig offline, auf deiner eigenen GPU.

Für Windows herunterladenFür Android herunterladen (.apk)
Für Mac herunterladenMac-Version kommt bald!
OS Windows 10/11GPU NVIDIA 8GB+VRAM 12GB empfohlenDisk 20GB

Keine NVIDIA-GPU? Starte zu 100% in der Cloud: 10 kostenlose Bilder jeden Tag, danach 1 Credit pro Bild. Eine NVIDIA-Karte (ab 8GB) schaltet unbegrenzte lokale Generierung frei.