LTX 2.5: des scènes multi-plans générées avec leur bande-son, en poids ouverts
Mis à jour le 16 août 2026
LTX 2.5 est un modèle de génération vidéo en poids ouverts développé par LTX, l'entreprise née de Lightricks. Lancé le 11 août 2026, il produit l'image et le son en une seule passe, dialogues et bruitages compris, à partir d'un texte, d'une image ou d'une vidéo existante. Le téléchargement des poids ne coûte rien sur Hugging Face, tandis que l'API facture chaque seconde générée. Les francophones devront composer avec une documentation anglophone, les prompts rédigés en français restant bien compris.
- Image et son générés ensemble, synchro labiale comprise
- Multi-plans natif avec personnages stables entre les coupes
- Poids ouverts, exécution locale dès 16 Go de VRAM
- Rendu plus rapide que le temps réel sur gros GPU
- Sortie 4K HDR et RAW pour la post-production
- Documentation et interface en anglais uniquement
- Texte incrusté à l'écran encore peu fiable
- Les upscalers de la version 2.3 restent à chaîner à part
Multi-plans, son synchronisé et rendu à fidélité adaptative
LTX 2.5 génère la vidéo et sa bande sonore d'un seul tenant, sans étape audio séparée. Le multi-plans natif marque cette version, un seul prompt décrit plusieurs plans et le modèle conserve le personnage, le décor, la lumière et la voix d'une coupe à l'autre. Vous demandez un plan large puis un gros plan, la même actrice revient avec le même timbre après le raccord.
Sous le capot, un décodeur vidéo par diffusion remplace l'ancienne reconstruction VAE et fait chuter les défauts visibles de 0,74 à 0,28 par clip sur le banc d'essai interne de 98 prompts. Le rendu dit à fidélité adaptative concentre le calcul sur les zones complexes d'une scène. Et la sortie native en 4K HDR et RAW alimente sans conversion les outils de montage vidéo et les chaînes d'étalonnage professionnelles.
LTX 2.5 en local, du GPU de bureau au serveur
Un GPU avec 16 Go de VRAM suffit pour lancer LTX 2.5 chez vous. Le modèle compte 22 milliards de paramètres, épaulé par un encodeur de texte Gemma, et la famille LTX cumule plus de 33 millions de téléchargements. La vitesse reste l'argument massue, 10 secondes de vidéo sortent en 6,8 secondes de calcul (mesure réalisée par LTX sur deux GB200 à 720p, autant le préciser d'emblée).
Face aux modèles fermés, l'écart revendiqué sur ce même banc d'essai se lit sans effort de mémoire.
| Modèle | Temps mesuré pour 10 s de vidéo |
|---|---|
| LTX 2.5 auto-hébergé (2x GB200) | 6,8 s |
| LTX 2.5 via l'API | 23,7 s |
| Omni Flash, Grok 1.5, Veo 3.1 | 52 à 70 s |
| Seedance 2.5 | 317 s |
| Kling 3.0 Pro | 398 s |
Se lancer avec LTX 2.5, du téléchargement gratuit à l'API
Trois chemins mènent au modèle, aucun ne demande de liste d'attente.
Côté tarifs, la variante Fast démarre à 0,09 $ la seconde en 720p et monte à 0,30 $ en 4K, la Pro se situant à 0,12 $ en 720p et 0,17 $ en 1080p. La licence Community autorise gratuitement l'usage commercial sous 10 millions de dollars de chiffre d'affaires annuel. Ces grilles bougent d'une version à l'autre, la page de ltx.io reste donc la seule référence à jour avant de budgéter un projet.
- Hugging Face et GitHub, poids, code d'inférence et checkpoint d'affinage gratuits
- ComfyUI, avec des gabarits de workflow officiels dès le premier jour
- L'API LTX, plus Runway et fal pour une version hébergée sans installation
Questions fréquentes
LTX 2.5 est-il gratuit ?
Oui, les poids, le code d'inférence et le code d'entraînement se téléchargent gratuitement sur Hugging Face et GitHub. La licence Community couvre l'usage commercial tant que votre société reste sous 10 millions de dollars de revenus annuels. Seuls l'API et les hébergeurs tiers facturent, à la seconde de vidéo générée.
Quelle carte graphique faut-il pour faire tourner LTX 2.5 en local ?
Un GPU de 16 Go de VRAM constitue le plancher, le modèle étant optimisé pour les RTX de NVIDIA et le DGX Spark. Pour un travail de production fluide, même avec le checkpoint distillé, comptez plutôt autour de 48 Go. Sans GPU NVIDIA, l'API ou une plateforme hébergée prend le relais.
LTX 2.5 ou Veo 3.1, quelle différence ?
Veo 3.1 est un modèle fermé, accessible uniquement via le cloud de Google, alors que LTX 2.5 se télécharge, s'affine et tourne sur votre propre matériel. Sur les mesures publiées par LTX, la génération est plusieurs fois plus rapide chez LTX 2.5, Veo conservant une belle réputation de fidélité d'image. Le contrôle local fait souvent pencher la balance.
À quoi sert la version robotique de LTX 2.5 ?
Simuler le monde physique pour entraîner des machines, voilà l'idée. Un checkpoint pré-entraîné dédié à l'IA physique accompagne la sortie, que les équipes robotiques affinent avec leurs propres données pour prédire la réaction d'un environnement aux actions d'un robot. Markov Robotics compte parmi les premières sociétés à l'exploiter.
Verdict : Dix secondes d'images rendues en moins de sept secondes de calcul, la génération vidéo devient une boucle d'essais quasi instantanée. Studios équipés en GPU, équipes pub qui multiplient les variantes de plans produit et développeurs attachés aux poids ouverts y trouveront un terrain de jeu très sérieux.
« Un assistant IA privé gratuit orienté confidentialité, hébergé en Europe et chiffré de bout en bout. Il combine des capacités de raisonnement poussées, la génération d'images, la recherche sur le deep web et la mémoire à long terme. Il garantit par ailleurs que vos conversations ne sont pas utilisées pour entraîner des modèles »
