Tout l’équipement nécessaire à la production vidéo tient désormais sur un seul bureau : lancement du LTX-2.5, un modèle OpenWeights World accéléré par NVIDIA

Cette semaine apporte son nouveau chapitre dans le grand livre de l’IA.

Tout l’équipement nécessaire à la production vidéo tient désormais sur un seul bureau : lancement du LTX-2.5, un modèle OpenWeights World accéléré par NVIDIA

La production vidéo évolue à mesure que les clips destinés aux réseaux sociaux, les créations publicitaires et la prévisualisation cinématographique passent du cloud aux GPU locaux. LTX a lancé aujourd’hui LTX-2.5, un modèle mondial à poids ouverts destiné à la génération de vidéos, aux applications en temps réel et à l’IA physique, spécialement conçu pour répondre à cette évolution. LTX a optimisé le modèle pour l’inférence locale sur les GPU NVIDIA RTX et NVIDIA DGX Spark, réduisant de cette manière les besoins en VRAM afin qu’un système « Frontier World » puisse fonctionner sur le matériel dont disposent déjà les créateurs. Cette sortie marque le point d’orgue de la série « Local AI » de NVIDIA, qui s’est étalée sur un mois et a été lancée le même jour que la mise à disposition en open source du système d’agent Nemotron 3.5 Lightning. Le signal émanant de ces deux modèles ouverts, dont le développement s’accélère localement, est en passe de devenir la norme en matière d’infrastructure de production.

Dans le même temps, lTX-2.5 met entre les mains des créateurs ce qui était auparavant réservé aux studios : une véritable cohérence. La génération native de plans multiples permet de rendre une séquence entière comme un tout cohérent, en conservant l’apparence d’un personnage d’un plan à l’autre et en corrigeant les anomalies qui rendaient les anciens modèles ouverts inutilisables pour les campagnes. Ajoutez-y une infrastructure linguistique Gemma 4 plus performante et un nouveau décodeur qui élimine les artefacts dans les plans à forte mouvement, et le résultat est pratiquement prêt pour la post-production. Le tout fonctionne sur un GPU NVIDIA RTX grand public, directement au sein de ComfyUI. Une seule personne, depuis son bureau, peut définir un personnage ou un style caractéristique grâce à un réglage fin rapide via LoRA. Pas besoin de studio. Pas besoin du cloud. Aucune adresse IP ne quitte la machine.

C’est là que réside le véritable changement : l’ensemble de la chaîne de production tient désormais sur un seul ordinateur de bureau. Ce qui nécessitait auparavant une équipe, une journée de tournage, une ferme de rendu et une facture de cloud se fait désormais grâce à la carte RTX déjà intégrée à la machine. Les clips supplémentaires n’entraînent aucun frais de génération ni aucun crédit facturé à l’utilisation. Cela révolutionne la façon dont les créateurs travaillent : ils peuvent mener de nombreuses expériences, explorer une douzaine de pistes au lieu de miser sur une seule idée « sans risque », et laisser le GPU générer en masse, pendant la nuit, une semaine de contenu. Au réveil, ils découvrent un dossier rempli d’options.

Autre élément, pour les créateurs de contenus courts et les équipes publicitaires qui doivent sans cesse renouveler leurs créations, cela change la donne. La lassitude face à la publicité s’installe généralement au bout de 7 à 10 jours ; le véritable obstacle n’a donc jamais été le manque d’idées, mais bien le coût et le temps nécessaires pour en produire en quantité suffisante. La création locale change la donne : développez différentes variantes à partir d’un même brief, testez dix accroches, adaptez-les à cinq marchés différents et renouvelez vos créations avant que le public ne s’en lasse. Les créateurs indépendants et les petites équipes peuvent désormais égaler le volume de production d’un studio complet grâce à un seul GPU RTX posé sur leur bureau.

Tout cela n’a d’importance que si la génération est rapide, et c’est le cas. Dans le benchmark « image-vers-vidéo » publié par LTX, un clip de 10 secondes prend 6,8 secondes en local sur deux cartes NVIDIA GB200 et 23,7 secondes via l’API LTX. Les alternatives propriétaires les plus rapides répertoriées, à savoir Omni Flash, Grok 1.5 et Veo 3.1, affichent des temps compris entre 52 et 70 secondes. Les systèmes plus lents affichent des résultats bien supérieurs : Seedance 2.0 à 196, FLUX 3 à 259, Seedance 2.5 à 317 et Kling 3.0 Pro à 398. En mode local, LTX-2.5 génère les données plus rapidement que la durée de lecture du clip lui-même, soit 7,6 fois plus vite que l’alternative fermée la plus proche et environ 58 fois plus vite que la plus lente. Cet écart permet de faire de la génération de lots pendant la nuit et des itérations A/B rapides une réalité concrète, et non plus une simple théorie.

D’un autre côté, tout au long du mois d’août, NVIDIA met à l’honneur des modèles, des applications et des outils issus de l’écosystème local de l’IA. Nemotron 3.5 Lightning, en outre lancé aujourd’hui, est un système open source de type « mixture-of-experts » de 30 milliards de paramètres destiné aux agents fonctionnant en continu. Il est accompagné de NeMo Switchyard, une bibliothèque open source qui achemine chaque étape du flux de travail d’un agent vers le système le mieux adapté. Le point commun réside dans le choix du matériel : les modèles ouverts de l’écosystème NVIDIA couvrent un large éventail, allant des PC RTX aux stations de travail, en passant par les centres de données et le cloud. La carte LTX-2.5 s’inscrit parfaitement dans cette dynamique en tant que modèle d’IA mondial accéléré par NVIDIA destiné aux créateurs, aux développeurs et aux équipes de robotique.

Alors que les grands modèles linguistiques (LLM) apprennent à prédire le mot suivant, les modèles du monde apprennent à prédire l’instant suivant. Ils génèrent des environnements, simulent leur comportement et permettent aux utilisateurs d’y interagir. Cette technologie est à la base du cinéma, de la publicité, des jeux vidéo, de la simulation, de ce fait que des robots utilisés dans les entrepôts et les usines. LTX présente la famille LTX comme le modèle de monde ouvert le plus utilisé, avec plus de 33 millions de téléchargements, et positionne LTX-2.5 comme sa version la plus performante à ce jour. Les poids ouverts permettent aux équipes de contrôler entièrement le matériel, la personnalisation et la propriété intellectuelle.

En parallèle, lTX a repensé presque toutes les étapes du processus de génération, plutôt que de se contenter d’ajouter des fonctionnalités à un noyau plus ancien :

Reste à voir comment l’industrie va réagir à cette annonce.

À découvrir aussi :


Couverture originale : MarkTechPost : MarkTechPost