Le secteur technologique continue de livrer des avancées remarquables.
Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation
Robbyant, une filiale d’Ant Group, a lancé LingBot-VLA 2.0, un modèle de base « Vision-Language-Action » (VLA) destiné aux robots. Cette version comprend un rapport technique, un code source sous licence Apache 2.0 et un checkpoint de 6 milliards de paramètres. L’équipe de recherche s’attaque à une lacune bien connue : les modèles VLA fonctionnent souvent en laboratoire, cependant rencontrent des difficultés lors de leur déploiement. LingBot-VLA 2.0 améliore la version précédente sur trois axes pratiques : la généralisation, un espace d’action élargi et la modélisation prédictive des dynamiques.
LingBot-VLA 2.0 est une politique robotique généraliste reposant sur une architecture de base « vision-langage ». Elle convertit les images captées par une caméra et une instruction linguistique en actions robotiques. Le modèle public est lingbot-vla-v2-6b, un checkpoint de 6 milliards de paramètres à « profondeur native ». Il utilise Qwen3-VL-4B-Instruct comme architecture VLM de base. Deux modèles enseignants, LingBot-Depth et DINO-Video, supervisent l’entraînement par distillation.
Sur ce point, un appel d’inférence prend environ 130 ms sur une carte NVIDIA GeForce RTX 4090D. Cette mesure a été réalisée avec 10 étapes de débruitage. L’expert d’action utilise une architecture de type « Mixture-of-Experts » (MoE) pour la mise à l’échelle.
Précisons, la généralisation commence par les données. L’équipe de recherche a rassemblé environ 60 000 heures de données de pré-entraînement. Celles-ci comprennent 50 000 heures de trajectoires de robots et 10 000 heures de vidéos humaines égocentriques. Les éléments robotiques couvrent 20 configurations différentes, allant des robots à un seul bras aux humanoïdes complets. L’ensemble brut est plus vaste : environ 90 000 heures de informations robotiques et 20 000 heures de vidéos égocentriques. Un pipeline repensé permet de filtrer les échantillons bruités pour ne conserver que l’ensemble de haute qualité.
En parallèle, le filtrage est explicite et mesurable. L’équipe de recherche calcule le jerk du troisième ordre ainsi que les scores Z de vitesse et d’accélération pour chaque incarnation. Les épisodes présentant une fluidité anormale ou contenant plus de 95 % de signaux statiques sont écartés. Les vidéos sont comparées aux états reproduits à l’aide du fichier URDF de chaque robot. Les annotateurs corrigent le flou, les occlusions, les images manquantes et les désalignements entre les différentes vues. Les séquences égocentriques sont soumises à un filtre VLM, puis à un SLAM égocentrique et à une reconstruction de la posture des mains par MANO.
Dans le même temps, l’annotation est automatisée à l’aide d’un modèle de vision-langage. Qwen3.6-27B segmente chaque vidéo en sous-tâches contiguës dans le temps. Chaque sous-tâche se voit attribuer une action « atomique » issue d’un vocabulaire fermé de 18 catégories. Ce vocabulaire comprend 15 actions primitives, auxquelles s’ajoutent « transit », « inactivité » et « autres ». Sur l’ensemble du corpus, les actions « déplacement » et « transit » sont les plus fréquentes.
Il faut souligner, chaque robot présentant des articulations différentes, LingBot-VLA 2.0 les unifie. Il utilise un vecteur canonique de 55 dimensions tant pour les états que pour les actions. Cette structure est fixe pour toutes les incarnations du jeu de données.
Difficile à ce stade de prédire tous les impacts de cette annonce.
Dans le même ordre d’idées :
- Lovable serait en pourparlers pour doubler sa valorisation et la porter à 13,2 milliards de dollars | TechCrunch
- NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base
- Pourquoi l’essor de l’IA open source ne nuit pas à Anthropic… pour l’instant | TechCrunch
Article original publié par MarkTechPost : MarkTechPost