Generalist AI lance GEN-1.5 : un modèle de base pour robots capable d’apprendre de nouvelles tâches à partir d’une seule démonstration de 3 à 12 secondes

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours.

Generalist AI lance GEN-1.5 : un modèle de base pour robots capable d’apprendre de nouvelles tâches à partir d’une seule démonstration de 3 à 12 secondes

Generalist AI a lancé GEN-1.5, un modèle de base pour robots capable d’apprendre une nouvelle tâche physique à partir d’une seule démonstration. Il suffit d’introduire 3 à 12 secondes de données sensori-motrices dans sa fenêtre contextuelle de 30 secondes pour que le robot exécute la tâche. Pas de mise à jour des gradients, pas de réglage fin, pas de programmation spécifique à la tâche. Sur 10 tâches de manipulation variées, cette suggestion contextuelle unique a atteint un taux de réussite moyen de 59 % (écart-type de ±10 %) directement à partir du modèle d’IA pré-entraîné. Dix étapes de gradient sur cinq minutes de éléments par tâche ont permis de porter ce taux à 83 % (±9 %). Generalist qualifie ce mécanisme de « prompting physique » et précise qu’il n’a jamais fait l’objet d’un entraînement spécifique : aucune modification architecturale, aucune boucle de méta-apprentissage, aucun objectif auxiliaire. Ce résultat est le fruit de plus de huit mois d’entraînement préalable continu sur des données d’interactions physiques. Les tâches sont simples et à court terme, comme l’indique clairement l’entreprise. Mais il s’agit du premier système, à la connaissance de son équipe, où l’apprentissage en une seule fois de compétences physiques a été mis en œuvre à grande échelle.

En complément, pas encore — il s’agit d’une version de recherche. Il n’y a pas de paramètres publics, pas d’API, pas de page de tarification et pas de produit en libre-service. Generalist AI exécute GEN-1.5 sur sa propre infrastructure et son propre moteur de données. Toute personne souhaitant y avoir accès aujourd’hui doit passer par un partenariat direct.

Il a fait l’objet d’un pré-entraînement continu pendant plus de huit mois sur des données d’interactions physiques capturées dans des logements, des entrepôts et des usines.

Fait intéressant, gEN-1.5 est un modèle d’IA multimodal de grande envergure qui traite des données vidéo, issues de capteurs, linguistiques et proprioceptives, dispose d’une mémoire de 30 secondes et génère des trajectoires d’action à une fréquence de 100 Hz. Il a fait l’objet d’un pré-entraînement continu pendant plus de huit mois sur des données d’interactions physiques capturées dans des logements, des entrepôts et des usines.

Fait intéressant, le mécanisme principal repose sur des incitations physiques. Un exemple sensorimoteur — flux sensoriels et trajectoire de l’action — est inséré dans la fenêtre contextuelle de 30 secondes via une interface de glisser-déposer. Le reste de la fenêtre contient des observations glissantes. Le système exécute alors immédiatement la tâche, sans aucune itération de gradient ni aucun ajustement fin.

Il est essentiel de noter que rien de tout cela n’a été intégré dès la conception. Generalist précise qu’aucune modification architecturale n’a été apportée pour favoriser l’apprentissage en contexte, qu’il n’y a pas de boucle de méta-apprentissage et qu’aucun objectif secondaire n’encourage l’improvisation. Cette capacité est apparue grâce à l’ampleur de l’entraînement préalable, de la même manière que la génération de réponses en une seule étape (one-shot prompting) est apparue dans GPT-3.

Sur 10 tâches variées, les invites contextuelles « one-shot » ont atteint un taux de réussite moyen de 59 % (écart-type de ±10 %) avec le modèle pré-entraîné, sans aucun entraînement supplémentaire. Dix étapes de gradient sur cinq minutes de données par tâche — soit environ 50 démonstrations — ont permis de porter ce taux à 83 % (± 9 %). Dans le cas extrême, une seule étape de gradient sur une minute de données a atteint 66,5 % sur une tâche non utilisée pour l’entraînement, sans aucun balayage des hyperparamètres spécifique à l’adaptation.

L’avenir dira si cette annonce tient toutes ses promesses.

À découvrir aussi :


Selon l’information initialement publiée par MarkTechPost : MarkTechPost