Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d’une IA centrée sur l’humain, reposant sur des poids de modèles personnalisables

Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d'une IA centrée sur l'humain, reposant sur des poids de modèles personnalisables

Le secteur de l’IA vient d’être le théâtre d’un développement notable. Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d’une IA centrée sur l’humain, reposant sur des poids de modèles personnalisables Thinking Machines Lab a publié un rapport visant à développer une IA qui prolonge la volonté et … Lire la suite

Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation

Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation

Le secteur technologique continue de livrer des avancées remarquables. Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation Robbyant, une filiale d’Ant Group, a lancé LingBot-VLA 2.0, un modèle de base « Vision-Language-Action » (VLA) destiné aux robots. Cette version comprend un … Lire la suite

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d'IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l'intelligence textuelle de son architecture de base

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours. NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base NVIDIA a lancé Audex (Nemotron-Labs-Audex-30B-A3B), un grand modèle linguistique unifié combinant audio et texte. Il comprend et génère … Lire la suite

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

Le domaine de l’IA connaît encore aujourd’hui une évolution intéressante. OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API OpenAI a lancé deux nouveaux modèles « Realtime » via son API. Ils s’appellent « gpt-realtime-2.1 » et « gpt-realtime-2.1-mini ». Tous deux sont destinés aux expériences vocales et multimodales … Lire la suite

Google AI lance DiffusionGemma, un modèle ouvert de 26 milliards de paramètres utilisant la diffusion de texte pour une génération jusqu’à quatre fois plus rapide

Google AI lance DiffusionGemma, un modèle ouvert de 26 milliards de paramètres utilisant la diffusion de texte pour une génération jusqu'à quatre fois plus rapide

Voici une annonce qui mérite l’attention des observateurs du secteur. Google AI lance DiffusionGemma, un modèle ouvert de 26 milliards de paramètres utilisant la diffusion de texte pour une génération jusqu’à quatre fois plus rapide Le nouveau système ouvert expérimental de Google remplace le décodage token par token par une diffusion de texte en parallèle, … Lire la suite

Le nouveau modèle Gemma 4 12B de Google est conçu pour fonctionner sur n’importe quel ordinateur portable doté de 16 Go de mémoire vive

Le nouveau modèle Gemma 4 12B de Google est conçu pour fonctionner sur n'importe quel ordinateur portable doté de 16 Go de mémoire vive

L’industrie de l’IA poursuit sa transformation rapide avec cette nouvelle annonce. Le nouveau modèle Gemma 4 12B de Google est conçu pour fonctionner sur n’importe quel ordinateur portable doté de 16 Go de mémoire vive Gemma 4 12B utilise un nouveau schéma de codage et la prédiction de tokens pour se montrer à la hauteur … Lire la suite

MiniMax lance MiniMax M3 avec une architecture MSA prenant en charge le contexte 1M-Token, la multimodalité native et le codage agentique

MiniMax lance MiniMax M3 avec une architecture MSA prenant en charge le contexte 1M-Token, la multimodalité native et le codage agentique

Voici une information qui pourrait bien avoir un impact durable sur le secteur. MiniMax lance MiniMax M3 avec une architecture MSA prenant en charge le contexte 1M-Token, la multimodalité native et le codage agentique MiniMax a officiellement lancé MiniMaxM3 le 1er juin 2026. Le modèle introduit MSA (MiniMax Sparse Attention), une récente architecture d’attention clairsemée … Lire la suite

Concevoir un pipeline RLVR multimodal complet avec Open-MM-RL, l’utilisation de prompts vision-langage, l’évaluation des récompenses et l’exportation vers GRPO

Concevoir un pipeline RLVR multimodal complet avec Open-MM-RL, l'utilisation de prompts vision-langage, l'évaluation des récompenses et l'exportation vers GRPO

L’actualité tech du jour met en lumière un développement significatif. Concevoir un pipeline RLVR multimodal complet avec Open-MM-RL, l’utilisation de prompts vision-langage, l’évaluation des récompenses et l’exportation vers GRPO Dans ce tutoriel, nous explorons l’ensemble de informations TuringEnterprises/Open-MM-RL comme base pratique pour le raisonnement multimodal et l’apprentissage par renforcement avec des récompenses vérifiables. Nous chargeons … Lire la suite

L’équipe Qwen d’Alibaba présente Qwen3.5-LiveTranslate-Flash : une interprétation multimodale en temps réel dans 60 langues avec un temps de latence de 2,8 secondes

L'équipe Qwen d'Alibaba présente Qwen3.5-LiveTranslate-Flash : une interprétation multimodale en temps réel dans 60 langues avec un temps de latence de 2,8 secondes

Le secteur technologique continue de livrer des avancées remarquables. L’équipe Qwen d’Alibaba présente Qwen3.5-LiveTranslate-Flash : une interprétation multimodale en temps réel dans 60 langues avec un temps de latence de 2,8 secondes L’interprétation simultanée est l’un des problèmes les plus complexes de l’IA appliquée. On demande en effet à un modèle de traduire un discours … Lire la suite

Les 10 principaux modèles d’IA physique équipant les robots du monde réel en 2026

Les 10 principaux modèles d'IA physique équipant les robots du monde réel en 2026

Un développement récent dans le monde de l’IA attire l’attention. Les 10 principaux modèles d’IA physique équipant les robots du monde réel en 2026 L’écart entre les capacités des modèles linguistiques et leur déploiement dans le domaine de la robotique s’est considérablement réduit au cours des 18 derniers mois. Une nouvelle catégorie de modèles de … Lire la suite