RAG « pixel-native » : guide pratique de l’indexation visuelle des documents

RAG « pixel-native » : guide pratique de l'indexation visuelle des documents

Une évolution notable vient d’être rendue publique dans le domaine. RAG « pixel-native » : guide pratique de l’indexation visuelle des documents Dans ce tutoriel, nous construisons de A à Z un pipeline complet de génération augmentée par la recherche, natif pour Pixel, et nous examinons comment fonctionne la recherche de documents sans recourir à … Lire la suite

PolyAI lance Dialog-RSN-1 : un modèle de dialogue natif audio qui intègre la gestion des tours de parole, la reconnaissance vocale, l’appel de fonctions et la réponse

PolyAI lance Dialog-RSN-1 : un modèle de dialogue natif audio qui intègre la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la réponse

Une évolution notable vient d’être rendue publique dans le domaine. PolyAI lance Dialog-RSN-1 : un modèle de dialogue natif audio qui intègre la gestion des tours de parole, la reconnaissance vocale, l’appel de fonctions et la réponse PolyAI a lancé Dialog-RSN-1, un système de dialogue qui perçoit directement le son de l’appelant au lieu de … Lire la suite

Google dévoile Gemini Robotics 2.0, qui promet une dextérité et une sécurité accrues

Google dévoile Gemini Robotics 2.0, qui promet une dextérité et une sécurité accrues

Le domaine de l’IA connaît encore aujourd’hui une évolution intéressante. Google dévoile Gemini Robotics 2.0, qui promet une dextérité et une sécurité accrues La gamme Gemini Robotics 2 comprend trois modèles, mais un seul est actuellement disponible à la vente. De plus, les robots équipés des modèles d’IA Gemini de Google sont désormais plus performants. … Lire la suite

Google dévoilement Gemini 3.6 Flash et une IA dédiée à la cybersécurité, et donne un avant-goût de Gemini 3.5 Pro et Gemini 4

Google dévoilement Gemini 3.6 Flash et une IA dédiée à la cybersécurité, et donne un avant-goût de Gemini 3.5 Pro et Gemini 4

Voici une annonce qui mérite l’attention des observateurs du secteur. Google dévoilement Gemini 3.6 Flash et une IA dédiée à la cybersécurité, et donne un avant-goût de Gemini 3.5 Pro et Gemini 4 Il existe aujourd’hui de nouveaux modèles 3.6 et 3.5, mais Google est déjà en train d’entraîner Gemini 4. En parallèle, google a … Lire la suite

Google Vids vous rend possible désormais de jouer les vedettes dans vos propres vidéos générées par l’IA | TechCrunch

Google Vids vous rend possible désormais de jouer les vedettes dans vos propres vidéos générées par l'IA | TechCrunch

Les dernières heures ont apporté leur lot d’informations dans l’écosystème IA. Google Vids vous rend possible désormais de jouer les vedettes dans vos propres vidéos générées par l’IA | TechCrunch Les services Soramay d’OpenAI ont peut-être fermé leurs portes, toutefois Google semble penser qu’il existe toujours un intérêt pour un solution permettant de jouer le … Lire la suite

Thinking Machines Lab lance Inkling : un modèle MoE multimodal à poids ouverts comportant 975 milliards de paramètres, dont 41 milliards de paramètres actifs, et dont l’effort de réflexion est contrôlable

Thinking Machines Lab lance Inkling : un modèle MoE multimodal à poids ouverts comportant 975 milliards de paramètres, dont 41 milliards de paramètres actifs, et dont l'effort de réflexion est contrôlable

Un développement récent dans le monde de l’IA attire l’attention. Thinking Machines Lab lance Inkling : un modèle MoE multimodal à poids ouverts comportant 975 milliards de paramètres, dont 41 milliards de paramètres actifs, et dont l’effort de réflexion est contrôlable Thinking Machines Lab vient de lancer Inkling, son premier système entraîné à partir de … Lire la suite

Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d’une IA centrée sur l’humain, reposant sur des poids de modèles personnalisables

Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d'une IA centrée sur l'humain, reposant sur des poids de modèles personnalisables

Le secteur de l’IA vient d’être le théâtre d’un développement notable. Le « Thinking Machines Lab » de Mira Murati présente les arguments techniques en faveur d’une IA centrée sur l’humain, reposant sur des poids de modèles personnalisables Thinking Machines Lab a publié un rapport visant à développer une IA qui prolonge la volonté et … Lire la suite

Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation

Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation

Le secteur technologique continue de livrer des avancées remarquables. Robbyant lance LingBot-VLA 2.0 : un modèle open source 6B de type « vision-langage-action » (VLA) destiné à la manipulation robotique inter-incarnation Robbyant, une filiale d’Ant Group, a lancé LingBot-VLA 2.0, un modèle de base « Vision-Language-Action » (VLA) destiné aux robots. Cette version comprend un … Lire la suite

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d'IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l'intelligence textuelle de son architecture de base

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours. NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un modèle d’IA de langage de grande capacité (LLM) audio-texte unifié qui préserve l’intelligence textuelle de son architecture de base NVIDIA a lancé Audex (Nemotron-Labs-Audex-30B-A3B), un grand modèle linguistique unifié combinant audio et texte. Il comprend et génère … Lire la suite

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

Le domaine de l’IA connaît encore aujourd’hui une évolution intéressante. OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API OpenAI a lancé deux nouveaux modèles « Realtime » via son API. Ils s’appellent « gpt-realtime-2.1 » et « gpt-realtime-2.1-mini ». Tous deux sont destinés aux expériences vocales et multimodales … Lire la suite