OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

Le domaine de l’IA connaît encore aujourd’hui une évolution intéressante.

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour les agents vocaux à faible latence via son API

OpenAI a lancé deux nouveaux modèles « Realtime » via son API. Ils s’appellent « gpt-realtime-2.1 » et « gpt-realtime-2.1-mini ». Tous deux sont destinés aux expériences vocales et multimodales à faible latence. Le modèle « mini » constitue l’élément phare de cette mise à jour. Il s’agit d’un système de raisonnement compact destiné à la voix en temps réel. Son coût est identique à celui de l’ancien système « gpt-realtime-mini ». OpenAI a également réduit la latence p95 d’au moins 25 % sur l’ensemble des modèles vocaux en temps réel. Cette réduction est due à une amélioration de la mise en cache.

gpt-realtime-2.1-mini est un mini-modèle d’IA de raisonnement destiné aux interactions vocales en temps réel. Il répond à des entrées audio et textuelles via une connexion en direct. OpenAI le présente comme l’option la plus rapide et la plus économique de sa gamme.

De plus, l’API en temps réel traite et génère le son à l’aide d’un modèle unique. Cela évite d’enchaîner des systèmes distincts de reconnaissance vocale et de synthèse vocale. Cette conception à modèle unique réduit la latence et préserve les nuances de la parole.

Le raisonnement est ici la principale capacité. Cela signifie que le modèle est capable de réfléchir en interne avant de s’exprimer. Le niveau « mini » prend par ailleurs en charge l’utilisation d’outils, ou l’appel de fonctions, via l’API en temps réel. Ensemble, ces fonctionnalités permettent au système « mini » de planifier une action, d’appeler votre fonction, puis de répondre.

La version supérieure est isgpt-realtime-2.1. Elle apporte une mise à jour de GPT-Realtime-2 avec une reconnaissance alphanumérique améliorée. Elle optimise également la gestion des silences et du bruit, de ce fait que le comportement en cas d’interruption. Elle prend en charge la conversion « parole-parole » avec un niveau de raisonnement configurable, le suivi des instructions et l’utilisation d’outils.

Une astuce pour faire votre choix : optez pour « usegpt-realtime-2.1 » si vous recherchez les meilleures performances en matière de raisonnement en temps réel, d’utilisation des outils, de suivi des instructions et de comportement de l’assistant vocal. Optez pour « usegpt-realtime-2.1-mini » si vous préférez une option plus rapide et plus économique.

Les grandes lignes :

  • Le niveau « mini » prend par ailleurs en charge l’utilisation d’outils, ou l’appel de fonctions, via l’API en temps réel.
  • Elle optimise également la gestion des silences et du bruit, de ce fait que le comportement en cas d’interruption.
  • Optez pour « usegpt-realtime-2.1-mini » si vous préférez une option plus rapide et plus économique.

L’évolution de ce dossier sera à suivre avec attention.

Dans le même ordre d’idées :


Via MarkTechPost : MarkTechPost