OpenAI présente GPT-Red : un modèle interne automatisé de « red teaming » qui a battu les testeurs humains par 84 % contre 13 % lors d’un test d’injection de prompts

Voici une information qui pourrait bien avoir un impact durable sur le secteur.

OpenAI présente GPT-Red : un modèle interne automatisé de « red teaming » qui a battu les testeurs humains par 84 % contre 13 % lors d’un test d’injection de prompts

Cette semaine, OpenAI a publié des informations détaillées sur GPT-Red, un modèle automatisé de « red teaming » réservé à un usage interne. Son rôle consiste à attaquer les propres modèles d’OpenAI et à détecter les vulnérabilités liées à l’injection de prompts.

Parallèlement, openAI avance deux raisons. Les tests de sécurité menés par des humains prennent beaucoup de temps et ne sont pas évolutifs. Les évaluations de robustesse couramment utilisées ont déjà atteint leurs limites avec ses derniers modèles.

Il fonctionne comme un membre d’une équipe de « red team » humaine.

Dans le même temps, la surface d’attaque ne cesse de s’étendre. Les agents consultent des données provenant de tiers via les navigateurs, les applications connectées, les fichiers locaux et divers outils. Ces fonctionnalités sont indispensables à l’exercice de leur travail. Elles permettent aussi à un pirate d’introduire une instruction spécialement conçue dans ces éléments.

GPT-Redis est un modèle, et non un benchmark statique ni une bibliothèque de prompts. Il fonctionne comme un membre d’une équipe de « red team » humaine. Il envoie un prompt, observe la réponse et procède par itérations pour atteindre un objectif.

De plus, l’équipe d’OpenAI l’a entraîné en utilisant une puissance de calcul comparable à celle de certaines de ses plus grandes séries d’entraînement post-formation, dans un souci de sécurité uniquement.

Deux décisions relatives au déploiement sont importantes. Premièrement, GPT-Red est maintenu séparé des modèles déployés. Cela permet d’empêcher les acteurs malveillants d’accéder à ses compétences malveillantes. Deuxièmement, il remplit deux fonctions : il détecte les vulnérabilités avant le déploiement et génère des attaques pendant l’entraînement.

Difficile à ce stade de prédire tous les impacts de cette annonce.

Dans le même ordre d’idées :


Lire l’article complet sur MarkTechPost : MarkTechPost