Notre approche des règles de l’UE relatives à la provenance des textes

Un pas supplémentaire vient d’être franchi dans cette révolution technologique en cours.

Notre approche des règles de l’UE relatives à la provenance des textes

Promouvoir la transparence dans les limites des technologies actuelles.

La provenance du contenu permet aux utilisateurs de comprendre d’où provient ce contenu, comment il a été créé ou modifié, et s’il contient des signaux associés à nos modèles. Nous avons déjà mis à la disposition du public des outils permettant d’identifier les images et les fichiers audio générés par nos modèles. Aujourd’hui, nous vous présentons notre approche en matière de filigranage de texte, en réponse à la loi européenne sur l’IA, et nous vous expliquons comment celle-ci s’inscrit dans le cadre plus large de nos activités.

Notons par ailleurs, la loi européenne sur l’IA impose aux fournisseurs d’IA générative de rendre les textes générés identifiables sous une forme lisible par machine. Le tatouage numérique et la détection des textes restent des technologies naissantes présentant des limites importantes, et les points de vue concernant leurs avantages et leurs utilisations responsables sont encore en cours d’évolution. Notre approche par étapes tient compte à la fois des exigences de la loi européenne sur l’IA et des limites de cette technologie, en mettant l’accent sur la transparence quant à ce qu’un filigrane textuel peut et ne peut pas révéler :

À compter d’aujourd’hui, les clients de l’API du monde entier pourront activer le tatouage de texte pour certains modèles. Le tatouage de texte restera désactivé par défaut dans l’API.

Au cours des prochaines semaines, nous ajouterons un filigrane invisible aux textes générés par ChatGPT et Codex dans l’Union européenne, lorsque cela sera applicable.

À relever, nous ouvrons les candidatures pour l’accès à notre détecteur de filigranes textuels. Dans un premier temps, l’accès sera réservé aux chercheurs agréés et aux organismes spécialisés susceptibles de nous aider à évaluer et à optimiser cette technologie.

Dans la foulée, ce qui précède ne s’applique qu’à la provenance des textes : nos outils de vérification pour les fichiers audio et les images, notamment l’ouropenai.com/verify⁠et notre API Content Provenance⁠(s’ouvre dans une nouvelle fenêtre), resteront accessibles au public pour les organisations souhaitant déterminer si une image ou un fichier audio a été généré par l’un de nos systèmes.

Notre technologie de tatouage numérique, textGrain, ajoute un signal statistique invisible aux choix lexicaux du modèle. Notre détecteur travaux de recherche ce signal afin de déterminer si un passage contient un filigrane OpenAI. Vous trouverez plus de détails sur le fonctionnement de textGrain dans notre rapport technique⁠(s’ouvre dans une nouvelle fenêtre), qui sera mis à jour avec des informations supplémentaires dans les semaines à venir. Nous prévoyons également de mettre cette technologie à disposition en open source afin que d’autres puissent s’en inspirer.

Une affaire qui méritera assurément d’être suivie de près.

Sur le même sujet :


Via OpenAI : OpenAI