Nouvelle étape franchie dans l’univers des technologies d’intelligence artificielle.
Yandex présente Sona : un système de recommandation génératif unique qui remplace l’ensemble de la cascade de recommandations
La plupart des systèmes de recommandation en production fonctionnent en cascade. Des générateurs de candidats alimentent un pré-classificateur, qui alimente à son tour un classificateur complexe reposant sur des centaines de caractéristiques artificielles. Le rapport technique de Yandex consacré à Sona décrit une architecture différente. Sona est un système d’IA générative qui regroupe la génération de candidats et leur classement au sein d’un même système, remplaçant ainsi les multiples étapes généralement utilisées dans les pipelines de recommandation. Yandex a testé ce modèle dans le cadre d’une expérience de sept jours en conditions réelles sur ses enceintes connectées. Lors d’un test A/B en ligne, l’entreprise a remplacé plus de 15 générateurs candidats, ainsi que les étapes de pré-classement et de classement, par un seul « Transformer » mis en service.
Par ailleurs, les cascades répartissent une décision entre des modèles entraînés séparément. Chaque étape optimise son propre objectif, et le module de classement ne voit que ce que les étapes en amont lui transmettent. L’architecture précédente de Yandex sur la plateforme Yandex Music exploitait des centaines de caractéristiques, y compris des signaux provenant d’Argus, l’ancien transformateur de recommandation de Yandex. Sona organise la génération et le classement des candidats autour d’une représentation commune de l’utilisateur. L’encodeur lit l’historique de l’auditeur une fois par requête. Un décodeur génère des candidats. Un module de classement les note en fonction des mêmes états de l’encodeur. Aucun composant n’utilise de caractéristiques définies manuellement. Les données d’entrée sont des champs d’événements enregistrés (ID du morceau, ID de l’artiste, durée, « j’aime », temps d’écoute, indicateurs de diffusion) et des identifiants sémantiques appris.
Sur les enceintes connectées Yandex, la lecture peut démarrer sans que l’utilisateur ait au préalable sélectionné un artiste, un genre musical ou une ambiance. L’équipe de recherche qualifie ce mode de « mode de recommandation pure ».
Conformément à la formulation « Semantic ID » de Rajput et al., chaque piste devient un tuple composé de 3 codes discrets. Un LLM multimodal « gelé » lit le spectrogramme mel des 90 premières secondes ainsi que le titre, les artistes et les balises. Il fonctionne en mode « préremplissage uniquement ». Un transformateur de raffinement à 4 couches aligne ensuite ces caractéristiques avec le comportement d’écoute, en utilisant l’InfoNCE sur des paires de morceaux collaboratives. Une méthode K-means résiduelle quantifie le résultat en 3 livres de codes de 32 000 entrées chacun. Ce résultat a dépassé la référence audio du CLMR : le Recall@1000 est passé de 0,8111 à 0,8524.
Sona traite 8 192 événements passés. Une attention complète sur toute cette durée étant coûteuse, l’encodeur répartit la profondeur de manière inégale. Les 2 048 événements les plus récents bénéficient d’une pile d’auto-attention à 7 couches. Les événements plus anciens ne passent que par une attention croisée et une seule couche couvrant l’historique complet. L’article indique que cela offre la possibilité de conserver la majeure partie de la qualité de l’attention complète pour environ la moitié du coût d’inférence.
Un décodeur à deux couches génère des tuples d’identifiants sémantiques (Semantic ID) grâce à une travaux de recherche par faisceau contraint d’une largeur de 1 024. Un trie de catalogue bloque les préfixes non valides. Chaque tuple est étendu à toutes les pistes qui le partagent. Le module de classement, composé de quatre couches d’attention croisée, attribue ensuite un score à ces pistes par rapport à la mémoire partagée de l’encodeur.
Les implications concrètes de cette annonce se dessineront progressivement.
Pour aller plus loin :
- Un responsable de la sécurité chez OpenAI démissionne, affirmant que « la culture d’entreprise est défaillante » | TechCrunch
- Les dernières actualités sur l’IA que nous avons annoncées en septembre 2026
Via MarkTechPost : MarkTechPost