Perplexity lance « pplx-embed-v2-context-9b-preview » : un modèle d’intégration contextuelle qui fournit des réponses et les éléments qui les étayent

Voici une annonce qui mérite l’attention des observateurs du secteur.

Perplexity lance « pplx-embed-v2-context-9b-preview » : un modèle d’intégration contextuelle qui fournit des réponses et les éléments qui les étayent

Perplexity Research et turbopuffer ont publié « pplx-embed-v2-context-9b-preview », un modèle d’encodage contextuel destiné aux pipelines RAG. Chaque segment est encodé en tenant compte du document dans son intégralité. Le véritable changement réside dans le signal d’apprentissage. Le modèle apprend à extraire la réponse ainsi que le contexte nécessaire pour la vérifier, et non pas un seul « passage de référence ». P

Est-il déployable ? Oui, en tant qu’aperçu auto-hébergé. Les poids sont disponibles sur Hugging Face sous licence MIT. Le chargement nécessite la version transformers >= 5.4.0 avec trust_remote_code=True. Il n’est pas encore disponible sur l’API Perplexity. La fiche du modèle d’IA précise que les poids et l’interface sont susceptibles d’évoluer sans garantie de rétrocompatibilité.

Les systèmes RAG divisent les longs documents en segments. Un segment dépend souvent d’une entité, d’un titre ou d’une définition mentionnée ailleurs. Les modèles contextuels résolvent ce problème grâce au « late chunking ». Le document est encodé en un seul passage, puis regroupé par segment.

L’entraînement, cependant, ne retient généralement qu’un seul segment « or » par requête. Tous les autres segments sont considérés comme négatifs, y compris les phrases qui permettent de vérifier la réponse. Perplexity énumère trois autres problèmes. Les étiquettes binaires fournissent un signal trop grossier. Le coût d’annotation des grands modèles de langage (LLM) augmente de manière linéaire avec la taille de l’ensemble de données. Les étiquettes sont également liées à une seule stratégie de découpage en segments.

À ce sujet, « The teacher » est le modèle de compression contextuelle sensible à la requête de Perplexity. Il analyse simultanément la requête et le document, puis attribue un score à chaque token.

À noter également, chaque lot utilise une stratégie d’échantillonnage aléatoire par blocs. Les blocs sont séparés par un token <|chunk_sep|> appris, puis soumis à un pooling de moyenne. Le « teacher » ne fonctionne que pendant l’entraînement ; ainsi, l’inférence n’entraîne ni latence ni besoin de stockage supplémentaire.

Le système s’appuie sur un système de exploration ColBERT 9B développé en interne. Une projection linéaire génère 2 048 dimensions. L’entraînement « Matryoshka » prend aussi en charge 1 024 dimensions. L’entraînement tenant compte de la quantification permet d’obtenir des représentations int8 natives. Cette version est un ensemble de modèles comprenant plusieurs points de contrôle. L’entraînement a utilisé environ 430 ensembles de informations couvrant plus de 50 langues, sans données ConTEB.

Présentation interactive de l’aperçu de l’intégration contextuelle de Perplexity : pourquoi les extraits isolés ne fonctionnent pas, comment la distillation par enseignant remplace le « passage de référence » unique, et ce que signifient les chiffres présentés.

Un dossier qu’il faudra continuer à observer dans les mois à venir.

Dans le même ordre d’idées :


D’après MarkTechPost : MarkTechPost