Together AI open-source OSCAR : un système de quantification de cache KV à 2 bits tenant compte de l’attention pour le service de modèles de langage à long contexte
Nouvelle information marquante dans l’actualité IA. Together AI open-source OSCAR : un système de quantification de cache KV à 2 bits tenant compte de l’attention pour le service de modèles de langage à long contexte L’inférence sur des contextes longs fait du cache clé-valeur l’un des principaux facteurs de coût liés à l’exploitation des modèles … Lire la suite