Voici une information qui pourrait bien avoir un impact durable sur le secteur.
Perplexity Open Sources Lily : un moteur d’inférence Rust + Metal pour Qwen3.6-35B-A3B sur Apple Silicon
Perplexity a open source Lily, le moteur d’inférence local derrière Hybrid Compute dans Perplexity Computer. Il s’agit d’un environnement d’exécution à processus unique : une couche Rust charge le point de contrôle et pilote la boucle de génération, une API de complétion de discussion compatible OpenAI diffuse les jetons et des noyaux Metal écrits à la main exécutent le modèle d’IA. Ni PyTorch ni MLX ne se trouvent dans le chemin d’exécution. Lily est délibérément étroite avec un seul système, Qwen3.6-35B-A3B, sur une seule famille de matériel et cette étroitesse est l’argument de performances.
Point notable, est-il déployable ? Oui. Une démo autonome est publique dans le référentiel pplx-garden. Un serveur d’inférence Rust and Metal offrant une génération de texte gourmand via une API HTTP minimale compatible OpenAI. Le point de contrôle 4 bits est de 19,4 Go, donc un Mac Apple Silicon avec 32 Go ou plus de mémoire unifiée est le plancher réaliste ; Le produit Hybrid Compute livré par Perplexity répertorie macOS 15+, 24 Go minimum et 32 Go pour de meilleurs résultats.
Dans le même temps, la pile Mac par défaut est MLXplusMLX-LM, qui fournit déjà une implémentation Qwen avec un travail d’experts groupé, un noyau Metal récurrent fusionné et une attention consciente de GQA. Cependant ses opérations doivent rester réutilisables dans toutes les architectures. Lily abandonne cela et regroupe la structure du modèle, les plans d’exécution et la sélection du noyau dans un seul environnement d’exécution.
Qwen3.6-35B-A3B stocke 35B de paramètres et en active environ 3B par jeton. Un routeur note 256 experts et en sélectionne huit, ainsi qu’un expert partagé qui voit chaque jeton. Il mélange par ailleurs 10 couches d’attention complète utilisant une attention de requête groupée (16 têtes de requête, deux têtes KV) avec 30 couches DeltaNet Gated. Cela donne trois modèles : des groupes d’experts inégaux, une attention portée à un cache KV croissant et une récurrence de taille fixe.
Le point de contrôle utilise une quantification affine par groupe sur 4 bits, chaque groupe de 64 poids partageant une échelle et un biais bfloat16, soit environ 70 Go de poids bfloat16 compressés à 19,4 Go. Les opérations du tenseur Metal 4 consomment bfloat16, les poids doivent donc être reconstruits en premier. Lily fait cela une tuile à la fois à l’intérieur du GEMM groupé, conservant les performances dans la mémoire du groupe de threads et les accumulant dans FP32, de sorte que le tableau étendu n’atteigne jamais la mémoire unifiée. Dans l’ablation de Perplexity, cette fusion a augmenté le préremplissage de bout en bout de 77,4 % à une invite de 512 jetons.
À ce sujet, conserver l’histogramme de routage, l’analyse des préfixes, la dispersion et la carte de blocs dans un seul tampon de commande GPU ajouté à 89 % à 512 jetons en supprimant la synchronisation du processeur à l’intérieur de chaque couche MoE. Passage de tuiles de 16 rangées à 32 rangées avec quatre groupes simd ajoutés de 13,2 % en 2K ; une analyse Gated DeltaNet résidant dans le registre a ajouté 5,6 %. Les GEMM experts représentent environ 90 % du temps de pré-remplissage. Les invites longues s’exécutent en morceaux délimités afin que les activations temporaires n’entrent pas en concurrence avec les pondérations et le cache pour la mémoire.
Dans le même temps, le décodage par lots 1 n’a pratiquement aucune réutilisation du poids, donc la bande passante fixe le plafond. Une étape enregistrée a lancé 795 noyaux formant 555 étapes séquentielles ; Lily enregistre les dépendances réelles dans une passe Metal simultanée afin que les noyaux indépendants se chevauchent. Le jeton sélectionné est écrit directement dans l’emplacement d’entrée résident du GPU de l’étape suivante, supprimant ainsi un aller-retour CPU par jeton, et quatre chaînes de noyau sont fusionnées pour conserver les intermédiaires dans les registres.
Ce qu’il faut noter :
- Dans l’ablation de Perplexity, cette fusion a augmenté le préremplissage de bout en bout de 77,4 % à une invite de 512 jetons.
- Les GEMM experts représentent environ 90 % du temps de pré-remplissage.
- Le décodage par lots 1 n’a pratiquement aucune réutilisation du poids, donc la bande passante fixe le plafond.
Reste à voir comment l’industrie va réagir à cette annonce.
À découvrir aussi :
Selon l’information initialement publiée par MarkTechPost : MarkTechPost