Un nouveau jalon vient d’être franchi dans l’univers de l’intelligence artificielle.
Les meilleurs modèles de langage locaux (LLM) pouvant fonctionner sur un seul GPU de 24 Go en 2026 : comparaison entre Qwen, Gemma, Mistral et DeepSeek
Une seule carte de 24 Go constitue le minimum pratique pour une inférence locale performante. Cela suffit pour des modèles véritablement performants, tout en restant suffisamment compact pour tenir sur un seul GPU. La RTX 3090 et la RTX 4090 s’inscrivent toutes deux dans cette catégorie. Le système de carte dont vous disposez importe moins que les modèles que vous choisissez d’y faire tourner.
Autrefois, les amateurs avaient pour habitude d’intégrer le plus gros modèle quant 70B possible sur la carte. Ce conseil est désormais obsolète. La stratégie 2026, plus performante, utilise des modèles modernes de classe 20B à 35B qui s’intègrent parfaitement. Ceux-ci laissent de la place pour le contexte, tout en restant suffisamment rapides pour le codage, le chat et les agents. Ce guide présente les modèles qui s’intègrent réellement, explique pourquoi chacun d’entre eux vaut la peine d’être utilisé, et détaille comment les 24 Go sont utilisés.
En règle générale, il faut compter environ 1 à 2 Go supplémentaires pour le cache KV et l’exécution dans le cas d’un contexte court.
Sur ce point, trois éléments consomment de la mémoire lors de l’inférence. Un bon choix de découpage est déterminant pour l’adéquation d’un modèle.
Le premier concerne les poids du système. Leur taille dépend du nombre de paramètres et de la quantification. Avec Q4_K_M, une valeur par défaut couramment utilisée pour l’inférence locale, chaque paramètre occupe environ 0,58 octet. Un modèle d’IA de 32 octets nécessite donc environ 18 à 20 Go rien que pour les poids. Les modèles de type « Mixture-of-Experts » (MoE) à la Mixtral constituent ici un piège courant. Chaque expert reste résident dans la VRAM, même lorsque seuls quelques-uns sont utilisés par jeton. Il faut donc dimensionner la mémoire MoE en fonction du nombre total de paramètres, et non des paramètres actifs.
Le deuxième facteur est le cache KV, dont la taille augmente avec la longueur du contexte. Les invites plus longues et les sessions plus longues consomment davantage de VRAM. Le troisième facteur est la surcharge d’exécution liée à la pile de service. En règle générale, il faut compter environ 1 à 2 Go supplémentaires pour le cache KV et l’exécution dans le cas d’un contexte court.
La quantification est le levier qui autorise de rendre les 24 Go exploitables. Q4_K_M offre un équilibre standard entre qualité et encombrement. Les options Q5_K_M et Q6_K améliorent la qualité au détriment de la mémoire. Les options Q8_0 et BF16 sont généralement trop volumineuses pour les modèles de classe 30 milliards sur une seule carte de 24 Go. L’outil interactif ci-dessous vous offre la possibilité de modifier le paramètre de quantification et d’observer en temps réel l’évolution de l’ajustement de chaque modèle.
Tous les modèles présentés ci-dessous sont soumis à une licence permissive, soit Apache 2.0, soit MIT. Ils tiennent tous sur une seule carte de 24 Go en configuration Q4_K_M, avec de la marge pour le contexte. Ils sont regroupés en fonction de la tâche pour laquelle chacun d’entre eux est le plus performant.
Le chapitre n’est pas clos, loin de là.
Pour aller plus loin :
- Quelqu’un a optimisé le MiniCPM5-1B d’OpenBMB sur les traces de « Claude Fable 5 » afin de produire un système de réflexion local de 657 Mo.
- Kimi : une menace ou un danger ? | TechCrunch
Source originale : MarkTechPost : MarkTechPost