Voici une annonce qui mérite l’attention des observateurs du secteur.
Baidu lance « Unlimited OCR », un modèle de 3B qui maintient le cache KV à un niveau constant pour l’analyse de documents longs
Baidu a mis en open source son logiciel « Unlimited OCR » le 22 juin 2026. Ce logiciel lit des documents volumineux en un seul passage grâce à un cache d’attention plat.
À noter également, la plupart des modèles OCR de bout en bout voient leurs performances diminuer à mesure que le volume de données générées augmente. Chaque token généré vient s’ajouter au cache clé-valeur. La consommation de mémoire augmente et la génération ralentit. L’analyse de dizaines de pages devient alors impraticable. La solution « Unlimited OCR » de Baidu résout directement ce problème. Elle remplace le mécanisme d’attention du décodeur par une architecture qui maintient la consommation de mémoire à un niveau constant.
Parallèlement, unlimited OCR s’appuie sur DeepSeek OCR comme base de référence. Il conserve le DeepEncoder et le décodeur de type « Mixture-of-Experts » (MoE). La conception MoE comporte au total 3 milliards de paramètres, toutefois n’en active que 500 millions lors de l’inférence.
DeepEncoder est le moteur de compression. Il associe en cascade un SAM-ViT utilisant l’attention par fenêtre à un CLIP-ViT utilisant l’attention globale. Au niveau du pont, il applique une compression de 16× des tokens. Une image PDF de 1024×1024 ne contient plus que 256 tokens visuels. Moins il y a de tokens en entrée, plus le préremplissage est réduit.
DeepEncoder prend en charge nativement cinq modes de résolution, tandis qu’Unlimited OCR en propose deux. Le mode « Base » fonctionne en 1024×1024 pour les documents de divers pages. Le mode « Gundam » utilise une résolution dynamique pour les pages individuelles.
La contribution porte sur l’attention à fenêtre glissante de référence (Reference Sliding Window Attention). L’attention multi-têtes standard (Multi-Head Attention) stocke une clé et une valeur pour chaque token. À mesure que la longueur de sortie T augmente, la taille du cache augmente également. Cette taille est donnée par la formule CMHA(T) = Lm + T. La consommation de mémoire et la latence augmentent sans limite.
Pour les professionnels du domaine, cette annonce mérite d’être surveillée.
À découvrir aussi :
- Une députée nie que son équipe ait utilisé l’IA pour rédiger un amendement sur le financement de la défense
- Les 7 types de mémoire des agents : guide technique à l’intention des ingénieurs en IA
Source originale : MarkTechPost : MarkTechPost