Nums AI lance Causilo : un système de base tabulaire qui arrive en tête du classement TabArena parmi les modèles individuels

L’innovation IA ne faiblit pas, comme en témoigne cette nouvelle annonce.

Nums AI lance Causilo : un système de base tabulaire qui arrive en tête du classement TabArena parmi les modèles individuels

Nums AI a lancé Causilo, un modèle de base tabulaire pré-entraîné destiné à la classification et à la régression. Causilo est fourni avec une interface scikit-learn, un code sous licence Apache 2.0 et des poids pré-entraînés disponibles sur Hugging Face. Sur TabArena, il affiche le meilleur classement Elo parmi les modèles individuels, tant pour la classification que pour la régression.

Est-ce déployable ? Oui, à des fins de recherche et d’évaluation dès aujourd’hui, sur CUDA ou CPU. L’utilisation commerciale, en production et via une API hébergée nécessite une licence distincte auprès de Nums AI.

Causilo est un modèle d’apprentissage contextuel. L’appel de la fonction `fit` ne met pas à jour les poids pré-entraînés. Il stocke les lignes d’entraînement en tant que contexte et prédit les lignes de requête en un seul passage avant. D’après sa soumission à TabArena, Nums AI a pré-entraîné Causilo uniquement sur des données synthétiques, sans utiliser les ensembles de données de TabArena.

Les données d’entrée peuvent être des tableaux NumPy ou des DataFrames pandas, y compris des caractéristiques catégorielles et des valeurs manquantes. La classification prend en charge jusqu’à 10 classes. La régression renvoie par défaut des prédictions de moyenne. La version 1.0.1 ajoute des résultats de médiane et de quantiles, basés sur 999 quantiles natifs.

Nums AI divise le réseau en trois phases : affinage, compression et apprentissage en contexte. Le code et les configurations mis à disposition montrent comment fonctionne chaque phase.

Autre élément, les caractéristiques sont regroupées par séries de trois. Chaque valeur intègre 16 fréquences sinusoïdales et cosinusoïdales apprises. Les valeurs manquantes se voient attribuer leur propre vecteur appris.

Deux étages de colonnes résument chaque groupe de caractéristiques. Dans chacun d’eux, 128 emplacements latents lisent uniquement les lignes d’apprentissage et transmettent ce résumé à chaque ligne. Entre les deux étages de colonnes, un étage de lignes permet aux groupes de caractéristiques d’interagir par le biais de 4 jetons latents. Il utilise l’attention croisée plutôt que l’auto-attention complète, ce qui, selon Nums AI, permet de maintenir le coût linéaire par rapport au nombre de caractéristiques.

En synthèse :

  • Le code et les configurations mis à disposition montrent comment fonctionne chaque phase.
  • Les caractéristiques sont regroupées par séries de trois.
  • Entre les deux étages de colonnes, un étage de lignes permet aux groupes de caractéristiques d’interagir par le biais de 4 jetons latents.

Les mois à venir apporteront sans doute plus de précisions.

Sur le même sujet :


Via MarkTechPost : MarkTechPost