L’émergence de la couche d’infrastructure de données Web pour l’IA

Une évolution notable vient d’être rendue publique dans le domaine.

L’émergence de la couche d’infrastructure de données Web pour l’IA

À mesure que l’IA continue de progresser, les infrastructures doivent évoluer pour permettre l’accès et la diffusion d’informations en temps réel à grande échelle.

L’IA connaît un essor fulgurant. De nouveaux cas d’utilisation apparaissent chaque jour. Pour tirer pleinement parti du potentiel de cette technologie, les entreprises ont besoin de données à grande échelle. Or, dans de nombreux cas, les informations pertinentes sont inaccessibles ou non structurées, ce qui limite leur utilisation par les modèles d’IA.

Pour bien saisir ce défi, il faut se pencher sur les fondements mêmes du Web.

Point notable, pour bien saisir ce défi, il faut se pencher sur les fondements mêmes du Web. Le Web n’a pas été conçu pour la découverte et la récupération automatisées que requièrent les nouvelles applications d’IA. Pour surmonter cette contrainte inhérente à sa conception, il faut mettre en place une infrastructure adaptée.

Point notable, la prochaine étape dans le domaine de l’IA pourrait dépendre d’une récente couche d’infrastructure de données Web capable de permettre aux modèles de découvrir et de cartographier cet univers numérique en constante expansion. Cette couche doit être capable de parcourir des centaines de millions de domaines Web existants et des milliards de nouvelles URL créées chaque semaine, afin de fournir des informations en temps réel et de surmonter les obstacles techniques.

À ce sujet, « Ces données laissent penser qu’il en existe bien d’autres », explique Or Lenchner, PDG de Bright Data, une plateforme de collecte de informations sur Internet. « Prenons l’exemple de l’univers : il est là, mais on ignore ce qu’on ignore. »

Alors que les premières avancées en matière d’IA reposaient sur l’augmentation du volume des informations d’entraînement et de la taille des modèles, les structures se heurtent aujourd’hui à un obstacle majeur : elles doivent s’adapter à la nature dynamique, non structurée et en constante évolution des données du Web afin de fonder leurs résultats sur des informations actuelles et vérifiables. Les performances de l’IA dépendent de plus en plus non seulement de l’architecture du modèle d’IA, toutefois aussi des capacités du mécanisme en matière de calcul, de réseau, d’extraction et d’ingénierie des informations — c’est-à-dire de sa capacité à extraire rapidement et de manière fiable des données récentes, pertinentes et fiables.

Par ailleurs, l’entraînement des modèles traditionnels repose sur des instantanés d’informations recueillies à un moment donné. Entraîner l’IA à partir de ces données statiques n’est plus suffisant. Pour suivre les fluctuations telles que les prix pratiqués par la concurrence, le moral des consommateurs et les tendances du marché, les entreprises ont besoin d’un flux constant d’informations nouvelles, leur permettant d’extraire des éléments en temps réel de ce fait que le contexte pertinent. Leur infrastructure doit donc être capable de gérer des millions d’interactions simultanées sur des sites web qui varient selon la zone géographique, la langue, le format et les règles d’accès.

Ce développement s’ajoute à une longue série d’évolutions dans le secteur.

Dans le même ordre d’idées :


D’après MIT Technology Review : MIT Technology Review