Read in English →

GLOSSAIRE

Base de données vectorielle

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

Une base de données vectorielle stocke les documents sous forme d'embeddings numériques et permet aux systèmes d'effectuer une recherche par sens plutôt que par mot-clé exact. Au lieu de faire correspondre des chaînes de texte, elle retrouve les passages, clauses ou enregistrements sémantiquement proches d'une requête. Dans le traitement documentaire, elle constitue le socle des étapes de récupération d'information (retrieval) qui fournissent le contexte aux modèles de langage avant qu'ils ne répondent à une question ou n'extraient une valeur.

Comment ça fonctionne

Lorsqu'un document est traité, son texte est découpé en fragments (paragraphes, clauses, lignes de tableau), et chaque fragment est converti en vecteur, une liste de nombres qui capture son sens, à l'aide d'un modèle d'embedding. Ces vecteurs sont stockés dans une base conçue pour la recherche par similarité, et non pour la recherche exacte par ligne comme un système SQL traditionnel. La base indexe les vecteurs à l'aide de structures telles que HNSW ou IVF, qui permettent de retrouver les correspondances les plus proches parmi des millions d'entrées en quelques millisecondes, sans avoir à tout parcourir.

Lorsqu'un utilisateur ou une application soumet une requête, celle-ci est elle aussi convertie en vecteur. La base compare ce vecteur de requête aux vecteurs stockés à l'aide d'une mesure de distance (la similarité cosinus est la plus courante) et renvoie les correspondances les plus proches. Ces résultats, généralement les fragments de texte d'origine accompagnés de métadonnées comme l'identifiant du document ou le numéro de page, sont transmis à un modèle de langage en guise de contexte. C'est la partie « récupération » du Retrieval-Augmented Generation.

La plupart des bases de données vectorielles prennent aussi en charge le filtrage : on peut combiner la recherche sémantique avec des contraintes strictes, comme « rechercher uniquement les factures de ce fournisseur » ou « uniquement les contrats signés après 2022 ». Cette combinaison entre classement sémantique et filtrage structuré est précisément ce qui les rend utiles en production, et pas seulement dans des démonstrations.

Pourquoi c'est important pour le traitement documentaire

Les bases de données vectorielles comptent parce que la recherche par mot-clé classique échoue sur des documents réels. Une clause de « résiliation pour convenance » peut être formulée d'une dizaine de façons différentes selon les contrats, et la recherche par mot-clé en manque la plupart. La récupération sémantique retrouve la clause pertinente quelle que soit sa formulation, ce qui explique qu'elle soit au cœur des outils d'analyse contractuelle, de traitement des sinistres et de recherche en conformité.

Elles réduisent aussi le volume de texte qu'un modèle de langage doit lire. Injecter une bibliothèque entière de contrats dans la fenêtre de contexte d'un modèle est lent et coûteux. Une base de données vectorielle ramène cela à une poignée de fragments pertinents, ce qui réduit les coûts et limite le risque que le modèle perde le fil des détails. Cela a un impact direct sur la précision : une mauvaise récupération d'information est l'une des principales causes de réponses erronées dans les systèmes d'IA documentaire, indépendamment de la qualité du modèle sous-jacent.

Termes associés

FAQ

Une base de données vectorielle, est-ce la même chose que le RAG ?

Non. Une base de données vectorielle n'est qu'un des composants d'un pipeline RAG (Retrieval-Augmented Generation). Le RAG désigne le principe général : récupérer le texte pertinent, puis générer une réponse. La base de données vectorielle prend en charge spécifiquement la partie récupération, en stockant et en recherchant des embeddings. Il faut aussi un système de découpage en fragments, un modèle d'embedding et un modèle de langage pour disposer d'un système RAG complet et fonctionnel.

Ai-je besoin d'une base de données vectorielle pour l'extraction de documents ?

Pas toujours. Pour une extraction structurée à partir de types de formulaires connus, l'extraction par gabarit ou par paires clé-valeur fonctionne souvent sans cela. Les bases de données vectorielles deviennent pertinentes lorsqu'il faut effectuer une recherche sémantique sur des ensembles de documents volumineux et variés, par exemple pour retrouver des clauses contractuelles pertinentes ou répondre à des questions ouvertes sur une archive documentaire, là où les gabarits exacts ne s'appliquent pas.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.