GLOSSAIRE
Embeddings (plongements vectoriels)
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
Les embeddings sont des représentations numériques de texte, d'images ou de la mise en page de documents, exprimées sous forme de vecteurs de nombres qui capturent le sens plutôt que le libellé exact. Deux contenus ayant une signification similaire se retrouvent avec des vecteurs qui sont proches dans cet espace numérique, même s'ils utilisent des mots ou des mises en forme différents. Dans le traitement de documents, les embeddings permettent à un système de comparer, de rechercher et de regrouper des documents ou des fragments de documents par leur signification, et pas seulement par la correspondance des caractères.
Fonctionnement
Un modèle, généralement un réseau neuronal entraîné sur de grands volumes de texte ou d'images de documents, convertit un contenu en un vecteur de longueur fixe, souvent de quelques centaines à quelques milliers de nombres. Cela se produit à différents niveaux de granularité : un document entier, une page, un paragraphe ou un seul bloc produit lors du segmentation. Le modèle apprend à placer les contenus sémantiquement liés près les uns des autres dans l'espace vectoriel pendant l'entraînement, de sorte que « total facture » et « montant dû » se retrouvent proches même si les chaînes de caractères diffèrent.
Une fois que vous avez des embeddings, vous pouvez mesurer la distance entre les vecteurs (généralement la similarité cosinus) pour classer le degré de parenté entre deux contenus. C'est le mécanisme qui sous-tend la recherche sémantique, le regroupement de documents et la détection des doublons. Il est également à la base de la génération augmentée de récupération (RAG), où un système intègre une requête, recherche dans un index vectoriel les blocs de documents les plus proches et fournit ces blocs à un modèle linguistique comme contexte.
Pour les documents en particulier, certains modèles d'embedding prennent en compte la mise en page et la structure visuelle en plus du texte, ce qui est important pour les formulaires, les tableaux et les pages numérisées où la position sur la page a une signification. Cela relie les embeddings à l'analyse de la mise en page des documents et aux modèles multimodaux comme un modèle vision-langage (VLM), qui peut intégrer directement une image d'une page sans étape d'OCR distincte.
Pourquoi c'est important pour le traitement de documents
Les embeddings résolvent un vrai problème : la correspondance exacte des mots-clés échoue lorsque les documents utilisent des termes, des abréviations ou des formats incohérents. Une recherche de « clause de résiliation » devrait également faire apparaître un paragraphe intitulé « droits de sortie anticipée ». Les embeddings rendent cela possible, c'est pourquoi ils sous-tendent la plupart des fonctionnalités modernes de recherche et de récupération dans les plateformes de documents.
Ils alimentent également les flux de travail basés sur la similarité : trouver des contrats quasi-doublons, signaler une réclamation qui ressemble à des schémas de fraude connus, ou regrouper les factures par fournisseur même lorsque les noms des fournisseurs sont formatés différemment. Dans l'analyse de contrats et le traitement des demandes d'assurance, ce type de récupération s'exécute souvent parallèlement à l'extraction structurée plutôt que de la remplacer. Les embeddings ne remplacent pas l'extraction clé-valeur ou l'extraction de tableaux précises ; ils constituent une couche complémentaire pour la recherche, la récupération et la comparaison sur de grands ensembles de documents.
Termes associés
- Génération augmentée de récupération (RAG)
- Segmentation (Chunking)
- Modèle vision-langage (VLM)
- Analyse de la mise en page des documents
- Extraction de données
FAQ
Les embeddings sont-ils la même chose que l'OCR ?
Non. L'OCR convertit une image de texte en caractères lisibles par machine. Les embeddings prennent du texte (ou de plus en plus, des images) qui est déjà numérique et le convertissent en un vecteur numérique pour la comparaison et la recherche. Un pipeline de documents a souvent besoin des deux : l'OCR pour lire la page, les embeddings pour rechercher ou récupérer sur de nombreuses pages. Voir la comparaison dans OCR vs VLM.
Ai-je besoin d'embeddings si je n'extrais que des champs structurés ?
Pas nécessairement. Si votre tâche consiste à extraire des champs fixes comme le numéro de facture ou la date de la police, les méthodes d'extraction directes telles que l'extraction zero-shot ou l'extraction clé-valeur fonctionnent généralement mieux et sont plus faciles à auditer. Les embeddings deviennent précieux lorsque vous avez besoin de rechercher, de regrouper ou de récupérer sur de grands ensembles de documents variés.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.