GLOSSAIRE
Génération augmentée par récupération (RAG)
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
La génération augmentée par récupération (RAG) est une technique qui permet à un modèle linguistique de répondre à des questions en utilisant des informations provenant d'une source de connaissances externe, plutôt que de se fier uniquement à ce qu'il a appris pendant sa formation. Une étape de récupération trouve les passages les plus pertinents pour une requête donnée, et le modèle génère ensuite sa réponse en se basant sur le texte récupéré. Dans les entreprises qui traitent beaucoup de documents, la « source de connaissances » est généralement un ensemble de PDF, de scans et de contrats, et c'est là que la plupart des systèmes RAG échouent discrètement.
Comment ça marche
Un pipeline RAG comporte trois étapes, et chacune dépend de la précédente. Premièrement, les documents sont divisés en morceaux et convertis en embeddings vectoriels, stockés dans un index de recherche. Deuxièmement, lorsqu'un utilisateur pose une question, le système intègre la requête et récupère les morceaux qui en sont sémantiquement les plus proches. Troisièmement, le modèle linguistique lit ces morceaux en même temps que la question et rédige une réponse, idéalement avec des citations renvoyant à la source.
L'étape que les gens sous-estiment est la toute première: extraire un texte propre des documents originaux. Si une clause de contrat a été extraite avec un tableau dont le contenu est illisible, ou si une facture scannée a été lue avec des chiffres intervertis, l'embedding de ce morceau sera construit à partir d'un texte erroné. La récupération pourrait toujours trouver le bon document, mais le modèle raisonnera sur un contenu corrompu. Aucune quantité d'incitations intelligentes ne pourra corriger cela par la suite.
C'est pourquoi l'analyse documentaire est en amont de tout le reste dans le RAG. L'OCR simple gère raisonnablement bien le texte propre et tapé, mais a du mal avec la mise en page, les tableaux et l'écriture manuscrite. Des systèmes plus performants utilisent l'ICR pour les champs manuscrits ou un VLM qui lit une page comme le ferait une personne, en gardant la structure et le contexte intacts. La qualité de cette première étape de conversion fixe une limite à la qualité finale de la réponse.
Pourquoi c'est important pour le traitement des documents
La plupart des échecs de RAG imputés au modèle linguistique sont en réalité des échecs d'analyse. Un total mal lu sur une facture, une clause déformée dans un bail, un tableau dont les lignes et les colonnes ont été brouillées: ces erreurs entrent silencieusement dans l'index et ne sont jamais signalées, car l'étape de récupération « réussit » tout de même à trouver le document. Le modèle génère alors une réponse confiante, mais erronée, basée sur une mauvaise entrée.
Cela est particulièrement important dans les flux de travail réglementés ou à enjeux élevés: l'analyse de contrats, les demandes d'indemnisation et l'intégration KYC impliquent tous des documents avec une structure dense, des formats mixtes et des conséquences juridiques ou financières en cas d'erreurs de détail. Avant d'investir dans le réglage de la récupération, la stratégie de découpage ou un modèle plus grand, il est utile de vérifier ce qui entre réellement dans l'index. Comparer les approches OCR et VLM pour vos types de documents est souvent la solution la plus efficace disponible, moins coûteuse que le réentraînement ou la réarchitecture de la couche de récupération, et elle s'attaque à la cause profonde plutôt qu'à un symptôme.
Termes associés
- OCR vs VLM
- Modèle Vision-Langage (VLM)
- Traitement Intelligent de Documents (IDP)
- Analyse de contrats
- Développer ou acheter un IDP
FAQ
Une meilleure analyse modifie-t-elle réellement la sortie RAG, ou est-ce principalement un problème de récupération?
Les deux sont importants, mais l'analyse vient en premier. Si le texte d'un morceau est erroné, la récupération peut toujours le classer comme pertinent, et le modèle générera une réponse à partir d'un contenu corrompu. Corriger la logique de récupération sans corriger la qualité d'extraction signifie simplement que le système trouve les mauvaises informations plus rapidement et les énonce avec plus de confiance.
L'OCR seule peut-elle prendre en charge un système RAG fiable pour les contrats ou les factures?
Pour les pages propres, tapées et bien scannées, souvent oui. Pour les tableaux denses, l'écriture manuscrite, les tampons ou les mises en page incohérentes, l'OCR simple a tendance à introduire des erreurs qui se propagent silencieusement dans l'index. Un VLM ou une approche combinée LAD/RAD gère généralement ces cas avec moins de corrections en aval.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.