Read in English →

GLOSSAIRE

Traçabilité par champ

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

La traçabilité au niveau du champ (ou provenance au niveau du champ) consiste à enregistrer, pour chaque valeur individuelle produite par un système d'extraction, l'emplacement exact d'où elle provient dans le document source : la page, les coordonnées de la zone de détection (bounding box), et souvent le score de confiance du modèle qui l'a produite. Elle permet à un humain ou à un système en aval de remonter d'un champ précis, disons un montant de facture ou un numéro de contrat, jusqu'aux pixels dont il a été extrait. Sans cela, une donnée extraite reste une boîte noire : elle a l'air correcte, mais elle est invérifiable.

Comment ça fonctionne

Lorsqu'un pipeline de traitement documentaire extrait des données structurées d'un PDF, d'une image scannée ou d'une photo, il produit généralement un objet JSON avec des noms de champs et des valeurs. La traçabilité au niveau du champ ajoute des métadonnées à chacune de ces valeurs : une référence au numéro de page, une bounding box délimitant la zone exacte de l'image d'où provient la valeur, la méthode d'extraction utilisée, et un score de confiance reflétant le degré de certitude du modèle.

Ces métadonnées accompagnent la valeur extraite tout au long du reste du pipeline. Elles sont généralement stockées dans le même enregistrement, ce qui permet à un gestionnaire de sinistres ou à un responsable conformité de cliquer sur un champ dans une interface de relecture et de voir la zone source surlignée sur l'image du document original, en regard de la valeur produite par le système.

La provenance est générée au moment de l'extraction, et non reconstruite après coup. Les systèmes utilisant des modèles capables d'analyser la mise en page (voir analyse de la mise en page documentaire) peuvent relier directement les coordonnées à la représentation interne de la page par le modèle, ce qui rend la correspondance précise même lorsqu'un document comporte plusieurs colonnes, des tableaux ou des annotations manuscrites. Les systèmes qui s'appuient sur un OCR générique suivi d'un modèle de langage offrent souvent une traçabilité plus faible, car l'étape de traitement par le LLM peut reformuler ou déduire des valeurs qui ne correspondent plus clairement à un emplacement unique sur la page.

Pourquoi c'est important pour le traitement documentaire

La traçabilité au niveau du champ transforme un résultat d'extraction en quelque chose qu'une personne peut réellement auditer. Dans l'analyse de sinistres d'assurance, l'analyse de contrats ou l'entrée en relation KYC, un chiffre erroné enfoui dans une charge JSON peut déclencher un paiement indu ou un manquement à la conformité. La provenance donne à un relecteur un moyen rapide de vérifier la source sans devoir relire l'intégralité du document.

Elle est également essentielle pour détecter les erreurs de modèle et la fraude. Si la bounding box d'une valeur pointe vers la mauvaise partie de la page, ou si un score de confiance est anormalement bas, c'est un signal qui doit alerter avant que l'enregistrement n'entre dans un système en aval. Ce point est central pour la détection de fraude documentaire, où les champs falsifiés paraissent souvent plausibles isolément mais ne correspondent pas à leur zone source revendiquée.

Les régulateurs et les auditeurs attendent de plus en plus ce type de traçabilité. Une piste d'audit qui n'enregistre que le résultat final, sans lien vers la source, constitue une preuve plus faible qu'une piste qui montre précisément l'origine de chaque valeur.

Termes associés

FAQ

La traçabilité au niveau du champ est-elle la même chose qu'un score de confiance ?

Non. Un score de confiance indique le degré de certitude du modèle sur une valeur. La provenance indique l'origine physique de cette valeur sur la page. Les deux voyagent généralement ensemble dans les mêmes métadonnées, mais l'un mesure la certitude et l'autre la traçabilité. Un système peut afficher une confiance élevée tout en manquant d'une provenance correcte, s'il est incapable de pointer vers une zone source.

La traçabilité au niveau du champ ralentit-elle le traitement ?

Pas de façon significative, si le modèle d'extraction produit nativement des coordonnées de mise en page dans le cadre de sa sortie. Le coût se situe dans le stockage et l'affichage des métadonnées, pas dans leur génération. Les pipelines construits autour d'une approche OCR générique puis LLM ajoutent parfois une étape de mise en correspondance distincte pour reconstruire la provenance, ce qui peut accroître la latence et réduire la précision.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.