Read in English →

GLOSSAIRE

Inférence de schéma

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

L'inférence de schéma est le processus par lequel un système de traitement de documents détermine quels champs, étiquettes et structures de données extraire, en se basant sur le contenu et la mise en page du document lui-même, plutôt que sur un modèle prédéfini. Au lieu qu'un ingénieur spécifie à l'avance "extraire le numéro de facture, la date, le total", le système lit le document et propose un schéma de lui-même. Cela est particulièrement important pour les types de documents dont le format varie considérablement, ou qu'une équipe n'a jamais configurés auparavant.

Comment ça marche

L'extraction clé-valeur traditionnelle repose sur un modèle: quelqu'un définit les champs qu'un type de document doit contenir, et le système fait correspondre ces champs à des positions ou des étiquettes sur la page. L'inférence de schéma inverse ce processus. Un modèle, généralement un Modèle Vision-Langage ou un grand modèle linguistique avec compréhension de documents, examine le document brut (texte, mise en page, tableaux, en-têtes) et en déduit quels sont probablement les champs significatifs.

En pratique, cela se déroule en plusieurs étapes. Premièrement, le système classe le type de document, ou du moins réduit la catégorie probable. Deuxièmement, il identifie les étiquettes candidates: du texte qui ressemble à un nom de champ ("N° de facture", "Preneur d'assurance", "Date d'échéance") associé à une valeur proche. Troisièmement, il regroupe les structures répétées en tableaux ou en éléments de ligne plutôt qu'en paires clé-valeur plates. Enfin, il produit un schéma (une liste de noms de champs, de types et, idéalement, de scores de confiance) qu'un humain ou un système en aval peut examiner et ajuster.

Ceci diffère de la classification de documents, qui détermine ce qu'est un document, et de l'extraction de données, qui extrait les valeurs une fois les champs connus. L'inférence de schéma se situe entre les deux: elle décide ce qui doit être extrait avant que l'extraction ne se produise. Certaines plateformes IDP permettent aux utilisateurs de modifier le schéma inféré et de le sauvegarder comme modèle réutilisable pour les futurs documents du même type, mélangeant l'inférence avec la rapidité d'une configuration fixe.

Pourquoi c'est important pour le traitement de documents

La plupart des flux de documents du monde réel incluent de longues traînes: factures de fournisseurs avec des mises en page incohérentes, contrats de contreparties qui n'adoptent jamais votre modèle, formulaires de réclamation qui changent à chaque cycle de renouvellement. Construire et maintenir un modèle pour chaque variante est coûteux et jamais tout à fait terminé. L'inférence de schéma permet à un système de gérer un nouveau type de document dès le premier jour, sans qu'un ingénieur n'écrive d'abord des règles d'extraction.

Le bénéfice pratique se manifeste en termes de temps d'intégration et de couverture. Une équipe évaluant le développement interne ou l'achat d'un IDP devrait demander aux fournisseurs comment le système se comporte sur un document qu'il n'a jamais vu: échoue-t-il, ou propose-t-il un schéma utilisable qu'un humain peut confirmer? Pour l'analyse de contrats ou l'intégration KYC, où les formats de documents varient selon la contrepartie ou la juridiction, cette capacité détermine souvent si un projet dépasse la phase pilote ou reste bloqué à reconstruire des modèles chaque mois.

Termes associés

FAQ

L'inférence de schéma remplace-t-elle entièrement les modèles?

Non. La plupart des systèmes de production utilisent l'inférence pour gérer des types de documents nouveaux ou imprévisibles, puis laissent un modèle prendre le relais une fois le schéma stabilisé. Les modèles restent plus rapides et plus prévisibles pour les formats à volume élevé et bien connus, comme une facture récurrente d'un seul fournisseur. L'inférence est la plus précieuse aux marges: nouveaux fournisseurs, nouvelles versions de formulaires, ou types de documents que vous n'avez pas encore configurés.

Quelle est la précision de l'inférence de schéma par rapport à un modèle construit à la main?

La précision dépend de la qualité du document et de la distinction visuelle des champs. Un formulaire bien formaté avec des étiquettes claires tend à inférer proprement; un tableau dense et non étiqueté ne le fait souvent pas. C'est pourquoi la plupart des plateformes IDP associent les schémas inférés à un score de confiance et à une étape de révision humaine avant que la sortie n'alimente les systèmes en aval.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.