Read in English →

GLOSSAIRE

Extraction de tableaux

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

L'extraction de tableaux est le processus de détection des structures tabulaires dans un document et de leur conversion en données structurées (lignes, colonnes et valeurs de cellules) qu'un système aval peut interroger ou traiter. Cela va au-delà de la simple lecture de texte: le système doit d'abord reconnaître l'existence d'un tableau, puis déterminer quels mots appartiennent à quelle ligne et quelle colonne, y compris les cas où les cellules s'étendent sur plusieurs lignes ou colonnes. Une bonne extraction de tableau préserve la structure logique des données, et pas seulement le texte visible.

Comment cela fonctionne

Un pipeline d'extraction de tableau se déroule généralement par étapes. Tout d'abord, une étape de détection localise les régions de tableau sur la page, souvent à l'aide de modèles de mise en page entraînés à repérer les structures en grille, les bordures ou les alignements de colonnes répétés. Deuxièmement, une étape de reconnaissance de structure cartographie la grille: elle doit inférer les limites des lignes et des colonnes même lorsque les lignes sont manquantes, faibles ou incohérentes d'une page à l'autre.

C'est là que réside la majeure partie de la difficulté réelle. Les cellules fusionnées rompent l'hypothèse d'une grille simple: un en-tête s'étendant sur trois colonnes, ou une ligne de sous-total s'étendant sur deux, oblige le modèle à raisonner sur l'étendue plutôt que sur la simple position. Les tableaux multipages ajoutent une autre couche: un tableau qui commence à la page 3 et continue à la page 4 doit voir ses lignes raboutées, avec des en-têtes soit répétés, soit implicites. Et les articles détaillés (les lignes individuelles d'une facture ou d'une demande, chacune avec une description, une quantité, un prix unitaire et un total) doivent être extraits avec suffisamment de cohérence pour que les quantités et les prix s'alignent correctement, ligne par ligne, même lorsqu'une description s'étend sur deux lignes.

Une fois la structure résolue, le texte de chaque cellule est lu (via l'OCR ou un modèle vision-langage) et typé: les nombres comme des nombres, les dates comme des dates. La sortie est généralement un objet structuré (JSON ou un format de tableau) plutôt qu'un simple vidage de texte, afin qu'il puisse être validé, additionné ou intégré à un autre système.

Pourquoi c'est important pour le traitement de documents

La plupart des contenus financiers et opérationnels des documents commerciaux se trouvent dans des tableaux, et non dans du texte libre. Totaux de factures, calendriers de réclamations, grilles de prix contractuels, états financiers: ce sont tous des tableaux, et les erreurs ont des conséquences directes. Un article mal lu peut fausser une quantité ou un prix, et un tableau multipage mal assemblé peut supprimer silencieusement des lignes, ce qui est bien pire qu'un échec d'extraction évident car personne ne le remarque avant que le rapprochement ne échoue.

L'OCR générique lit les caractères dans le bon ordre visuel mais n'a pas de concept de lignes ou de colonnes, c'est pourquoi l'extraction de tableaux est traitée comme une capacité à part entière dans les systèmes IDP plutôt que comme un effet secondaire de la reconnaissance de texte. Pour les équipes financières et opérationnelles, le test pratique n'est pas de savoir si un outil peut extraire du texte d'un tableau. C'est de savoir s'il gère correctement les en-têtes fusionnés, la continuation sur plusieurs pages et les articles de ligne au niveau de la ligne sur les types de documents spécifiques qu'ils traitent réellement, factures, formulaires de réclamation, contrats, sans nettoyage manuel ultérieur.

Termes associés

FAQ

Comment les systèmes gèrent-ils les tableaux qui s'étendent sur plusieurs pages ?

Ils détectent que la structure de colonne d'un tableau se poursuit sur la page suivante, généralement en comparant les positions des colonnes et le texte d'en-tête à travers le saut de page, puis fusionnent les lignes en un seul tableau logique. Les en-têtes répétés sur chaque page aident, mais de nombreux documents réels les omettent, de sorte que le système doit déduire la continuité à partir de la seule mise en page.

Pourquoi les cellules fusionnées sont-elles difficiles à extraire correctement ?

Les cellules fusionnées rompent l'hypothèse selon laquelle chaque cellule occupe exactement une ligne et une colonne. Un modèle doit détecter l'étendue visuelle (une boîte plus large, une ligne interne manquante) et décider à quelles lignes ou colonnes la valeur s'applique réellement. Si cela est mal fait, les valeurs sont dupliquées, supprimées ou attachées à la mauvaise ligne.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.