GLOSSAIRE
Analyse de mise en page
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
L'analyse de la mise en page des documents est le processus d'identification et de cartographie des éléments structurels d'un document, tels que les paragraphes, les tableaux, les en-têtes, les colonnes, les signatures et les timbres, avant que tout texte ne soit lu ou interprété. Elle répond à la question « qu'est-ce qui est où » sur une page, indépendamment de « qu'est-ce que ça dit ». La plupart des pipelines de traitement intelligent des documents exécutent l'analyse de la mise en page comme une étape précoce, car une mauvaise compréhension de la structure tend à corrompre tout le reste en aval.
Comment ça marche
Un moteur d'analyse de la mise en page prend une image de page ou un PDF et produit une carte spatiale de son contenu. Les systèmes classiques le font en deux étapes : d'abord, ils détectent les régions à l'aide de techniques de vision par ordinateur (détection de bords, composants connectés ou détecteurs d'objets entraînés), puis ils classent chaque région dans un type, tel que « tableau », « titre », « corps de texte » ou « figure ». Le résultat est généralement un ensemble de coordonnées, souvent exprimées sous forme de boîte englobante, étiquetées avec une balise et un ordre de lecture.
Les approches modernes s'appuient de plus en plus sur des modèles d'apprentissage profond entraînés sur de grands ensembles de documents annotés (factures, contrats, formulaires, articles scientifiques) pour reconnaître les motifs de mise en page sans règles codées à la main. Certains systèmes plus récents, en particulier ceux basés sur un Modèle Vision-Langage, analysent la mise en page et le contenu ensemble en un seul passage plutôt que de traiter la structure et le texte comme des problèmes distincts. Ceci est important pour les documents où le sens dépend de la position : un nombre dans un tableau a une signification différente de celle du même nombre dans une note de bas de page.
L'analyse de la mise en page doit également gérer le désordre du monde réel : numérisations inclinées, mises en page multi-colonnes, annotations manuscrites sur du texte imprimé et documents mélangeant langues ou écritures. Un bon système produit un ordre de lecture qu'un humain reconnaîtrait comme correct, et non une simple liste de boîtes déconnectées.
Pourquoi c'est important pour le traitement des documents
L'analyse de la mise en page est ce qui permet à un système de faire la différence entre une ligne d'article dans un tableau et un nombre d'apparence similaire situé dans un paragraphe. Sans elle, les outils d'extraction devinent la structure et se trompent sur tout ce qui est plus complexe qu'une page de texte brut. Cela affecte directement la précision de l'extraction de tableaux et de l'extraction de paires clé-valeur, et cela alimente la classification de documents, car les motifs de mise en page signalent souvent le type de document avant toute analyse de texte.
Pour les flux de travail réglementés comme l'intégration KYC ou le traitement des réclamations, les erreurs de mise en page se cumulent. Une limite de champ mal lue sur un document d'identité ou un formulaire de réclamation peut décaler toute une extraction en aval, ce qui nécessite une révision manuelle et anéantit l'intérêt de l'automatisation. Une analyse fiable de la mise en page est l'une des raisons plus discrètes pour lesquelles certains systèmes IDP atteignent des taux élevés de traitement direct tandis que d'autres stagnent à « principalement automatisé, principalement révisé à la main ».
Termes associés
- Boîte englobante
- Extraction de tableaux
- Modèle Vision-Langage (VLM)
- OCR (Reconnaissance Optique de Caractères)
- Traitement Intelligent de Documents (IDP)
FAQ
L'analyse de la mise en page des documents est-elle la même chose que l'OCR ?
Non. L'OCR convertit les pixels en caractères et en mots. L'analyse de la mise en page identifie les régions auxquelles ces mots appartiennent (tableaux, en-têtes, paragraphes) et l'ordre dans lequel ils doivent être lus. Les deux sont généralement exécutés ensemble dans un pipeline, mais ils résolvent des problèmes différents : l'OCR gère la reconnaissance, l'analyse de la mise en page gère la structure. Voir OCR vs VLM pour comprendre comment les nouveaux modèles combinent les deux.
Pourquoi l'analyse de la mise en page échoue-t-elle sur les documents numérisés ou de mauvaise qualité ?
L'inclinaison, le bruit et la faible résolution déforment les indices visuels (lignes, espacement, alignement) sur lesquels les modèles de mise en page s'appuient pour détecter les régions. Un tableau légèrement tourné peut être mal interprété comme du texte libre, et les lignes de grille faibles peuvent ne pas être enregistrées du tout. Les systèmes entraînés sur des documents réels variés et imparfaits gèrent cela mieux que ceux entraînés uniquement sur des échantillons numériques propres.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.