Read in English →

GLOSSAIRE

Classification de documents

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

La classification de documents est le processus d'identification automatique du type d'un document (facture, contrat, carte d'identité, formulaire de réclamation, etc.) afin qu'il puisse être acheminé, extrait et traité correctement. Il s'agit généralement de la première étape d'une chaîne de traitement intelligent de documents, car chaque règle d'extraction en aval dépend de la connaissance du type de document lu. Sans une classification précise, un système applique soit le mauvais modèle, soit oblige un humain à trier les documents manuellement.

Comment ça marche

Un modèle de classification examine un document, soit sous forme d'image, soit sous forme de texte extrait, soit les deux, et l'attribue à l'une des catégories prédéfinies. Les systèmes plus anciens s'appuyaient sur la correspondance de mots-clés ou des modèles de mise en page fixes: si le mot "facture" apparaissait près du haut, le document était une facture. Cette approche échoue rapidement lorsque les documents varient en format, en langue ou en qualité de numérisation.

Les systèmes modernes entraînent des modèles statistiques ou d'apprentissage profond sur des exemples étiquetés, apprenant des indices visuels (logos, structures de tableaux, timbres) et textuels (phrases spécifiques, noms de champs). Les approches plus récentes utilisent des modèles Vision-Langage, qui lisent une page comme une personne le ferait: en combinant la mise en page, l'imagerie et le texte en un seul jugement sur le type de document. Ceci est important pour les documents numérisés ou photographiés où l'OCR seule a des difficultés avec le bruit, la rotation ou l'écriture manuscrite.

La classification peut se faire à différents niveaux de granularité. Une première passe grossière pourrait séparer les "documents financiers" des "documents d'identité". Une passe plus fine pourrait distinguer une facture commerciale d'une note de crédit, ou une carte d'identité nationale d'un permis de séjour. De nombreux systèmes de production enchaînent les deux: un classifieur rapide de première passe réduit le champ, puis un modèle spécialisé ou un ensemble de règles d'extraction gère le sous-type spécifique. Les scores de confiance accompagnent généralement chaque prédiction, de sorte que les cas de faible confiance peuvent être signalés pour une révision humaine plutôt que traités aveuglément.

Pourquoi c'est important pour le traitement des documents

Une mauvaise classification est coûteuse car elle a des effets en cascade. Un formulaire de demande d'indemnisation mal classé peut être acheminé vers le mauvais modèle d'extraction, produisant des valeurs de champ erronées qu'un humain détecte tardivement, voire pas du tout. Dans les flux de travail réglementés tels que l'onboarding KYC ou la conformité à la facturation électronique, un document non classé ou mal classé peut bloquer un dossier entier.

Une bonne classification réduit le tri manuel, raccourcit le temps de traitement et permet aux organisations de définir différents niveaux de service par type de document: une facture simple peut être traitée automatiquement, tandis qu'une clause contractuelle litigieuse est signalée à un avocat. Elle améliore également l'auditabilité, car chaque document porte un enregistrement de ce qu'il a été déterminé et de la confiance du système. Pour les équipes qui évaluent s'il faut le construire en interne ou acheter une plateforme, la précision de la classification sur leur mélange de documents réels (et non un ensemble de démonstration d'un fournisseur) est l'un des signaux les plus clairs de la fiabilité d'un système en production.

Termes associés

FAQ

En quoi la classification de documents est-elle différente de l'extraction de données ?

La classification répond à la question "quel type de document est-ce ?", tandis que l'extraction répond à la question "quelles sont les valeurs qu'il contient ?". La classification vient en premier: elle détermine quel modèle d'extraction ou quelle règle s'applique. Un système peut classer un document correctement et extraire les champs mal, ou vice versa, donc les deux étapes nécessitent des vérifications de précision séparées.

La classification de documents peut-elle gérer des fichiers mixtes ou multi-pages ?

Oui, mais cela nécessite une division au niveau de la page avant la classification, car un seul PDF peut contenir une facture, son bon de commande associé et un bon de livraison signé. Les pipelines bien conçus classent chaque page ou section logique indépendamment, puis regroupent les pages associées, plutôt que de supposer qu'un fichier équivaut à un seul type de document.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.