GLOSSAIRE

Score de confiance

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

Un score de confiance est une estimation numérique, généralement comprise entre 0 et 100 ou 0 et 1, qu'un système de traitement intelligent de documents attribue à un élément de donnée extrait pour indiquer la probabilité que cette donnée soit correcte. Il est produit par champ, par poste ou par document, et reflète la certitude du modèle plutôt qu'une garantie d'exactitude. Les équipes l'utilisent pour décider quelles extractions peuvent être considérées comme fiables automatiquement et lesquelles nécessitent une vérification humaine.

Fonctionnement

Un score de confiance provient du modèle d'extraction lui-même, et non d'une étape d'audit distincte. Lorsqu'un moteur d'OCR ou un modèle de vision-langage (VLM) lit un document, il calcule la probabilité que sa sortie corresponde à la valeur réelle sur la page. Cette probabilité dépend de plusieurs facteurs: la qualité de l'image, la clarté de la police, le fait que le champ se trouve dans un tableau propre ou une marge manuscrite désordonnée, et la correspondance entre les données d'entraînement du modèle et le type de document présenté.

La plupart des plateformes IDP génèrent des scores à plusieurs niveaux. Un score au niveau du document répond à la question "ai-je classifié cela correctement ?". Un score au niveau du champ répond à la question "ce numéro de facture est-il correct ?". L'extraction de tableaux nécessite souvent sa propre logique de notation, car un seul chiffre mal lu dans une colonne de quantité peut fausser les totaux sans diminuer le score des cellules voisines.

Les scores ne deviennent utiles qu'une fois qu'un seuil est défini. Une configuration courante : tout ce qui est supérieur à 95 est traité automatiquement, tout ce qui est entre 80 et 95 passe dans une file de révision légère, et tout ce qui est inférieur à 80 fait l'objet d'une vérification manuelle complète. Les seuils appropriés varient selon le champ. Un nom de client peut tolérer une barre plus basse qu'un montant de paiement, car le coût d'une erreur diffère. Ne pas bien calibrer cela, que ce soit trop strict ou trop lâche, est l'une des raisons les plus courantes pour lesquelles les projets IDP n'atteignent pas le taux d'automatisation promis.

Pourquoi c'est important pour le traitement de documents

Le scoring de confiance est ce qui permet à l'IDP de fonctionner en toute sécurité sans qu'une personne ne vérifie chaque champ. Sans cela, une entreprise fait face à un choix binaire : faire confiance au système aveuglément, ou tout examiner, ce qui va à l'encontre du but de l'automatisation. Les seuils par champ permettent à une entreprise d'automatiser 90 % des extractions qui sont clairement correctes et d'acheminer les 10 % restants à un réviseur, ce qui est un bien meilleur ratio que de réviser des documents entiers.

Ceci est particulièrement important dans les flux de travail réglementés ou à enjeux élevés. Dans les demandes d'indemnisation d'assurance, un numéro de police à faible confiance devrait arrêter le traitement direct avant qu'un paiement ne soit effectué au mauvais demandeur. Dans l'intégration KYC, une date de naissance ou un numéro d'identification à faible confiance devrait déclencher une vérification de conformité plutôt qu'une approbation. Le score est également un artefact d'audit : il donne aux équipes de conformité une raison défendable pour laquelle un document a été ou non approuvé automatiquement, ce qui est important lors des revues de sécurité et de conformité.

Termes associés

FAQ

Quel seuil de confiance une entreprise doit-elle utiliser ?

Il n'y a pas de chiffre universel. Cela dépend du coût de l'erreur du champ et de la précision de base du modèle sur ce type de document. La plupart des équipes commencent de manière conservative (un seuil élevé, plus de révision manuelle) et le réduisent progressivement à mesure qu'elles mesurent les taux d'erreur réels par rapport au score, plutôt que de faire confiance au paramètre par défaut du fournisseur dès le départ.

Un score de confiance élevé garantit-il que la valeur extraite est correcte ?

Non. Il reflète la propre certitude du modèle, calculée à partir de modèles qu'il a déjà vus, et non une vérification indépendante par rapport à la vérité terrain. Un modèle peut être sûr de se tromper, en particulier sur des types de documents ou des mises en page sur lesquels il n'a jamais été entraîné. C'est pourquoi l'échantillonnage et les audits périodiques des résultats à haute confiance sont toujours importants.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.