Coût réel de l'extraction de données: au-delà des benchmarks
Par Sygnet Research, vérifié avant publication

À retenir
- La précision mesurée par les benchmarks s'évalue par page ou par champ sur des corpus propres et sélectionnés, alors que votre coût réel se paie par enregistrement correct et exploitable, un dénominateur totalement différent.
- Un extracteur fiable à 90 % mais trop confiant en lui laisse filer des erreurs en production, tandis qu'un extracteur fiable à 78 % mais bien calibré renvoie ses propres échecs vers une relecture humaine : l'option qui paraît la moins chère est souvent la moins fiable.
- Le taux moyen de traitement sans intervention humaine dans le secteur des comptes fournisseurs est de 32,6 %, et de 49,2 % pour les meilleurs acteurs du marché, selon les chiffres d'Ardent Partners cités par Parseur, loin des scores supérieurs à 90 % que suggèrent les fiches techniques des modèles.
- Refaites le calcul avec votre propre coût horaire de relecture, votre propre coût d'erreur et votre propre mix documentaire avant de vous fier au classement des leaderboards.
Pourquoi un score de benchmark plus élevé ne garantit-il pas un coût par réponse correcte plus faible ?
Parce que le score de benchmark et le véritable moteur de coût ne mesurent pas la même chose. La précision d'un leaderboard est une moyenne calculée sur un corpus figé ; le coût par réponse correcte est la dépense totale (inférence, plus relecture humaine, plus le coût des erreurs qui passent entre les mailles du filet) divisée par le nombre d'enregistrements réellement exploitables en aval. Le lien entre les deux passe par deux variables que les benchmarks ignorent : la répartition des erreurs entre les champs, et la capacité du système à savoir quand il a tort.
OmniDocBench, l'un des benchmarks d'extraction les plus utilisés, évalue la précision d'extraction sur 1 355 pages à l'aide de métriques de distance d'édition et de structure de tableaux, et son score global est une moyenne pondérée : Overall = ((1 − TextEdit) + FormulaCDM + TableTEDS) / 3 × 100. C'est un indicateur utile pour la recherche, mais désastreux pour un achat éclairé. Un modèle peut gagner deux points au score global en transcrivant mieux les formules mathématiques tout en se dégradant sur les quatre champs dont votre processus de comptes fournisseurs a réellement besoin. Les auteurs d'OmniDocBench eux-mêmes précisent que le benchmark se limite à deux langues et, pour l'essentiel, à des scans propres ou semi-propres.
La précision d'un benchmark est une moyenne calculée sur les documents de quelqu'un d'autre, pondérée selon les priorités de quelqu'un d'autre.
Quelle est la véritable formule de coût ?
Coût par réponse correcte = (coût d'inférence + coût de relecture humaine + coût des erreurs non détectées) ÷ nombre d'enregistrements corrects. Il suffit de poser le calcul pour voir le classement s'inverser bien plus souvent qu'on ne le pense.
Le coût de relecture domine généralement le calcul. Dans la plupart des institutions financières, la vérification manuelle des champs extraits reste le principal poste de coût par document, ce qui fait du traitement de bout en bout (straight-through processing) le véritable levier de productivité. L'inférence, en comparaison, est bon marché et le devient de plus en plus : Google Document AI facture 0,10 $ par document de 10 pages maximum pour l'extracteur de factures, et 30 $ pour 1 000 pages pour l'extracteur de formulaires et l'extracteur personnalisé, tandis qu'Amazon Textract facture les formulaires à 0,05 $ par page et les dossiers de crédit à 0,07 $. Un relecteur payé 35 € chargé coûte environ 0,29 € pour 30 secondes d'attention. Un seul document relu manuellement annule l'économie réalisée sur plusieurs pages d'inférence.
Les erreurs non détectées constituent le troisième terme, et le plus difficile à chiffrer. Dans les chaînes de traitement à forts enjeux, y compris le rapprochement comptable, le contrôle de conformité et l'automatisation des achats, une extraction silencieusement erronée est plus dangereuse qu'une extraction visiblement absente. Si un IBAN erroné vous coûte 400 € en travail de récupération, un taux de fuite de 0,5 % sur 50 000 documents par an représente 100 000 € qui n'apparaîtront jamais sur la moindre facture fournisseur.
En quoi la calibration l'emporte-t-elle sur la précision brute ?
La calibration transforme la précision en automatisation. Un extracteur qui signale de façon fiable les 22 % de champs sur lesquels il est incertain vous permet d'approuver automatiquement les 78 % restants avec un taux d'erreur maîtrisé ; un extracteur fiable à 90 % mais confiant sur l'ensemble de ses résultats vous oblige soit à tout relire, soit à accepter 10 % de fuite.
La version formelle de ce principe est une porte de sélection : on n'accepte un champ que si sa probabilité dépasse un seuil choisi sur un jeu de calibration mis de côté, de façon à ce que le taux d'erreur parmi les champs acceptés reste inférieur ou égal à un budget fixé par l'opérateur, en utilisant la méthode Learn-Then-Test pour obtenir une garantie indépendante de la distribution, le reste étant renvoyé vers une relecture humaine. L'indicateur pertinent n'est pas la précision, c'est le pourcentage de champs pouvant être approuvés automatiquement tout en maintenant le taux d'erreur du lot accepté sous un objectif donné.
C'est pourquoi la confiance brute affichée par un VLM est un piège. Les VLM modernes extraient des paires clé-valeur dès la sortie de la boîte, mais leurs signaux de confiance verbalisés sont peu fiables et corrèlent faiblement avec l'exactitude réelle des champs. Une étude sur la calibration en extraction documentaire a constaté des niveaux de qualité allant du quasi-parfait au gravement surconfiant : il faut donc mesurer sur vos propres documents avant de faire confiance à un score. Le test est peu coûteux : prélevez 100 extractions marquées à 0,90 ou plus par le système et vérifiez-les manuellement ; si plus de 10 % contiennent des erreurs, les scores de confiance sont mal calibrés.
Une comparaison chiffrée
Le tableau ci-dessous est un modèle, pas une mesure réelle : 10 000 documents par mois, 12 champs chacun, 0,29 € de temps de relecteur par document traité manuellement, 400 € par erreur non détectée. L'extracteur A affiche une précision de 90 % mais avec des scores trop confiants ; l'extracteur B affiche 78 % avec une confiance calibrée par champ. Remplacez par vos propres chiffres, c'est la structure du calcul qui compte.
| Donnée | Extracteur A (90 %, trop confiant) | Extracteur B (78 %, calibré) |
|---|---|---|
| Précision par champ | 90 % | 78 % |
| Signal de confiance exploitable | Non | Oui, par champ |
| Documents approuvés automatiquement | 35 % (règles définies manuellement) | 72 % (seuil fixé à 0,5 % d'erreur sur le lot accepté) |
| Documents relus manuellement / mois | 6 500 | 2 800 |
| Coût de relecture / mois | 1 885 € | 812 € |
| Erreurs non détectées / mois | ~45 | ~8 |
| Coût des erreurs non détectées | 18 000 € | 3 200 € |
| Coût d'inférence à 0,05 €/document | 500 € | 500 € |
| Total / mois | 20 385 € | 4 512 € |
| Coût par enregistrement correct | 2,08 € | 0,45 € |
L'écart de douze points de précision pèse moins lourd que l'écart de calibration, d'un facteur quatre dans ce modèle. Notez aussi ce que la comparaison n'inclut pas : l'effort d'intégration, la dérive des schémas, et le fait que le service de relecture A2I d'Amazon est fermé aux nouveaux clients tandis que Google a abandonné la fonctionnalité d'intervention humaine de Document AI, ce qui signifie que, sur ces API, vos équipes techniques doivent construire elles-mêmes les écrans de relecture. C'est une ligne budgétaire bien réelle, et c'est le cœur de toute analyse honnête entre développement interne et solution externe.
Que devraient mesurer les équipes techniques à la place ?
Mesurez le taux de traitement sans intervention humaine à un budget d'erreur fixé pour le lot accepté, puis le coût par enregistrement correct. Tout le reste relève du diagnostic.
Trois voies, et non deux, constituent le schéma opérationnel qui rend cela mesurable : traitement direct, relecture au niveau du champ, et exception entièrement manuelle. Fusionnez-les en une seule pile de documents « à relire » et c'est cette pile qui l'emportera. Fixez les seuils par champ selon les conséquences, et non de façon uniforme : calibrez les seuils en fonction du coût d'une valeur erronée, AWS situant la fourchette raisonnable autour de 50 % pour du texte d'archive et de 90 % ou plus pour des décisions financières. Comme objectifs de référence, un taux de traitement direct de 60 % à 75 % après trois mois d'ajustement est une ambition réaliste, avec un taux d'erreur non détectée inférieur à 0,5 % et une précision par champ supérieure à 95 % sur les champs critiques.
Auditez ensuite. Un échantillon aléatoire de documents approuvés automatiquement reste le seul contrôle capable de révéler un seuil fixé trop bas avant que quelqu'un en aval ne s'en aperçoive. Sygnet conçoit des solutions d'extraction documentaire avec confiance par champ et routage de relecture, et publie ses propres notes sur la définition des seuils de confiance pour les workflows de gestion de sinistres.
La question n'est jamais de savoir à quel point le modèle est précis, mais combien de champs il vous permet d'approuver automatiquement à un taux d'erreur que vous pouvez défendre devant un auditeur.
Quand l'extracteur à 90 % l'emporte-t-il vraiment ?
Quand vos documents ressemblent à ceux du benchmark et que le coût de vos erreurs est faible. Si vous construisez un corpus RAG à partir de PDF numériques propres, la qualité brute d'extraction résume quasiment toute l'histoire : il n'y a pas de file de relecture, et une amélioration de 1 % de la distance d'édition du texte se répercute directement sur la qualité de la recherche documentaire.
Le tableau change avec des entrées moins propres. L'équipe de HunyuanOCR a construit une version « Wild » d'OmniDocBench en imprimant des documents puis en les re-photographiant avec des plis, des courbures et un éclairage variable, précisément parce que les scores obtenus sur des scans propres ne prédisent en rien la performance sur des photos de smartphone, et la majorité du flux de KYC ou de prise en charge de sinistres provient de photos prises au téléphone. Les tableaux constituent une autre ligne de fracture : sur OmniDocBench v1.5, les scores TEDS rapportés vont de 57,88 pour Marker-1.8.2 à 86,78 pour dots.ocr, un écart de 29 points qu'un score global aplatit en quelque chose de beaucoup moins alarmant. Si votre valeur réside dans les tableaux, lisez la sous-métrique plutôt que le score global, et consultez nos notes sur les métriques d'extraction de tableaux.
FAQ
Comment calculer le coût par réponse correcte pour un extracteur de documents ?
Faites passer 300 à 500 de vos propres documents dans chaque solution candidate. Comptez les enregistrements entièrement corrects (tous les champs requis exacts), mesurez au chronomètre le temps moyen de relecture par document traité manuellement, et attribuez une valeur en euros à une erreur non détectée en fonction du coût réel de sa correction en aval. Ensuite : (inférence + coût de relecture + coût des fuites) ÷ nombre d'enregistrements corrects. Faites ce calcul par type de document ; le classement diffère souvent entre les factures et les documents d'identité.
La précision par champ ou la précision par document est-elle le bon indicateur ?
La précision par document, si l'automatisation vous importe. La précision document mesure le pourcentage de documents sans aucune erreur d'extraction sur l'ensemble des champs, et c'est ce chiffre qui déterminera votre taux de traitement sans intervention humaine. Une précision par champ de 98 % sur 12 champs implique qu'environ 78 % des documents contiennent au moins une erreur si les défaillances sont indépendantes. Elles ne le sont pas en pratique, c'est pourquoi il faut mesurer plutôt que calculer.
Peut-on corriger un extracteur trop confiant sans changer de modèle ?
Souvent oui, grâce à une couche de calibration. Une étude indique qu'une couche de calibration Lasso ajustée sur environ 165 échantillons du domaine cible semble suffisante pour un nouveau déploiement, et que la qualité des échantillons négatifs compte plus que la taille du jeu de données, un taux d'échec naturel de 26 % offrant une supervision plus riche qu'un taux de 4 %. En pratique : collectez les corrections de vos relecteurs, ajustez un petit modèle qui relie les signaux à l'exactitude réelle, et fixez le seuil sur ce modèle plutôt que sur le score du fournisseur.
Quel taux de traitement sans intervention humaine puis-je espérer en première année ?
Moins élevé que ce que promet la présentation commerciale du fournisseur. Les benchmarks du secteur pour les comptes fournisseurs situent le taux moyen de traitement sans intervention humaine à 32,6 %, et à 49,2 % pour les meilleurs acteurs. Une chaîne de traitement moderne bien ajustée sur un type de document restreint peut faire mieux, mais prévoyez vos budgets autour de 50 % à 70 % sur un trafic mixte, et considérez la file de relecture comme un poste de coût permanent plutôt que transitoire.
Un email quand nous publions quelque chose qui vaut votre temps.