CHECKLISTS
Checklist pour évaluer la précision d'extraction
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
Constituer le jeu de test en premier
- Utilisez des documents issus de vos sources de production réelles, pas des échantillons de démonstration du fournisseur (les fournisseurs sélectionnent des cas favorables)
- Prévoyez au moins 100 à 200 documents par type avant de vous fier à un chiffre agrégé
- Couvrez délibérément les cas limites : scan de travers, champs manuscrits, fax basse résolution, variantes multi-pages
- Réservez un échantillon que le fournisseur ou le modèle n'a jamais vu pendant le réglage
- Établissez vous-même les réponses de référence, ou faites-les vérifier par une deuxième personne (les réponses "correctes" fournies par le fournisseur ne sont pas indépendantes)
- Actualisez le jeu de test tous les quelques mois, au fur et à mesure que les formats de documents ou les fournisseurs changent
Définir des indicateurs au niveau des champs, pas seulement des documents
- Mesurez la précision par champ, pas uniquement par document (une précision document de 95 % peut masquer un champ erroné 40 % du temps)
- Distinguez "champ manquant", "champ erroné" et "champ halluciné" (ces problèmes appellent des corrections différentes)
- Suivez séparément la précision et le rappel pour les champs parfois absents du document source (totaux, lignes de TVA, dates optionnelles)
- Définissez à l'avance ce que signifie "correct" pour les champs ambigus (formats de date, devise, noms partiels) afin que votre équipe n'improvise pas en pleine relecture
- Pondérez les champs selon leur impact métier : un IBAN erroné pèse plus lourd qu'une description de facture erronée
Mesurer honnêtement le taux de traitement automatique (STP)
- Définissez le STP comme "n'a nécessité aucune correction humaine", pas "le modèle a produit une réponse"
- Communiquez le taux STP au seuil de confiance que vous utiliserez réellement en production, pas celui qui paraît le plus flatteur en démonstration
- Vérifiez ce qu'il advient du taux STP si vous resserrez le seuil de 5 à 10 points (une chute brutale trahit un modèle fragile)
- Distinguez le taux STP par type de document : une moyenne entre types peut masquer un type défaillant
- Suivez l'évolution du taux STP dans le temps après le déploiement, pas seulement au stade du pilote
Tester en conditions réelles d'exploitation
- Reproduisez le même test sur des documents issus de votre source de moins bonne qualité (vieux scanner, photo mobile, fax dégradé)
- Vérifiez la performance sur votre mix documentaire réel, pondéré par les volumes effectifs, et non par une répartition équitable entre types
- Testez avec les formats de fichiers que vous recevez réellement : PDF, TIFF, JPEG, pièces jointes d'e-mail
- Vérifiez que le système gère correctement les fichiers multi-pages et multi-documents, pas seulement les échantillons d'une page
- Comparez les approches basées sur l'OCR et sur les VLM sur le même jeu de données si vous hésitez sur celle qui convient à vos documents (voir OCR vs VLM)
Valider les scores de confiance
- Vérifiez que les signalements de faible confiance correspondent réellement à des erreurs (représentez la confiance en fonction de la précision réelle)
- Fixez votre seuil de relecture en fonction du coût de l'erreur, pas d'un réglage par défaut (voir seuils de confiance IA pour le traitement des sinistres)
- Confirmez que les scores de confiance sont calibrés par champ, pas seulement par document
- Testez si les scores de confiance restent stables quand la qualité du document se dégrade
Chiffrer l'impact business
- Calculez le coût par champ correctement extrait, pas seulement le coût par document (voir extraction de documents : précision vs coût par réponse correcte)
- Estimez le temps gagné par les équipes qui relisent les exceptions par rapport à un traitement entièrement manuel
- Modélisez le ROI à votre volume et à votre tolérance d'erreur réels, pas sur un benchmark générique (voir le calculateur de ROI)
- Intégrez le coût des erreurs qui atteignent les systèmes en aval sans être détectées
Erreurs courantes
- Se fier au chiffre de précision affiché par un fournisseur sans vérifier sur quel jeu de documents il a été mesuré.
- Mesurer la précision au niveau du document en ignorant quels champs précis génèrent les erreurs.
- Tester uniquement sur des échantillons propres, puis être surpris par les scans du monde réel.
- Traiter le taux STP comme une donnée fixe, alors qu'il évolue à chaque changement de seuil ou de mix documentaire.
- Faire l'impasse sur une seconde relecture de ses propres réponses de référence, ce qui fausse la "base de comparaison" dès le départ.
- Comparer deux systèmes sur des jeux de test différents et en tirer des conclusions malgré tout.
FAQ
De combien de documents ai-je besoin dans un jeu de test pour faire confiance aux résultats ?
Cela dépend du nombre de types de documents et de variantes que vous traitez, mais moins de 100 par type produit généralement des chiffres bruités et instables. Si vous avez cinq types de documents avec des mises en page différentes, il vous faut quelques centaines d'exemplaires par type pour détecter les cas limites. Pour un passage en revue détaillé du test d'extraction de factures en particulier, voir précision de l'IA pour les factures : comment tester et mesurer la performance réelle.
Dois-je comparer les fournisseurs sur leurs propres jeux de test ou sur le mien ?
Exigez toujours le vôtre. Les fournisseurs communiquent naturellement des chiffres issus de jeux de données qui favorisent leur système, et même les fournisseurs honnêtes règlent leur modèle sur des données qui ne correspondent pas à votre mix documentaire. Si vous comparez plusieurs fournisseurs, consultez notre checklist d'évaluation des fournisseurs IDP pour la démarche complète, au-delà de la seule précision.
Un taux STP élevé signifie-t-il toujours un faible taux d'erreur ?
Non. Un taux STP élevé peut masquer un système qui se trompe avec assurance sur des champs que personne ne vérifie, comme un code de TVA secondaire ou un champ de date rarement utilisé. Associez toujours le taux STP à la précision au niveau des champs, et vérifiez quelle proportion des documents "traités automatiquement" contenait en réalité une erreur simplement non signalée pour relecture.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.