GLOSSAIRE
Hallucination des LLM
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
La hallucination de LLM est la tendance d'un grand modèle linguistique à produire une réponse qui semble plausible mais n'a aucun fondement dans le document source. Dans l'extraction de documents, cela signifie généralement que le modèle renvoie une valeur (une date, un montant, une clause) qui n'a jamais été écrite sur la page, remplie à partir de la mémoire de motifs plutôt que lue à partir du texte. Le résultat est propre et confiant, ce qui le rend dangereux dans un flux de travail commercial.
Comment ça marche
Un modèle linguistique génère du texte un jeton à la fois, choisissant la continuation la plus statistiquement probable compte tenu de tout ce qu'il a vu jusqu'à présent. Il n'a pas de concept intégré de "je ne sais pas". Lorsqu'un document est flou, qu'un champ est manquant ou qu'une mise en page perturbe l'ordre de lecture du modèle, il doit quand même produire quelque chose. Il s'appuie donc sur les motifs appris pendant la formation et comble le vide avec une valeur qui correspond à la forme attendue : un numéro de facture plausible, un total raisonnable, une date de contrat qui correspond au format du reste de la page.
Ceci diffère d'une simple erreur d'OCR, où un caractère est mal lu mais l'emplacement source est réel. Une hallucination n'a aucun ancrage. Le modèle peut signaler un montant de TVA qui n'existe nulle part dans le fichier, ou attribuer à tort une clause à la mauvaise partie parce que cette association est apparue souvent dans les données de formation.
Les systèmes d'extraction basés sur les architectures de modèle vision-langage n'y sont pas immunisés, car le composant de génération de langage se situe toujours en aval de la lecture visuelle. Le risque augmente avec des documents plus longs, des mises en page ambiguës et des champs qui nécessitent des calculs arithmétiques (totaux, sous-totaux, calculs de taxes) plutôt qu'une copie directe. Il augmente également lorsqu'un schéma demande un champ qui n'est tout simplement pas présent dans le document : un système bien conçu devrait dire "non trouvé", mais un modèle mal contraint en inventera souvent un.
Pourquoi c'est important pour le traitement des documents
Les champs hallucinés brisent la confiance dans l'automatisation précisément là où l'automatisation est censée faire gagner du temps. Un total de facture légèrement erroné, un numéro de police sorti de nulle part, une date de renouvellement de contrat qui ne correspond pas au PDF : ces erreurs passent les contrôles silencieux et atterrissent dans les systèmes en aval (ERP, réclamations, dossiers KYC) comme si elles étaient des faits avérés. Contrairement à un plantage système, personne ne s'en aperçoit avant que le rapprochement n'échoue ou qu'un auditeur ne pose une question.
La solution est architecturale, pas seulement de l'ingénierie rapide. L'extraction doit être fondée : chaque champ doit être lié à une boîte englobante sur la page source, chaque valeur doit être recoupée avec la mise en page du document, et chaque score de confiance faible doit être acheminé vers un réviseur humain au lieu d'être approuvé automatiquement. C'est pourquoi les objectifs de traitement direct doivent toujours être associés à des seuils de confiance visibles, et pourquoi les flux de travail réglementés comme l'intégration KYC ou les réclamations d'assurance nécessitent un examen humain dans la boucle pour tout ce que le système ne peut pas pointer sur la page.
Termes associés
- Score de confiance
- Humain dans la boucle (HITL)
- Boîte englobante
- Modèle Vision-Langage (VLM)
- Extraction zero-shot
FAQ
L'hallucination peut-elle être totalement éliminée ?
Non, pas avec les architectures de modèles actuelles. Elle peut être considérablement réduite grâce à des techniques de mise à la terre (lier chaque valeur extraite à un emplacement spécifique dans le document source), à la validation de schémas et à des seuils de confiance qui acheminent les champs incertains vers un examen humain au lieu de les accepter automatiquement. Traitez l'hallucination comme un risque à gérer en permanence, et non comme un bogue à corriger une fois pour toutes.
En quoi l'hallucination est-elle différente d'une erreur de lecture OCR ?
Une erreur de lecture OCR a un ancrage réel : le caractère existe sur la page mais a été mal lu, souvent en raison d'une mauvaise qualité de numérisation. Une hallucination n'a aucun ancrage. Le modèle produit une valeur qui n'est écrite nulle part dans le document, générée à partir de motifs appris plutôt que du contenu réel de la page. Les systèmes fondés peuvent signaler le second cas ; l'OCR seul ne le peut pas.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.