Read in English →

GLOSSAIRE

Reconnaissance d'entités nommées (NER)

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

La reconnaissance d'entités nommées (NER, pour Named Entity Recognition) consiste à repérer et étiqueter automatiquement des informations précises dans un texte : noms, dates, montants, organisations, adresses. Dans le traitement documentaire, la NER est ce qui transforme un bloc de texte non structuré en une série de données étiquetées et exploitables. C'est généralement une étape au sein d'un pipeline d'extraction plus large, pas le pipeline dans son intégralité.

Comment ça marche

Les modèles de NER parcourent le texte et attribuent à chaque segment pertinent une catégorie : personne, entreprise, montant, date, lieu, référence produit, etc. Les systèmes les plus anciens s'appuyaient sur des règles et dictionnaires construits à la main (listes de raisons sociales connues, expressions régulières pour les dates ou les IBAN). Les modèles statistiques ont pris le relais, entraînés sur des exemples annotés pour reconnaître des schémas contextuels plutôt que des correspondances exactes. Aujourd'hui, la plupart des systèmes en production s'appuient sur des modèles de langage à base de transformers, parfois affinés sur des données métier spécifiques (contrats juridiques, dossiers médicaux, factures), qui gèrent bien mieux la variabilité et l'ambiguïté que les approches à base de règles.

Le traitement intervient généralement après que le parsing de documents et l'OCR ont converti une image ou un PDF en texte exploitable par une machine, et fonctionne souvent en complément des informations de mise en page, afin de relier chaque entité à sa position sur la page. Une fois les entités repérées, elles doivent encore être validées : une date correctement identifiée n'est pas forcément la bonne date (date d'émission ou date d'échéance, par exemple). C'est pourquoi la NER est rarement déployée seule. Elle alimente l'extraction clé-valeur, la validation croisée entre documents, ou des règles métier qui déterminent ce que l'entité extraite signifie réellement pour un type de document donné. Les scores de confiance associés à chaque entité détectée aident les systèmes en aval, ou les équipes chargées de la relecture, à décider quand faire confiance au résultat et quand le vérifier.

Pourquoi c'est important pour le traitement documentaire

La plupart des documents professionnels regorgent d'entités nommées : nom du fournisseur sur une facture, parties dans un contrat, demandeurs sur un formulaire d'assurance, personnes sur un document KYC. Extraire correctement ces informations, et leur attribuer la bonne étiquette, est ce qui rend possible le traitement automatisé. Une NER défaillante, et tout casse en aval : les paiements partent sur le mauvais compte, une clause contractuelle est attribuée à la mauvaise partie, un contrôle de conformité laisse passer un nom sous sanction.

La NER est également essentielle pour les enjeux de conformité. Détecter des noms de personnes, des adresses ou des numéros d'identité est un prérequis pour l'anonymisation des données personnelles (PII redaction) et pour respecter les obligations du RGPD. Dans les procédures KYC et LCB-FT, identifier correctement les entités à travers plusieurs documents (un nom orthographié légèrement différemment sur un passeport et sur une facture d'énergie) est central pour vérifier l'identité et détecter la fraude. La qualité de la NER conditionne directement le volume de relecture manuelle encore nécessaire dans un flux documentaire.

Termes associés

FAQ

La NER est-elle la même chose que l'extraction de données ?

Non. La NER identifie et étiquette des entités dans un texte (un nom, une date, un montant). L'extraction de données est plus large : elle détermine aussi quelle entité correspond à quel champ dans un schéma cible, valide la valeur, et la structure pour un usage dans une base de données ou un système en aval. La NER n'est souvent qu'un composant au sein d'un pipeline d'extraction de données plus large.

La NER fonctionne-t-elle bien sur des documents scannés ou de mauvaise qualité ?

Cela dépend fortement de ce qui se passe avant. La NER opère sur du texte : si l'OCR déchiffre mal des caractères ou brouille la mise en page, les entités trouvées seront erronées ou absentes, quelle que soit la qualité du modèle sous-jacent. C'est pourquoi la qualité de l'OCR et de l'analyse de mise en page comptent autant que celle du modèle de NER lui-même.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.