Read in English →

TYPES DE DOCUMENTS

Extraction de pièces d'identité (CNI, passeport)

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

Une carte d'identité ou un passeport est délivré par une autorité nationale (en France, l'ANTS pour la CNI, ou le ministère de l'Intérieur pour les passeports) et parvient généralement à une entreprise via des formulaires d'onboarding, des dossiers de sinistre ou des demandes de location. Les personnes qui le traitent travaillent dans des équipes conformité, opérations ou support client, et doivent confirmer l'identité avant de faire avancer un dossier. L'extraction automatisée récupère le nom, la date de naissance, le numéro du document et la zone de lecture optique (MRZ) du titulaire dans des champs structurés, et vérifie que la somme de contrôle de la MRZ correspond aux données visibles. Bien menée, elle transforme une vérification d'identité manuelle qui prend plusieurs minutes en une opération qui prend quelques secondes, sans en affaiblir la rigueur.

Champs à extraire

ChampFormat / exempleContrôle de validation
Type de documentCNI, passeport, titre de séjourCorrespond à une taxonomie de documents connue
NomMARTINCorrespond à la ligne 1 de la MRZ
PrénomsCLAIRE ISABELLECorrespond à la ligne 1 de la MRZ, ordre respecté
Date de naissance1988-04-12Chiffre de contrôle MRZ valide
Lieu de naissancePARIS 14E, FRANCEPrésent sur la CNI, absent de la MRZ
SexeFM/F/X uniquement
NationalitéFRACode ISO 3166-1 alpha-3
Numéro du document19CD81047XChiffre de contrôle MRZ valide
Date de délivrance2021-03-02Antérieure à la date d'expiration
Date d'expiration2031-03-01Non dépassée pour un usage d'onboarding
Autorité de délivrancePréfecture de ParisCorrespond à une liste d'émetteurs connue
Ligne 1 de la MRZIDFRAMARTIN<<CLAIRE<<<<<<<Longueur fixe, format regex
Ligne 2 de la MRZ19CD81047X4FRA8804125F...Chiffre de contrôle composite valide
Présence de signaturebooléenDétectée via un modèle de mise en page
Présence de photobooléenDétectée via un modèle de mise en page

Pourquoi ce document est difficile à traiter

Les documents d'identité sont petits, denses, et présentent des incohérences d'un pays à l'autre, voire d'une année d'émission à l'autre. La France elle-même compte trois générations de CNI en circulation : l'ancienne carte cartonnée, la carte plastique introduite en 2021 avec une nouvelle mise en page et une puce, et différents formats transitoires encore valides jusqu'à leur expiration. Chaque génération place les champs à des endroits différents, utilise des polices différentes, et la version la plus récente ajoute une photo gravée au laser que les scanners confondent souvent avec un artefact d'impression.

Les passeports ajoutent une couche de complexité supplémentaire : plus de 190 pays émetteurs, chacun avec sa propre mise en page, sa langue et ses dispositifs de sécurité. La MRZ est le seul élément standardisé (norme ICAO 9303), mais elle ne porte qu'un sous-ensemble de champs, et les scanners perdent fréquemment des caractères en bordure lorsque le document est photographié en angle ou partiellement masqué par une main.

La qualité des scans est intrinsèquement inégale : ces documents sont photographiés avec des téléphones, sous un mauvais éclairage, parfois à travers une pochette plastique. Les hologrammes et les encres réactives aux UV, censés prévenir la fraude, perturbent également l'OCR classique, qui interprète mal certains chiffres. Les documents multilingues (les passeports du Maghreb, avec de l'arabe et du français, par exemple) exigent des modèles capables de gérer des écritures mixtes sur une même ligne. Et comme les documents d'identité sont la cible la plus fréquente de la fraude, l'extraction doit signaler les incohérences, pas seulement lire le texte : une police qui ne correspond pas à l'année de délivrance, ou une somme de contrôle MRZ qui échoue, compte ici davantage que pour la plupart des autres types de documents.

Comment Sygnet le traite

Sygnet commence par classer le document selon son type et sa génération (ancienne CNI, nouvelle CNI, passeport, titre de séjour) avant de lancer l'extraction, car la position des champs et la structure de la MRZ en dépendent. Un LLM multimodal lit à la fois la mise en page visuelle et la MRZ, en recoupant les deux plutôt que de se fier à l'une ou l'autre isolément. Chaque champ extrait porte un score de confiance et une zone de délimitation (bounding box) reliée à l'image source, afin qu'un relecteur puisse voir exactement où la « date de naissance » a été lue et la juger d'un coup d'œil. C'est ce que nous entendons par traçabilité au niveau du champ : aucun champ n'arrive sans moyen de le vérifier.

Les règles de validation s'exécutent automatiquement : chiffres de contrôle de la MRZ, logique des dates (délivrance avant expiration, date de naissance cohérente avec le type de document), et vérification du format de l'émetteur. Lorsqu'un document fait partie de plusieurs pièces soumises pour un même dossier, Sygnet applique une validation croisée entre documents : le nom sur la pièce d'identité correspond-il au nom sur le bulletin de paie ou le RIB soumis dans le même dossier ? Les champs à faible confiance, ainsi que tout document dont la somme de contrôle échoue, sont routés vers une relecture humaine ; tout le reste passe directement dans le schéma de sortie sous forme de sortie structurée propre, livrée par API ou webhook. C'est la discipline centrale d'un onboarding KYC fiable : automatiser les cas courants, et router le reste vers un humain avec les preuves déjà réunies.

Règles de validation à appliquer

  • Recalculer les chiffres de contrôle MRZ pour la date de naissance, le numéro du document et la ligne composite ; rejeter en cas de non-correspondance.
  • Recouper les champs de la MRZ avec les champs imprimés visibles ; un écart signale souvent une falsification ou un scan défectueux, pas seulement du bruit d'OCR.
  • Vérifier que la date d'expiration n'est pas dépassée, avec une marge de tolérance configurable pour les cas limites.
  • Vérifier l'autorité de délivrance par rapport à une liste de référence connue, propre au pays et à la génération du document.
  • Signaler les documents où les zones photo ou signature sont absentes ou présentent des signes de retouche numérique.
  • Vérifier le code de nationalité par rapport à la norme ISO 3166-1 alpha-3, et non à un nom de pays en texte libre.
  • Pour les flux d'onboarding, comparer le nom et la date de naissance extraits avec les autres documents soumis (bulletin de paie, RIB) avant d'accepter le dossier.

FAQ

Sygnet peut-il lire le nouveau format de CNI française ?

Oui. Sygnet classe les documents par génération avant l'extraction, car la CNI de 2021 présente une mise en page, une puce et une photo gravée au laser différentes des anciennes versions plastique et cartonnée. Les champs sont mappés génération par génération, et la MRZ (présente sur l'ancien comme sur le nouveau format) sert de contrôle croisé par rapport aux données imprimées visibles.

Que se passe-t-il si la somme de contrôle de la MRZ échoue ?

Le document est signalé et routé vers une relecture humaine plutôt qu'accepté ou rejeté silencieusement. Un échec de somme de contrôle peut révéler une simple erreur de scan, un document abîmé, ou quelque chose de plus grave. Sygnet fait apparaître l'échec ainsi que la zone de délimitation de la ligne concernée, afin qu'un relecteur puisse juger rapidement, sans devoir relire tout le document depuis le début.

En quoi cela diffère-t-il d'une extraction d'identité par OCR seul ?

L'OCR classique lit des caractères mais ne comprend ni la mise en page, ni les différences entre générations, ni la structure de la MRZ. Sygnet combine la compréhension visuelle de la mise en page avec l'analyse de la MRZ et une validation croisée entre les deux, ce qui permet de détecter des erreurs qu'un OCR seul laisserait passer. Pour approfondir cette distinction, voir OCR vs VLM.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.