Read in English →

TYPES DE DOCUMENTS

Extraction d'avis d'imposition

Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.

L'avis d'imposition est le document annuel de l'administration fiscale française qui confirme la situation d'un foyer au regard de l'impôt sur le revenu pour l'exercice précédent. Émis par la Direction Générale des Finances Publiques (DGFiP), il atterrit entre les mains des banques, des organismes de crédit, des bailleurs, des équipes RH et des services sociaux qui ont besoin d'une preuve de revenus ou de situation fiscale. Ces équipes traitent le document pour vérifier la solvabilité, l'éligibilité à certaines prestations ou le respect de conditions contractuelles. L'extraction automatisée transforme un PDF administratif dense de plusieurs pages en champs structurés qu'un système de crédit ou d'onboarding peut exploiter en quelques secondes, sans qu'un collaborateur ait besoin de chercher la bonne case en page deux.

Champs à extraire

ChampFormat / exempleContrôle de validation
Numéro fiscalNombre à 13 chiffres, ex. 1234567890123Vérification de la longueur et du schéma de contrôle
Référence de l'avisAlphanumérique, ex. 2024A01B234567Correspondance avec le format attendu ; cohérence avec l'année d'émission
Nom et prénom du déclarant« MARTIN Sophie »Présent, non vide, cohérent avec une pièce d'identité en cas de recoupement
Adresse fiscaleAdresse postale complèteFormat du code postal (5 chiffres), commune existante
Revenu fiscal de référence (RFR)Montant en euros, ex. 32 450 €Valeur non négative, plage plausible
Nombre de partsDécimal, ex. 2,5Compris entre 1 et 10, cohérent avec la composition du foyer
Situation de famille« Marié(e) », « Célibataire », etc.Correspondance avec une liste de valeurs connues
Montant de l'impôt netMontant en euros, ex. 1 870 €Cohérence avec le RFR et le nombre de parts
Année des revenusAnnée, ex. 2023Antérieure d'un an à la date d'émission de l'avis
Date de mise en recouvrementJJ/MM/AAAADate valide, plausible par rapport à l'année des revenus
Centre des finances publiquesNom et adressePrésent, cohérent avec la liste connue des centres DGFiP
Avis rectificatif (oui/non)Indicateur booléenDétection de la présence du mot-clé « rectificatif »

Pourquoi ce document est difficile à traiter

L'avis d'imposition paraît standardisé, mais il varie plus qu'on ne l'imagine. La DGFiP a révisé sa mise en page plusieurs fois au cours de la dernière décennie, et les configurations propres à chaque foyer (déclarant unique, déclaration commune, personnes à charge, sources de revenus multiples) modifient les sections qui apparaissent et leur emplacement. Les copies scannées ou photographiées, fréquentes lorsqu'elles sont transmises via une application mobile ou par e-mail, introduisent des défauts d'inclinaison, des reflets et des artefacts de compression qui dégradent la précision de l'OCR sur les caractères de petite taille, en particulier le numéro fiscal et les codes de référence, ces chaînes denses qui n'offrent aucun contexte en langage naturel pour guider la correction.

Les documents multi-pages ajoutent une difficulté supplémentaire : les chiffres clés (RFR, impôt dû, nombre de parts) se trouvent sur des pages différentes selon la complexité du foyer, et une extraction naïve limitée à la première page les manquera purement et simplement. Les copies caviardées ou partiellement masquées, transmises délibérément pour dissimuler certains chiffres, sont également fréquentes dans les contextes de location et de crédit, ce qui complique les contrôles anti-fraude automatisés.

La fraude est un risque bien réel. Des avis d'imposition falsifiés ou modifiés circulent pour des dossiers de location et des demandes de crédit, et une simple altération visuelle (changer un chiffre dans le champ RFR) est facile à réaliser et difficile à détecter sans vérifier la cohérence arithmétique entre les champs ou l'empreinte structurelle du document. Voir notre note sur la détection de la fraude documentaire pour l'approche générale.

Comment Sygnet traite ce document

Sygnet commence par classifier le fichier entrant comme un avis d'imposition, en le distinguant de documents proches comme les bulletins de paie ou les relevés bancaires. Le schéma est ensuite déduit dynamiquement selon la version du document et la configuration du foyer, car la position et le nombre de champs varient selon les cas. Chaque champ extrait porte un score de confiance et une référence de zone (bounding box) renvoyant à la page source, ce qui permet à un relecteur ou à un système en aval de voir exactement d'où provient chaque donnée plutôt que de faire confiance à une boîte noire. C'est la même logique de traçabilité au niveau du champ que nous appliquons à l'ensemble de nos types de documents.

Des règles de validation s'exécutent automatiquement : contrôle du format du numéro de référence, cohérence des dates entre année des revenus et date d'émission, et cohérence arithmétique entre RFR, nombre de parts et impôt dû. Lorsque le score de confiance du modèle sur un champ donné descend sous un seuil défini, ou qu'une règle de validation échoue, le dossier est acheminé vers une relecture humaine plutôt que d'être transmis automatiquement en aval. Tout le reste part directement vers une sortie structurée, livrée au format JSON conforme au schéma attendu par votre système financier ou de conformité. Voir sortie structurée pour le détail de ce format. Les journaux de traitement sont conservés à des fins d'audit, conformément à notre approche du RGPD et du traitement documentaire.

Règles de validation à appliquer

  • Vérifier que le numéro fiscal respecte la structure attendue à 13 chiffres et qu'il ne se répète pas entre des demandeurs sans lien entre eux
  • Contrôler le format de la référence de l'avis par rapport au schéma DGFiP connu pour l'année fiscale indiquée
  • Vérifier que l'année des revenus précède exactement d'un an la date de mise en recouvrement
  • Recalculer la plausibilité du montant de l'impôt net au regard du RFR et du nombre de parts, en utilisant les barèmes fiscaux publiés
  • Signaler les documents dont le nombre de parts sort de la plage 1 à 10 ou ne correspond pas à la situation de famille déclarée
  • Recouper le code postal et le nom de la commune avec le référentiel officiel des adresses françaises
  • Comparer le nom et l'adresse extraits avec les autres pièces KYC soumises dans le même dossier
  • Détecter la présence du mot « rectificatif » ou « avis rectificatif » dans le document et l'orienter séparément, car il annule et remplace un avis antérieur

FAQ

L'extraction permet-elle de détecter un avis d'imposition falsifié ?

L'extraction seule ne peut pas certifier l'authenticité d'un document, mais elle peut signaler des schémas suspects : incohérences arithmétiques entre RFR, nombre de parts et impôt dû, irrégularités de police dans les champs modifiés, ou écarts structurels par rapport au modèle DGFiP en vigueur. Combinée aux contrôles décrits dans notre référence sur la détection de la fraude documentaire, cette approche permet de repérer une part significative des documents falsifiés, même si une relecture manuelle reste recommandée pour les décisions à fort enjeu, comme les crédits d'un montant important.

En quoi cela diffère-t-il de l'extraction d'un bulletin de paie ?

Les deux sont des documents de vérification de revenus, mais un bulletin de paie couvre une seule période de paie et nécessite principalement l'employeur, le salaire brut/net et les champs de cotisations. Un avis d'imposition résume une année fiscale entière pour un foyer et requiert la composition du foyer, des numéros de référence et une logique de dates inter-annuelles. Les champs, les règles de validation et les schémas de fraude typiques diffèrent suffisamment pour que nous les traitions comme des pipelines distincts. Voir extraction de bulletin de paie pour la comparaison.

L'OCR suffit-il, ou faut-il une approche différente ?

L'OCR classique peine souvent avec les chaînes numériques denses et la mise en page variable de ce document, en particulier sur les copies scannées. Un modèle qui comprend la structure et le contexte du document, et pas seulement la forme des caractères, produit des résultats plus fiables sur des champs comme le numéro fiscal ou le RFR. Notre page OCR vs VLM traite ce compromis plus en détail.

ÉTAPE SUIVANTE

Voyez le résultat sur vos propres documents

Un email quand nous publions quelque chose qui vaut votre temps.