Échantillonnage et annotation pour l'extraction de clauses
Par Sygnet Research, vérifié avant publication
À retenir
- Vous n'avez jamais besoin de 5 000 contrats étiquetés : un échantillon stratifié d'environ 400 documents suffit pour une estimation de précision à ±5 points avec un niveau de confiance de 95%, et la répartition par type de clause compte davantage que le volume total.
- Des corpus publics déjà annotés par des experts font le gros du travail gratuitement : CUAD propose plus de 500 contrats annotés par des juristes experts sur 41 types de clauses, soit plus de 13 000 annotations, et MAUD y ajoute 47 457 annotations sur 152 accords de fusion publics.
- Un LLM juge n'est exploitable qu'après avoir mesuré son taux d'accord avec des relecteurs humains ; les taux publiés se situent autour de 0,83 et s'effondrent dès que la référence passe d'« un expert » à « la majorité des experts ».
- Rapportez le rappel par type de clause, pas un F1 global unique. Sur les benchmarks dérivés de CUAD, les meilleurs modèles plafonnent autour d'un F1 de 0,64, et c'est dans la variance entre catégories de clauses que se cache le vrai risque de diligence.
Pourquoi ne pas simplement faire annoter la data room à la main ?
Parce que l'annotation experte de clauses coûte plus cher que la revue elle-même. Les auteurs de MAUD donnent des chiffres concrets : l'annotation a mobilisé plus de 10 000 heures de travail d'étudiants en droit et d'avocats expérimentés, chaque étudiant suivant entre 70 et 100 heures de formation avant de commencer à annoter, et l'équipe a estimé la valeur du jeu de données à plus de 5 millions de dollars en appliquant un taux courant de 500 dollars de l'heure en honoraires juridiques M&A. Et cela ne portait que sur 152 accords. En appliquant ce modèle d'annotation à 5 000 contrats comportant chacun 20 à 40 clauses cibles, vous financez une seconde équipe de due diligence.
La seconde raison est structurelle. L'extraction de clauses est un problème d'aiguille dans une botte de foin : dans CUAD, en moyenne seulement 0,25% de chaque contrat est surligné pour un label donné, et plus de 99% des fenêtres glissantes ne contiennent aucun des 41 labels pertinents. Un modèle entraîné naïvement apprend donc à toujours renvoyer une absence de résultat. Un échantillonnage aléatoire de pages ou de documents n'apporte presque aucun signal sur les clauses qui vous intéressent. Il faut un échantillonnage conçu autour des cas positifs.
L'annotation experte de clauses à l'échelle d'une data room coûte plus cher que la revue de diligence qu'elle est censée accélérer.
À quoi ressemble une architecture de benchmark sur 5 000 contrats ?
Quatre couches, chacune répondant à une question différente, seule la plus petite nécessitant des labels humains.
Couche 1 : les jeux de référence publics pour valider la méthode avant de toucher aux données clients. Le seul jeu de test de CUAD fournit 4 128 points de données répartis sur 41 catégories de clauses issues de 102 contrats uniques, avec des longueurs de contexte allant de 0,6k à 301k caractères et une répartition des labels de 30% positifs / 70% négatifs. Cette masse de négatifs est précisément l'intérêt du jeu de données : elle teste si votre pipeline invente des clauses qui n'existent pas.
Couche 2 : une tranche stratifiée annotée par des humains sur votre propre corpus, 300 à 500 documents, répartis selon le type de contrat, la langue, la qualité de numérisation et le nombre de pages plutôt que tirés uniformément.
Couche 3 : des pseudo-labels de consensus multi-modèles sur le reste des documents. Lorsque deux extracteurs hétérogènes s'accordent sur une portion de texte et une valeur normalisée, on traite cela comme un label provisoire ; en cas de désaccord, on dispose d'une file de relecture humaine gratuite et à fort rendement.
Couche 4 : des invariants déterministes qui ne nécessitent aucun label : validité du format des dates, valeurs de droit applicable issues d'un vocabulaire fermé, délais de préavis dans des plages plausibles, noms des parties réconciliés avec le cap table. Toute violation d'invariant est une erreur par construction.
| Couche | Volume | Coût humain | Ce qu'elle mesure |
|---|---|---|---|
| Jeux publics (CUAD, MAUD) | 100-500 contrats | nul | Validité de la méthode, discipline sur la classe négative |
| Tranche humaine stratifiée | 300-500 documents | 2-4 semaines-expert | Précision/rappel non biaisés avec intervalles de confiance |
| Pseudo-labels de consensus | les 5 000 | relecture des désaccords uniquement | Dérive, couverture, angles morts par type de document |
| Invariants déterministes | les 5 000 | nul | Format, plages et contradictions entre documents |
Quelle doit vraiment être la taille de l'échantillon annoté par des humains ?
Pour un chiffre de précision global, environ 385 documents. C'est de l'arithmétique binomiale élémentaire : 1,96² × 0,25 / 0,05² ≈ 384 échantillons pour une marge de ±5 points à 95% de confiance, indépendamment du fait que le corpus contienne 5 000 ou 500 000 contrats. En resserrant à ±2 points, le nombre grimpe à environ 2 400, ce qui explique pourquoi ±5 points reste le choix raisonnable pour un benchmark de diligence ponctuel.
Le piège est qu'un chiffre global est quasiment inutile. Il faut le rappel par clause, et les clauses rares sont rares : une clause de changement de contrôle peut n'apparaître que dans 8% du corpus, de sorte qu'un échantillon aléatoire de 400 documents ne fournit qu'environ 32 cas positifs, avec un intervalle de confiance suffisamment large pour y faire passer un camion. La solution consiste à allouer par strate : 30 à 50 cas positifs par type de clause réellement pertinent, trouvés en surpondérant les documents signalés par le pipeline ainsi que les candidats récupérés par mots-clés qu'il n'avait pas repérés. On repondère ensuite aux proportions du corpus au moment du reporting. Notre checklist pour évaluer la précision d'extraction détaille davantage la conception des strates.
Un LLM juge peut-il remplacer l'annotateur humain ?
Il peut démultiplier vos annotateurs, pas les remplacer, et seulement après avoir mesuré son taux d'accord sur la tranche stratifiée. Les chiffres publiés sont encourageants mais ne constituent pas un chèque en blanc. Une revue de portée sur le LLM-juge dans le domaine de la santé a montré que, sur 13 études rapportant un taux d'accord, la médiane comme la moyenne se situaient à 0,83, avec cette réserve que les tâches bien délimitées, assorties de grilles d'évaluation précises, surpassent les tâches de génération ouverte. Dans un contexte de questions-réponses juridiques centrées sur des textes de loi, l'accord juge-humain a atteint 88,30%, mais les faux négatifs représentaient 10,80% des cas, ce qui signifie que le juge se montrait plus strict que les évaluateurs humains.
Le signal d'alerte que toute équipe data devrait retenir : dans une étude, le même juge qui atteignait un accord de 0,83 avec au moins un expert tombait à 0,51 face à des jugements de majorité d'experts. Le score de votre juge est fonction de votre référentiel. Définissez d'abord le référentiel (majorité de trois relecteurs, désaccords arbitrés), puis calibrez. Faites tourner le juge sur 300 éléments annotés par des humains, calculez le kappa de Cohen et une matrice de confusion, et consignez son biais directionnel afin de corriger le chiffre affiché. Notez aussi que cohérence n'est pas synonyme de justesse : une étude récente montre qu'une forte auto-cohérence n'indique pas nécessairement un fort taux d'accord avec les jugements humains.
Le taux d'accord de votre LLM juge est une propriété de votre référentiel, pas du juge lui-même.
Quelles métriques comptent spécifiquement pour la due diligence ?
Le rappel par type de clause, le taux d'abstention, et le coût par bonne réponse. Un F1 pondéré par la précision masque le seul échec qui peut faire capoter une opération : une clause manquée que personne ne relira. Utilisez le F2 en complément du F1 pour pondérer le rappel, comme le fait ContractEval, où les modèles propriétaires sont en tête sur la justesse et où GPT-4.1 et GPT-4.1 mini affichent les meilleurs scores F1, à 0,641 et 0,644, avec un F2 de 0,672 et 0,678.
Suivez explicitement le taux de fausse abstention. ContractEval a mesuré un taux de « paresse » et constaté que les modèles open source produisent plus souvent des réponses de type « aucune clause pertinente » même lorsque des clauses pertinentes sont présentes, un mode d'échec qui a l'apparence d'une sortie propre et se lit comme un contrat sans problème. Le taux de faux positifs de GPT-4.1 sur cet axe était de 0,071.
Deux autres constats méritent d'orienter la conception du benchmark : la performance varie selon les catégories juridiques, avec une justesse nettement plus faible sur les clauses moins courantes ou plus longues, et le mode raisonnement améliore l'efficacité apparente de la sortie tout en réduisant la justesse. Testez le raisonnement activé et désactivé plutôt que de supposer qu'il aide. Pour l'économie de ce compromis, voir notre note sur la précision versus le coût par bonne réponse.
Comment détecter les erreurs dans les 4 600 documents jamais annotés ?
Grâce à des signaux de désaccord et à des contrôles de cohérence inter-documents, plutôt qu'avec davantage de labels. Trois mécanismes font la majeure partie du travail.
Désaccord de consensus : faites tourner deux extracteurs avec des profils d'échec différents (un parseur sensible à la mise en page et un modèle vision-langage, par exemple) et envoyez tout désaccord en relecture. Comme la tâche d'extraction est par nature parcimonieuse, les désaccords ne représentent qu'une faible fraction des champs totaux mais concentrent une large part des erreurs.
Échantillonnage d'auto-cohérence : relancez le même modèle à température > 0 sur une tranche et signalez les champs dont les réponses varient. Traitez la variance comme un indicateur de difficulté, en gardant à l'esprit la réserve évoquée plus haut : la stabilité seule ne prouve pas la justesse.
Contrôles de contradiction au niveau du corpus : une même contrepartie apparaissant avec deux droits applicables différents, une clause de cession marquée absente dans un contrat dont l'accord-cadre indique qu'elle doit obligatoirement figurer, des délais de préavis de résiliation hors de la distribution habituelle pour cette famille de contrats. Ces contrôles détectent de vraies erreurs sans aucune annotation. Sygnet construit des pipelines d'extraction où la confiance au niveau du champ et la provenance de chaque extrait sont exposées pour chaque réponse, ce qui est précisément ce qui rend possible ce type d'audit a posteriori ; la même logique s'applique plus largement au traitement documentaire pour les opérations M&A et la due diligence.
Fixez votre seuil de relecture à partir de la tranche de calibration, pas de l'intuition. Si un type de clause affiche un rappel de 0,92 au-dessus d'un certain seuil de confiance et de 0,55 en dessous, ce seuil constitue votre frontière d'intervention humaine, et il doit être défini clause par clause.
FAQ
Combien de contrats dois-je annoter pour faire confiance à un benchmark d'extraction de clauses ?
Environ 400 documents pour une estimation de précision globale à ±5 points avec 95% de confiance, plus 30 à 50 exemples positifs par type de clause qui vous intéresse. La répartition par clause compte plus que le volume total. Les clauses rares comme le changement de contrôle ou l'exclusivité nécessitent un surpondérage délibéré, car un tirage uniforme produira trop peu de cas positifs pour estimer le rappel avec un intervalle exploitable.
CUAD reste-t-il un benchmark valide pour les pipelines LLM ?
Oui, comme contrôle de méthode plutôt que comme plafond de performance. Ses contrats proviennent de transactions réelles couvrant un large éventail de types de clauses, et les annotations ont été réalisées par des étudiants en droit ayant suivi 70 à 100 heures de formation spécialisée sous supervision d'avocats. Il reste la colonne vertébrale de travaux plus récents : ContractEval y a évalué 4 modèles propriétaires et 15 modèles open source. Il ne reflétera pas vos types de documents, vos langues ni votre qualité de numérisation, d'où l'intérêt de le combiner avec votre propre tranche stratifiée.
Quelle précision puis-je attendre d'un LLM générique pour l'extraction de clauses ?
Moins que ce que suggèrent les démos fournisseurs. Sur l'identification de risques au niveau des clauses basée sur CUAD, les meilleurs modèles ont obtenu un F1 d'environ 0,64, la similarité de Jaccard étant utilisée pour mesurer l'utilisabilité de la sortie indépendamment de la justesse. Les auteurs de ContractEval concluent que la plupart des LLM se situent à un niveau comparable à celui d'un assistant juridique junior et que les modèles open source nécessitent un fine-tuning ciblé pour les contextes juridiques à fort enjeu. Prévoyez une relecture humaine sur les clauses à faible confiance et sur les clauses rares.
Faut-il benchmarker des modèles quantifiés ou en pleine précision ?
Testez les deux, puis tranchez selon le coût. ContractEval a constaté que la quantification accélère l'inférence au prix d'une baisse de performance, et qu'elle réduit légèrement la performance, en particulier en mode raisonnement, si bien que les modèles en pleine précision peuvent être préférables pour les tâches juridiques, sauf contraintes de ressources strictes. Pour un travail de diligence, où une clause manquée coûte bien plus cher que des heures de GPU, le choix par défaut de la pleine précision est généralement le bon.
Un email quand nous publions quelque chose qui vaut votre temps.