COMPARATIFS
Alternative à Google Document AI
Par Sygnet Research. Rédigé par Sygnet, sourcé, vérifié avant publication.
Google Document AI est un ensemble de processeurs Google Cloud destinés à numériser et extraire des données de documents : OCR, analyse de mise en page, parseurs prêts à l'emploi et extracteurs personnalisés que l'on entraîne via une console. Sygnet est une plateforme et une API d'automatisation intelligente de documents conçue pour les équipes qui veulent une sortie structurée à partir de types de documents inconnus, sans avoir à construire au préalable un pipeline d'entraînement. Cette page est rédigée par Sygnet, il convient donc de lire la comparaison en ayant cela à l'esprit : chaque affirmation ci-dessous concernant Google Document AI renvoie vers la documentation ou la page tarifaire de Google elle-même, et lorsque nous n'avons pas pu vérifier un point, nous le signalons. Si vos documents sont à fort volume, de format stable, et que votre équipe travaille déjà entièrement sur Google Cloud, Document AI constitue un choix par défaut raisonnable, et cette page vous orientera probablement vers cette solution.
En bref
| Critère | Google Document AI | Sygnet |
|---|---|---|
| Types de documents | Les processeurs sont organisés par type : OCR, Form Parser, Layout Parser, classificateur et séparateur personnalisés, Summarizer, plus les extracteurs personnalisés. L'extracteur personnalisé permet aux utilisateurs de construire une extraction d'entités pour de nouveaux types de documents lorsqu'aucun processeur pré-entraîné n'est disponible (docs) | Tout type de document, en zero-shot, avec inférence de schéma |
| Mise en place et entraînement | Plusieurs modes existent. En zero-shot, seul le schéma est requis, et un jeu de test est nécessaire pour évaluer la précision (docs). L'entraînement d'un modèle personnalisé nécessite un minimum de trois documents (docs) | Aucune étape d'entraînement, aucun étiquetage ; on définit ou infère un schéma puis on appelle l'API |
| Approche d'extraction | Une combinaison de modèles de deep learning sensibles à la mise en page et de modèles à base de gabarits (docs) | Extraction zero-shot par modèle, vers un JSON structuré |
| Confiance | Renvoyée dans la réponse. La confiance de mise en page est un nombre compris entre 0 et 1, et chaque entité porte une valeur de confiance (référence, traitement des réponses) | Score de confiance par champ sur chaque champ extrait |
| Traçabilité | Des polygones de délimitation sont renvoyés, avec des coordonnées de sommets normalisées par rapport à l'image d'origine, dans l'intervalle 0 à 1 (référence) | Traçabilité par zone de délimitation (bounding box) pour chaque champ (traçabilité au niveau du champ) |
| Validation | Les entités incluent des valeurs normalisées, par exemple une date décomposée en année, mois et jour (docs). Les moteurs de règles métier ne font pas partie de la sortie documentée du processeur | Règles de validation et contrôles croisés entre documents intégrés |
| Circuit de relecture | Non vérifié pour cette page ; consultez la documentation Google actuelle pour les options de relecture humaine | Relecture humaine déclenchée uniquement en cas de faible confiance |
| Déploiement et hébergement | Une région ou multi-région doit être spécifiée pour le stockage et le traitement ; les options multi-régionales sont us et eu, avec un support mono-région limité (docs) | API hébergée uniquement, hébergement dans l'UE sur Google Cloud europe-west1 (sécurité) |
| Politique de données | Régie par les conditions générales de Google Cloud ; nous n'avons pas cité ici de clause précise sur l'entraînement des modèles | Aucun entraînement sur les documents des clients |
| Modèle tarifaire | Au nombre de pages, par processeur. Enterprise Document OCR est facturé 1,50 $ par 1 000 pages jusqu'à 5 000 000 de pages par mois, puis 0,60 $ par 1 000 au-delà ; l'extracteur personnalisé et Form Parser sont à 30 $ par 1 000 pages jusqu'à 1 000 000, puis 20 $ au-delà ; Layout Parser est à 10 $ par 1 000 pages. Les requêtes en échec (erreurs 4xx ou 5xx) ne sont pas facturées (tarifs) | Au document (tarifs) |
| API | REST et bibliothèques clientes dans plusieurs langages, au sein d'un projet Google Cloud (référence) | API REST, actuellement en accès anticipé |
| Classification et tri | Le séparateur et le classificateur personnalisés sont facturés 5 $ par 1 000 pages jusqu'à 1 000 000, puis 3 $ au-delà ; Summarizer est à 25 $ par 1 000 pages (tarifs) | Traité dans le cadre de l'extraction ; aucun processeur distinct à déployer |
Les forces de Google Document AI
D'abord, l'échelle et le prix par page. À 1,50 $ par 1 000 pages pour Enterprise Document OCR, ce tarif descendant à 0,60 $ au-delà de cinq millions de pages par mois, la numérisation brute de gros fonds documentaires est très peu coûteuse, et la grille tarifaire récompense le volume. Le modèle de processeurs est aussi réellement flexible : l'extracteur personnalisé prend en charge trois modes, l'IA générative en zero-shot et few-shot, un modèle personnalisé classique pour les équipes qui ne souhaitent pas recourir à l'IA générative, et un entraînement à base de gabarits qui peut fonctionner avec aussi peu que trois documents d'entraînement et trois documents de test pour des mises en page fixes (docs). Cette dernière option convient bien aux formulaires administratifs stables.
L'outillage autour de l'étiquetage est mature. Le modèle de fondation peut extraire des champs sur de nombreux types de documents, et l'étiquetage automatique réutilise vos noms de labels et vos annotations précédentes pour accélérer l'étiquetage à grande échelle (docs). Si vous devez améliorer une mise en page spécifique, vous pouvez continuer à alimenter le modèle en données et l'affiner (fine-tuning), les étapes d'entraînement étant un contrôle avancé (docs). Vous héritez également de l'IAM, de la facturation, de la journalisation et des régions de Google Cloud. Pour une équipe déjà installée sur GCP, cela compte beaucoup.
Les forces de Sygnet
Le pari de Sygnet est que l'essentiel du travail documentaire relève de la longue traîne, et non d'un formulaire unique à fort volume. L'extraction se fait en zero-shot sur tout type de document, avec inférence de schéma, si bien qu'un nouveau format de fournisseur ou un certificat inhabituel ne nécessite ni jeu de données, ni passe d'étiquetage, ni version de processeur à déployer. Chaque champ revient avec un score de confiance et une zone de délimitation (bounding box), ce qui rend possible une relecture sélective : les documents ne partent chez un humain que lorsque la confiance est faible, et le relecteur voit précisément à quel endroit de la page la valeur a été trouvée.
La validation fait partie du produit plutôt que d'être écrite en aval. Des règles s'appliquent aux champs extraits, et des contrôles croisés comparent les valeurs entre plusieurs documents d'un même lot, ce qui correspond à la configuration habituelle du travail en gestion de sinistres assurance et en onboarding KYC. L'hébergement est exclusivement dans l'UE, sur Google Cloud europe-west1, et les documents des clients ne servent pas à entraîner les modèles ; les détails figurent sur la page sécurité. La tarification se fait au document, et non à la page, ce qui est plus facile à prévoir lorsque la longueur des fichiers varie. Sygnet est aujourd'hui en accès anticipé, donc un périmètre plus restreint et plus récent qu'un service Google Cloud.
Quelle solution pour quelle équipe
- Numérisation à fort volume d'archives. Optez pour Google Document AI. La tarification OCR à la page à ce niveau de volume est difficile à battre, et vous n'avez probablement pas besoin de règles métier au niveau du champ.
- Une poignée de formulaires stables et à fort volume. Document AI, de nouveau. L'entraînement par gabarit ou modèle personnalisé se rentabilise lorsque la mise en page varie peu et que le volume se chiffre en millions de pages.
- Longue traîne de formats, peu d'exemples par format. Sygnet. Le zero-shot combiné à l'inférence de schéma supprime le coût de mise en place par format qui domine ce type de travail. Nos notes sur le choix construire ou acheter détaillent où se cache habituellement ce coût.
- Charges réglementées dans l'UE avec exigences d'audit. Sygnet si vous voulez un hébergement exclusivement européen et une traçabilité par champ par défaut. Document AI si vous préférez rester dans votre projet GCP existant et configurer vous-même la multi-région eu.
- Déjà fortement investi dans Google Cloud, avec des ingénieurs ML. Document AI. Vous irez plus loin, plus vite, avec les outils et le modèle IAM que vous connaissez déjà.
FAQ
Google Document AI peut-il extraire des données d'un type de document jamais rencontré auparavant ?
Oui, au sein de l'extracteur personnalisé. Le type de modèle par défaut de l'extracteur personnalisé est un modèle de fondation capable de prédiction en zero-shot, sans entraînement (docs). Il faut malgré tout créer un processeur, définir le schéma et choisir une région avant de pouvoir l'appeler. La différence avec Sygnet est opérationnelle plutôt que conceptuelle : aucun processeur à créer ni à versionner.
Comment les modèles tarifaires se comparent-ils réellement ?
Ils ne sont pas directement comparables, car Google facture à la page par processeur, tandis que Sygnet facture au document. L'exemple donné par Google lui-même : 100 pages traitées via Form Parser coûtent 3 $ (tarifs). Les fichiers multi-pages modifient fortement la comparaison, il convient donc de modéliser votre répartition réelle de pages. Notre calculateur de ROI et notre note sur le coût par réponse correcte aident à poser ce cadrage.
Les deux outils conservent-ils les données dans l'UE ?
Document AI vous impose de choisir un emplacement, et eu figure parmi les options multi-régionales prises en charge, avec un support mono-région limité en Europe (docs). La disponibilité par région varie selon la version du processeur, il faut donc vérifier le tableau des capacités du processeur souhaité. Sygnet fonctionne uniquement sur Google Cloud europe-west1 et n'entraîne pas de modèles sur les documents des clients.
ÉTAPE SUIVANTE
Voyez le résultat sur vos propres documents
Un email quand nous publions quelque chose qui vaut votre temps.