Vous pouvez utiliser Enterprise Document OCR dans Document AI pour détecter et extraire du texte et des informations de mise en page à partir de différents documents. Grâce aux fonctionnalités configurables, vous pouvez adapter le système pour répondre à des exigences spécifiques de traitement des documents.
Présentation
Vous pouvez utiliser Enterprise Document OCR pour des tâches telles que la saisie de données basée sur des algorithmes ou le machine learning, ainsi que pour améliorer et vérifier la précision des données. Vous pouvez également utiliser Enterprise Document OCR pour effectuer des tâches telles que :
- Numérisation de texte : extrayez le texte et les données de mise en page des documents pour la recherche, les pipelines de traitement de documents basés sur des règles ou la création de modèles personnalisés.
- Utiliser des applications de grands modèles de langage : utilisez la compréhension contextuelle des LLM et les capacités d'extraction de texte et de mise en page de l'OCR pour automatiser les questions et les réponses. Dégagez des insights à partir des données et simplifiez les workflows.
- Archivage : numérisez les documents papier pour les rendre lisibles par machine et améliorer leur accessibilité.
Choisir la meilleure solution OCR pour votre cas d'utilisation
| Solution | Produit | Description | Cas d'utilisation |
|---|---|---|---|
| Document AI | Enterprise Document OCR | Modèle spécialisé pour les cas d'utilisation de documents. Les fonctionnalités avancées incluent le score de qualité de l'image, les indications de langue et la correction de la rotation. | Recommandé pour extraire du texte de documents. Il peut s'agir de fichiers PDF, de documents scannés en tant qu'images ou de fichiers Microsoft DocX. |
| Document AI | Modules complémentaires OCR | Des fonctionnalités premium pour répondre à des besoins spécifiques. Compatible uniquement avec Enterprise Document OCR version 2.0 et ultérieure. | Vous devez détecter et reconnaître des formules mathématiques, recevoir des informations sur le style de police ou activer l'extraction de cases à cocher. |
| API Cloud Vision | Détection de texte | API REST disponible dans le monde entier, basée sur le modèle OCR standard Google Cloud . Quota par défaut de 1 800 requêtes par minute. | Cas d'utilisation généraux d'extraction de texte nécessitant une faible latence et une capacité élevée. |
| Cloud Vision | OCR Google Distributed Cloud (obsolète) | Application Google Cloud Marketplace qui peut être déployée en tant que conteneur sur n'importe quel cluster GKE à l'aide de GKE Enterprise. | Pour répondre aux exigences de résidence des données ou de conformité. |
Détection et extraction
Enterprise Document OCR peut détecter des blocs, des paragraphes, des lignes, des mots et des symboles dans des PDF et des images, et redresser les documents pour une meilleure précision.
Attributs de détection et d'extraction de mise en page acceptés :
| Texte imprimé | Écriture manuscrite | Paragraphe | Bloquer | Ligne | Éléments textuels | Au niveau des symboles | Numéro de page |
|---|---|---|---|---|---|---|---|
| Par défaut | Par défaut | Par défaut | Par défaut | Par défaut | Par défaut | Configurable | Par défaut |
Les fonctionnalités configurables d'Enterprise Document OCR sont les suivantes :
Extraire du texte intégré ou natif à partir de PDF numériques : cette fonctionnalité extrait le texte et les symboles exactement tels qu'ils apparaissent dans les documents sources, même pour les textes pivotés, les tailles ou styles de police extrêmes, et le texte partiellement masqué.
Correction de la rotation : utilisez Enterprise Document OCR pour prétraiter les images de documents afin de corriger les problèmes de rotation qui peuvent affecter la qualité de l'extraction ou le traitement.
Score de qualité d'image : recevez des métriques de qualité qui peuvent vous aider à acheminer les documents. Le score de qualité des images fournit des métriques de qualité au niveau de la page dans huit dimensions, y compris le flou, la présence de polices plus petites que d'habitude et l'éblouissement.
Spécifier la plage de pages : spécifie la plage de pages d'un document d'entrée pour l'OCR. Cela permet d'économiser des dépenses et du temps de traitement pour les pages inutiles.
Détection de la langue : détecte les langues utilisées dans les textes extraits.
Suggestions de langue et d'écriture manuscrite : améliorez la justesse en fournissant au modèle OCR une suggestion de langue ou d'écriture manuscrite en fonction des caractéristiques connues de votre ensemble de données.
Pour savoir comment activer les configurations OCR, consultez Activer les configurations OCR.
Modules complémentaires OCR
Enterprise Document OCR propose des fonctionnalités d'analyse facultatives qui peuvent être activées sur les demandes de traitement individuelles selon les besoins.
Les fonctionnalités complémentaires suivantes sont disponibles pour les versions pretrained-ocr-v2.0-2023-06-02 et pretrained-ocr-v2.1-2024-08-07 stables, ainsi que pour la version pretrained-ocr-v2.1.1-2025-01-31 Release Candidate.
- OCR pour les formules mathématiques : identifiez et extrayez les formules des documents au format LaTeX.
- Extraction des cases à cocher : détectez les cases à cocher et extrayez leur état (coché/décoché) dans la réponse Enterprise Document OCR.
- Détection du style de police : identifiez les propriétés de police au niveau des mots, y compris le type, le style, l'écriture manuscrite, l'épaisseur et la couleur de la police.
Pour savoir comment activer les modules complémentaires listés, consultez Activer les modules complémentaires de reconnaissance optique des caractères.
Formats de fichiers acceptés
Enterprise Document OCR est compatible avec les formats de fichiers PDF, GIF, TIFF, JPEG, PNG, BMP et WebP. Pour en savoir plus, consultez Fichiers acceptés.
Enterprise Document OCR est également compatible avec les fichiers DocX de 15 pages maximum en mode synchrone et de 30 pages maximum en mode asynchrone. Pour envoyer une demande d'augmentation de quota (DAQ), suivez la procédure permettant de demander un ajustement de quota. La compatibilité avec le format DocX est en version Preview privée. Pour demander l'accès, contactez l'équipe responsable de votre compte Google.
Gestion avancée des versions
La gestion avancée des versions est disponible en version bêta. Les mises à niveau des modèles OCR d'IA/ML sous-jacents peuvent entraîner des modifications du comportement de l'OCR. Si une cohérence stricte est requise, utilisez une version figée du modèle pour ancrer le comportement à un ancien modèle OCR pendant 18 mois maximum. Cela garantit le même résultat pour la fonction OCR d'image. Consultez le tableau sur les versions de l'outil de traitement.
Versions du processeur
Les versions de processeur suivantes sont compatibles avec cette fonctionnalité. Pour en savoir plus, consultez Gérer les versions de l'outil de traitement.
| ID de version | Canal de publication | Description |
|---|---|---|
pretrained-ocr-v1.2-2022-11-10 |
Stable | Version figée du modèle v1.0 : fichiers, configurations et binaires du modèle d'un instantané de version figé dans une image de conteneur pendant 18 mois maximum. |
pretrained-ocr-v2.0-2023-06-02 |
Stable | Modèle prêt pour la production, spécialisé dans les cas d'utilisation de documents. Inclut l'accès à tous les modules complémentaires OCR. |
pretrained-ocr-v2.1-2024-08-07 |
Stable | Les principaux axes d'amélioration de la version 2.1 sont les suivants : meilleure reconnaissance du texte imprimé, détection plus précise des cases à cocher et ordre de lecture plus précis. |
pretrained-ocr-v2.1.1-2025-01-31 |
Version candidate | La version 2.1.1 est semblable à la version 2.1 et est disponible dans toutes les régions, à l'exception de US, EU et asia-southeast1. |
Utiliser Enterprise Document OCR pour traiter des documents
Ce guide de démarrage rapide vous présente Enterprise Document OCR. Il vous explique comment optimiser les résultats de la reconnaissance optique des caractères (OCR) pour votre workflow en activant ou en désactivant l'une des configurations OCR disponibles.
- Connectez-vous à votre compte Google Cloud . Si vous débutez sur Google Cloud, créez un compte pour évaluer les performances de nos produits en conditions réelles. Les nouveaux clients bénéficient également de 300 $ de crédits sans frais pour exécuter, tester et déployer des charges de travail.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
Créer un processeur Enterprise Document OCR
Commencez par créer un processeur Enterprise Document OCR. Pour en savoir plus, consultez Créer et gérer des processeurs.
Configurations OCR
Toutes les configurations OCR peuvent être activées en définissant les champs correspondants dans ProcessOptions.ocrConfig dans ProcessDocumentRequest ou BatchProcessDocumentsRequest.
Pour en savoir plus, consultez Envoyer une demande de traitement.
Analyse de la qualité des images
L'analyse intelligente de la qualité des documents utilise le machine learning pour évaluer la qualité d'un document en fonction de la lisibilité de son contenu.
Cette évaluation de la qualité est renvoyée sous la forme d'un niveau de qualité [0, 1], où 1 signifie une qualité parfaite.
Si le niveau de qualité détecté est inférieur à 0.5, une liste des raisons de mauvaise qualité (triées par probabilité) est également renvoyée.
Une probabilité supérieure à 0.5 est considérée comme une détection positive.
Si le document est considéré comme défectueux, l'API renvoie les huit types de défauts de document suivants :
quality/defect_blurryquality/defect_noisyquality/defect_darkquality/defect_faintquality/defect_text_too_smallquality/defect_document_cutoffquality/defect_text_cutoffquality/defect_glare
L'analyse de la qualité des documents présente certaines limites :
- Il peut renvoyer des faux positifs pour des documents numériques sans défaut. Cette fonctionnalité est plus efficace sur les documents numérisés ou photographiés.
Les défauts de reflet sont locaux. Leur présence n'empêche pas forcément la lisibilité globale du document.
Entrée
Pour l'activer, définissez ProcessOptions.ocrConfig.enableImageQualityScores sur true dans la demande de traitement.
Cette fonctionnalité supplémentaire ajoute une latence comparable au traitement OCR à l'appel du processus.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableImageQualityScores": true
}
}
}
Sortie
Les résultats de la détection des défauts s'affichent dans Document.pages[].imageQualityScores[].
{
"pages": [
{
"imageQualityScores": {
"qualityScore": 0.7811847,
"detectedDefects": [
{
"type": "quality/defect_document_cutoff",
"confidence": 1.0
},
{
"type": "quality/defect_glare",
"confidence": 0.97849524
},
{
"type": "quality/defect_text_cutoff",
"confidence": 0.5
}
]
}
}
]
}
Pour obtenir des exemples de sortie complets, consultez Exemple de sortie de processeur.
Indicateurs de langue
Le processeur de reconnaissance optique des caractères est compatible avec les indications de langue que vous définissez pour améliorer les performances du moteur de reconnaissance optique des caractères. L'application d'un indice de langue permet à la ROC d'optimiser la reconnaissance pour une langue sélectionnée au lieu d'une langue déduite.
Entrée
Pour l'activer, définissez ProcessOptions.ocrConfig.hints[].languageHints[] avec une liste de codes de langue BCP-47.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"hints": {
"languageHints": ["en", "es"]
}
}
}
}
Pour obtenir des exemples de sortie complets, consultez Exemple de sortie de processeur.
Détection des symboles
Renseignez les données au niveau du symbole (ou de la lettre individuelle) dans la réponse du document.
Entrée
Pour l'activer, définissez ProcessOptions.ocrConfig.enableSymbol sur true dans la demande de traitement.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableSymbol": true
}
}
}
Sortie
Si cette fonctionnalité est activée, le champ Document.pages[].symbols[] est renseigné.
Pour obtenir des exemples de sortie complets, consultez Exemple de sortie de processeur.
Analyse PDF intégrée
Extrayez le texte intégré à des fichiers PDF numériques. Lorsqu'elle est activée, le modèle PDF numérique intégré est automatiquement utilisé s'il existe du texte numérique. Si le texte n'est pas numérique, le modèle OCR optique est automatiquement utilisé. L'utilisateur reçoit les deux résultats textuels fusionnés.
Entrée
Pour l'activer, définissez ProcessOptions.ocrConfig.enableNativePdfParsing sur true dans la demande de traitement.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableNativePdfParsing": true
}
}
}
Détection de personnages dans une boîte
Par défaut, Enterprise Document OCR dispose d'un détecteur activé pour améliorer la qualité de l'extraction de texte des caractères situés dans une zone. Voici un exemple :

Si vous rencontrez des problèmes de qualité de reconnaissance optique des caractères avec des caractères à l'intérieur de cadres, vous pouvez désactiver cette option.
Entrée
Pour le désactiver, définissez ProcessOptions.ocrConfig.disableCharacterBoxesDetection sur true dans la demande de traitement.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"disableCharacterBoxesDetection": true
}
}
}
Ancienne mise en page
Si vous avez besoin d'un algorithme heuristique de détection de la mise en page, vous pouvez activer l'ancienne mise en page, qui sert d'alternative à l'algorithme actuel de détection de la mise en page basé sur le ML. Il ne s'agit pas de la configuration recommandée. Les clients peuvent choisir l'algorithme de mise en page le plus adapté à leur flux de travail documentaire.
Entrée
Pour l'activer, définissez ProcessOptions.ocrConfig.advancedOcrOptions sur ["legacy_layout"] dans la demande de traitement.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"advancedOcrOptions": ["legacy_layout"]
}
}
}
Spécifier une plage de pages
Par défaut, la reconnaissance optique des caractères extrait le texte et les informations de mise en page de toutes les pages des documents. Vous pouvez sélectionner des numéros de page ou des plages de pages spécifiques, et n'extraire le texte que de ces pages.
Il existe trois façons de configurer cela dans ProcessOptions :
- Pour ne traiter que la deuxième et la cinquième page :
{
"individualPageSelector": {"pages": [2, 5]}
}
- Pour ne traiter que les trois premières pages :
{
"fromStart": 3
}
- Pour ne traiter que les quatre dernières pages :
{
"fromEnd": 4
}