Audience
L'objectif de ce tutoriel est de vous aider à développer des applications à l'aide de la détection de documents texte de l'API Google Cloud Vision. Il y est supposé que vous maîtrisez les concepts et les techniques de base de la programmation. Mais même si vous êtes un programmeur débutant, vous devriez pouvoir suivre et exécuter ce tutoriel sans difficulté, puis utiliser la documentation de référence de l'API Cloud Vision pour créer des applications de base.
Prérequis
- Configurez un projet API Cloud Vision dans la console Google Cloud .
Configurez votre environnement pour utiliser le service Identifiants par défaut de l'application.
Python
- Installez Python.
- Installez pip.
- Installez la bibliothèque cliente Google Cloud et la bibliothèque de traitement d'images Python Imaging Library.
Annoter une image à l'aide de l'OCR dans un document texte
Ce tutoriel vous présente une application de base de l'API Vision qui envoie une requête DOCUMENT_TEXT_DETECTION, puis traite la réponse fullTextAnnotation.
Une fullTextAnnotation est une réponse hiérarchique structurée pour le texte UTF-8 extrait de l'image. Elle est organisée sous la forme Pages → Blocks → Paragraphs → Words → Symbols (Pages → Blocs → Paragraphes → Mots → Symboles) :
Pageest un ensemble de blocs, avec des méta-informations sur la page : tailles, résolutions (la résolution X et la résolution Y peuvent varier).Blockreprésente un élément "logique" de la page (par exemple, une zone couverte de texte, ou une image ou un séparateur situé entre des colonnes). Les blocs de texte et de tableau contiennent les principales informations nécessaires à l'extraction du texte.Paragraphest une unité structurelle de texte représentant une séquence ordonnée de mots. Par défaut, les mots sont considérés comme séparés par des sauts de mot.Wordest la plus petite unité de texte. Elle est représentée sous la forme d'un tableau de symboles.Symbolreprésente un caractère ou un signe de ponctuation.
fullTextAnnotation peut également fournir les URL d'images Web correspondant partiellement ou parfaitement à l'image de la requête.
Intégralité du code
Lors de la lecture du code, nous vous recommandons de vous reporter également la documentation de référence de l'API Cloud Vision pour Python.