Es wird die optische Zeichenerkennung (Optical Character Recognition, OCR) für ein Bild ausgeführt: Texterkennung und ‑konvertierung in maschinencodierten Text. Erkennt und extrahiert UTF-8-Text in einem Bild.
Bilder: Optimiert für kleine Textbereiche in einem größeren Bild.
Antwort: Es werden eine Liste der als Text identifizierten Wörter, die zugehörigen Begrenzungsrahmen und textAnnotations sowie die strukturelle Hierarchie für den von OCR erkannten Text (fullTextAnnotation) zurückgegeben.
Es wird die optische Zeichenerkennung (OCR) für eine Datei (PDF-/TIFF-Format) oder ein Bild mit viel Text durchgeführt: Erkennung des Textes und Konvertierung in maschinencodierten Text.
Dateien: Optimiert für Dokumentdateien (PDF/TIFF).
Bilder: Optimiert für dicht beschriebene Textbereiche in einem Bild (Bilder von Dokumenten) und Bilder, die Handschrift enthalten.
Antwort: Es wird die strukturelle Hierarchie für den per OCR erkannten Text zurückgegeben (fullTextAnnotation).
Es werden allgemeine Label- und Begrenzungsrahmen-Annotationen für mehrere Objekte bereitgestellt, die in einem einzelnen Bild erkannt wurden.
Für jedes erkannte Objekt werden die folgenden Elemente zurückgegeben: eine Textbeschreibung, ein Konfidenzwert und normalisierte Eckpunkte [0,1] für das Begrenzungspolygon um das Objekt.