Liste der Features

Mit der Vision API können Sie derzeit die folgenden Features verwenden:

Alle Featuretypen

Texterkennung

Bild eines Verkehrsschilds
  • Es wird die optische Zeichenerkennung (Optical Character Recognition, OCR) für ein Bild ausgeführt: Texterkennung und ‑konvertierung in maschinencodierten Text. Erkennt und extrahiert UTF-8-Text in einem Bild.
  • Bilder: Optimiert für kleine Textbereiche in einem größeren Bild.
  • Antwort: Es werden eine Liste der als Text identifizierten Wörter, die zugehörigen Begrenzungsrahmen und textAnnotations sowie die strukturelle Hierarchie für den von OCR erkannten Text (fullTextAnnotation) zurückgegeben.
    • Hierarchie der extrahierten Textstruktur:
      • TextAnnotation -> Seite -> Block -> Absatz -> Wort -> Symbol.
      • Jede Strukturkomponente ab Seite kann außerdem eigene Attribute wie erkannte Sprachen, Zeilenumbrüche usw. haben.
  • Unterstützte Sprachen: Funktioniert mit derzeit unterstützten, zugeordneten und experimentellen Sprachen.
  • Enum-Wert des Features: TEXT_DETECTION.

Erkennung von Dokumenttext (hoher Textanteil/Handschrift)

Bild mit Fließtext und Anmerkungen
Bild mit handschriftlichem Text
  • Es wird die optische Zeichenerkennung (OCR) für eine Datei (PDF-/TIFF-Format) oder ein Bild mit viel Text durchgeführt: Erkennung des Textes und Konvertierung in maschinencodierten Text.
  • Dateien: Optimiert für Dokumentdateien (PDF/TIFF).
  • Bilder: Optimiert für dicht beschriebene Textbereiche in einem Bild (Bilder von Dokumenten) und Bilder, die Handschrift enthalten.
  • Antwort: Es wird die strukturelle Hierarchie für den per OCR erkannten Text zurückgegeben (fullTextAnnotation).
    • Hierarchie der extrahierten Textstruktur:
      • TextAnnotation -> Seite -> Block -> Absatz -> Wort -> Symbol.
      • Jede Strukturkomponente ab Seite kann außerdem eigene Attribute wie erkannte Sprachen, Zeilenumbrüche usw. haben.
  • Unterstützte Sprachen: Funktioniert mit derzeit unterstützten, zugeordneten und experimentellen Sprachen.
  • Enum-Wert des Features: DOCUMENT_TEXT_DETECTION.
    • Hat Vorrang, wenn DOCUMENT_TEXT_DETECTION und TEXT_DETECTION angefordert werden.

Erkennung von Sehenswürdigkeiten1

Bild der Basilius-Kathedrale
  • Es wird der Name der Sehenswürdigkeit, ein Konfidenzwert sowie ein Begrenzungsrahmen in dem Bild mit der Sehenswürdigkeit zurückgegeben.
  • Es werden Koordinaten für die erkannte Entität angegeben.

Logoerkennung2

Annotiertes Logo
  • Es wird eine Textbeschreibung der identifizierten Entität, ein Konfidenzwert und ein Begrenzungspolygon für das Logo in der Datei zurückgegeben.

Labelerkennung3

Bild einer Straße in Shanghai
  • Es werden allgemeine Labels für ein Bild bereitgestellt.
  • Für jedes Label wird eine Textbeschreibung, ein Konfidenzwert und eine Aktualitätsbewertung zurückgegeben.

Bildattribute4

Bild von Bali mit Attributen
  • Es werden die dominanten Farben in einem Bild zurückgegeben.
  • Jede Farbe wird im RGBA-Farbraum dargestellt, hat einen Konfidenzwert und es wird dafür der Anteil der Pixel angezeigt, die die Farbe belegt [0, 1].

Objektlokalisierung5

Bild mit Begrenzungsrahmen
  • Es werden allgemeine Label- und Begrenzungsrahmen-Annotationen für mehrere Objekte bereitgestellt, die in einem einzelnen Bild erkannt wurden.
  • Für jedes erkannte Objekt werden die folgenden Elemente zurückgegeben: eine Textbeschreibung, ein Konfidenzwert und normalisierte Eckpunkte [0,1] für das Begrenzungspolygon um das Objekt.

Erkennung von Zuschneidehinweisen