Verarbeitungsantwort verarbeiten

Die Antwort auf eine Verarbeitungsanfrage enthält ein Document-Objekt mit allen bekannten Informationen zum verarbeiteten Dokument, einschließlich aller strukturierten Informationen, die Document AI extrahieren konnte.

Auf dieser Seite wird das Layout des Document-Objekts erläutert. Dazu werden Beispieldokumente bereitgestellt und Aspekte der OCR-Ergebnisse den spezifischen Elementen des Document-Objekt-JSON zugeordnet. Außerdem finden Sie hier Codebeispiele für Clientbibliotheken und das Document AI Toolbox SDK. In diesen Codebeispielen wird die Onlineverarbeitung verwendet, aber das Parsen des Document-Objekts funktioniert für die Batchverarbeitung genauso.

handle-response-1

Die orangefarbenen und blauen Rechtecke und Pfeile stehen dafür, dass mindestens ein Feld der verbundenen Objekte .layout bzw. detectedLanguage ist. Im Diagramm wird die Krähenfußnotation verwendet.

Verwenden Sie ein JSON-Anzeige- oder Bearbeitungstool, das speziell für das Ein- und Ausblenden von Elementen entwickelt wurde. Die Überprüfung von unformatiertem JSON in einem Texteditor ist ineffizient.

Text, Layout und Qualitätsfaktoren

Hier ein Beispiel für ein Textdokument:

handle-response-2

Hier ist das vollständige Dokumentobjekt, das vom Prozessor Enterprise Document OCR zurückgegeben wird:

JSON herunterladen

Diese OCR-Ausgabe ist auch immer in der Ausgabe des Document AI-Prozessors enthalten, da die OCR von den Prozessoren ausgeführt wird. Dabei werden die vorhandenen OCR-Daten verwendet. Deshalb können Sie solche JSON-Daten mit der Inline-Dokumentoption in Document AI-Prozessoren eingeben.

  image=None, # all our samples pass this var
  mime_type="application/json",
  inline_document=document_response # pass OCR output to CDE input - undocumented

Hier sind einige der wichtigen Felder:

Rohtext

Das Feld text enthält den Text, der von Document AI erkannt wird. Dieser Text enthält keine Layoutstruktur außer Leerzeichen, Tabulatoren und Zeilenumbrüchen. In diesem Feld werden die Textinformationen eines Dokuments gespeichert. Es dient als zentrale Informationsquelle für den Text des Dokuments. Andere Felder können sich anhand der Position (startIndex und endIndex) auf Teile des Textfelds beziehen.

  {
    text: "Sample Document\nHeading 1\nLorem ipsum dolor sit amet, ..."
  }

Seitengröße und Sprachen

Jedes page im Dokumentobjekt entspricht einer physischen Seite aus dem Beispieldokument. Die JSON-Beispielausgabe enthält eine Seite, da es sich um ein einzelnes PNG-Bild handelt.

  {
    "pages:" [
      {
        "pageNumber": 1,
        "dimension": {
          "width": 679.0,
          "height": 460.0,
          "unit": "pixels"
        },
      }
    ]
  }
{
  "pages": [
    {
      "detectedLanguages": [
        {
          "confidence": 0.98009938,
          "languageCode": "en"
        },
        {
          "confidence": 0.01990064,
          "languageCode": "und"
        }
      ]
    }
  ]
}

OCR-Daten

Mit Document AI OCR wird Text mit unterschiedlicher Granularität oder Organisation auf der Seite erkannt, z. B. Textblöcke, Absätze, Tokens und Symbole (die Symbolebene ist optional, wenn die Ausgabe von Daten auf Symbolebene konfiguriert ist). Das sind alles Mitglieder des Seitenobjekts.

Jedes Element hat ein entsprechendes layout, das seine Position und seinen Text beschreibt. Nicht textbasierte visuelle Elemente (z. B. Kästchen) sind ebenfalls auf Seitenebene.

{
  "pages": [
    {
      "paragraphs":