Benutzerdefinierter Splitter
Mit dem benutzerdefinierten Splitter können Sie zusammengesetzte Dokumente (Dokumente aus mehreren Klassen) in eine Reihe von Dokumenten mit einer einzelnen Klasse aufteilen, indem Sie jedes logische Dokument identifizieren. Ein Hypothekenpaket enthält beispielsweise mehrere Klassen, z. B. Antrag, Einkommensnachweis und Lichtbildausweis. Benutzerdefinierte Splitter-Prozessoren können wie geliefert verwendet oder von Grund auf mit Ihren eigenen Dokumenten und benutzerdefinierten Klassen trainiert werden.
Beschreibung und Verwendung des Splitters
Sie können benutzerdefinierte Splitter erstellen, die speziell auf Ihre Dokumente zugeschnitten sind und mit Ihren Daten trainiert und ausgewertet werden, oder vortrainierte Modelle mit generativer KI bereitstellen. Diese Prozessoren identifizieren Dokumentklassen unter Nutzung einer benutzerdefinierten Gruppe von Klassen. Sie können diese Prozessoren dann für Ihre Dokumente verwenden. In der Regel verwenden Sie einen benutzerdefinierten Splitter für Dateien, die aus verschiedenen Arten logischer Dokumente bestehen, und übergeben die Dokumente dann mithilfe der Klassenidentifikation an einen geeigneten Extraktionsprozessor, um die Entitäten zu extrahieren.
Da ML-Modelle nicht perfekt sind und eine bestimmte Fehlerrate haben und Fehler bei der Aufteilung in der Regel sehr problematisch sind (eine fehlerhafte Aufteilung macht zwei Dokumente falsch und verursacht Extraktionsfehler), empfiehlt es sich, immer eine manuelle Überprüfung nach der Aufteilung der Vorhersage, aber vor der eigentlichen Dateiaufteilung zu haben. Je nach Geschäftsanforderungen gibt es Alternativen zur manuellen Überprüfung:
- Verwenden Sie die Konfidenzwerte in der Vorhersage, um zu entscheiden, ob die manuelle Überprüfung übersprungen werden soll (wenn sie hoch genug ist). Dieser Konfidenzgrenzwert sollte anhand von Verlaufsdaten zu Fehlerraten bei bestimmten Konfidenzwerten bestimmt werden. Dies sollte eine Geschäftsentscheidung auf der Grundlage der Geschäftsprozesstoleranz für Fehler und Anforderungen sein, um die manuelle Überprüfung zu umgehen.
- In einigen Anwendungsfällen können die aufgeteilten Dokumente gemäß der vorhergesagten Klasse direkt an den entsprechenden Extractor weitergeleitet werden. Wenn die Extraktion unvollständig ist oder niedrige Konfidenzwerte hat, isolieren Sie die aufgeteilten Dokumente und lösen Sie das ursprüngliche zusammengesetzte Dokument und die Aufteilungsentscheidung aus, um sie dann zu überprüfen. Das erfordert recht komplexe Workflow-Anforderungen.
Versionen benutzerdefinierter Splitterversionen
Die folgenden Modelle sind für benutzerdefinierte Splitter verfügbar. Informationen zum Ändern von Modellversionen finden Sie unter Prozessorversionen verwalten.
Version 1.5 unterstützt Konfidenzwerte.
| Modellversion | Beschreibung | Release-Version | Erscheinungsdatum |
|---|---|---|---|
pretrained-splitter-v1.5-2025-07-14 |
Allgemein verfügbares Modell, das auf dem Gemini 2.5 Flash-LLM basiert. Dieses vortrainierte Modell kann ohne vorheriges Training verwendet werden. Es unterstützt Zero-Shot-Splitting und ‑Klassifizierung. | Stabil | 14. Juli 2025 |
pretrained-splitter-v1.6-2026-03-09 |
Release-Kandidat, der auf dem Gemini 3.1 Flash-LLM basiert. | Releasekandidat | 9. März 2026 |
pretrained-splitter-v1.6-pro-2026-03-09 |
Release-Kandidat, der auf dem Gemini 3.1 Pro-LLM basiert. | Releasekandidat | 9. März 2026 |
Wenn Sie eine Anfrage zur Kontingenterhöhung für das Standardkontingent für Prozessoren stellen möchten, folgen Sie der Anleitung unter Kontingentanpassung beantragen.
Benutzerdefinierte Splitterversion auswählen
Wenn Sie einen benutzerdefinierten Splitter verwenden, können Sie ihn mit Ihren eigenen Daten trainieren oder eine vortrainierte Version mit generativer KI verwenden, z. B. pretrained-splitter-v1.5-2025-07-14.
Der Trainingsprozess kann mehrere Stunden dauern, ermöglicht es Ihnen aber, das Modell an die Besonderheiten Ihrer Daten anzupassen. Vortrainierte Versionen basieren auf Gemini-Modellen. Sie können in kürzerer Zeit in die Produktion überführt oder zur schnellen Iteration und zum Testen von Labeling-Schemata verwendet werden. Sie benötigen kein Trainings-Dataset.
Die folgende Anleitung gilt für beide Versionen. Es werden jeweils die unterschiedlichen Schritte für die einzelnen Versionen angegeben.
Benutzerdefinierten Splitter in der Google Cloud Console erstellen
In dieser Kurzanleitung wird beschrieben, wie Sie mit Document AI einen benutzerdefinierten Splitter erstellen und trainieren, der Beschaffungsdokumente teilt und klassifiziert. Die meiste Dokumentvorbereitung ist abgeschlossen, sodass Sie sich auf das Erstellen einer benutzerdefinierten Aufteilung konzentrieren können.
Ein typischer Workflow zum Erstellen und Verwenden eines benutzerdefinierten Splitters mit trainierter Basisversion sieht so aus:
- Erstellen Sie einen benutzerdefinierten Splitter in Document AI.
- Erstellen Sie ein Dataset mit einem leeren Cloud Storage-Bucket.
- Definieren und erstellen Sie ein Prozessorschema (Klassen).
- Importieren Sie Dokumente.
- Weisen Sie den Trainings- und Testsets Dokumente zu.
- Annotieren Sie Dokumente manuell in Document AI Workbench oder über Labeling-Aufgaben.
- Trainieren Sie den Prozessor.
- Bewerten Sie den Prozessor.
- Stellen Sie den Prozessor bereit.
- Testen Sie den Prozessor.
- Verwenden Sie den Prozessor für Ihre Dokumente.
Ein typischer Workflow zum Erstellen und Verwenden einer vortrainierten Version eines benutzerdefinierten Splitters sieht so aus:
- Erstellen Sie einen benutzerdefinierten Splitter in Document AI.
- Erstellen Sie ein Dataset mit einem leeren Cloud Storage-Bucket.
- Vortrainierte Modellversion auswählen
- Definieren und erstellen Sie ein Prozessorschema (Klassen).
- Optional: Importieren Sie Dokumente.
- Optional: Weisen Sie den Test-Datasets Dokumente zu, wenn Sie die Leistung des Modells bewerten möchten.
- Optional: Bewerten Sie den Prozessor.
- Testen Sie den Prozessor.
- Stellen Sie den Prozessor bereit.
- Verwenden Sie den Prozessor für Ihre Dokumente.
Eine detaillierte Anleitung dazu finden Sie direkt in der Google Cloud Console. Klicken Sie dazu einfach auf Anleitung:
Hinweis
- Melden Sie sich in Ihrem Google Cloud -Konto an. Wenn Sie mit Google Cloudnoch nicht vertraut sind, erstellen Sie ein Konto, um die Leistungsfähigkeit unserer Produkte in der Praxis sehen und bewerten zu können. Neukunden erhalten außerdem ein Guthaben von 300 $, um Arbeitslasten auszuführen, zu testen und bereitzustellen.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI, Cloud Storage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI, Cloud Storage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
Erforderliche Rollen
Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen für das Projekt zuzuweisen, damit Sie die nötigen Berechtigungen zum Erstellen eines benutzerdefinierten Splitters haben:
- Document AI-Administrator (
roles/documentai.admin) - Storage-Administrator (
roles/storage.admin)
Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.
Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.
Prozessor erstellen
Rufen Sie in der Google Cloud Console- im Bereich „Document AI“ die Seite Workbench auf.
Wählen Sie unter Benutzerdefinierter Dokument-Splitter die Option
Prozessor erstellen aus.
Geben Sie im Menü Prozessor erstellen einen Namen für den Prozessor ein, z. B.
my-custom-document-splitter.
Wählen Sie die Region aus, die Ihnen am nächsten ist.
Wählen Sie Erstellen aus. Der Tab Details zum Prozessor wird angezeigt.
Dataset konfigurieren
Zum Trainieren dieses neuen Prozessors müssen Sie ein Dataset mit Trainings- und Testdaten erstellen, damit der Prozessor die zu klassifizierenden und aufzuteilenden Dokumente leichter identifizieren kann.
Für dieses Dataset ist ein neuer Speicherort erforderlich. Dies kann ein leerer Cloud Storage-Bucket oder -Ordner sein oder Sie können einen von Google verwalteten (internen) Speicherort zulassen.
- Wenn Sie von Google verwalteten Speicherplatz verwenden möchten, wählen Sie diese Option aus.
- Wenn Sie Ihren eigenen Speicher verwenden möchten, um kundenverwaltete Verschlüsselungsschlüssel (CMEKs) zu verwenden, wählen Sie Ich gebe einen eigenen Speicherort an aus und folgen Sie der Anleitung weiter unten.

Cloud Storage-Bucket für das Dataset erstellen
Wechseln Sie zum Tab
Trainieren des Prozessors.Wählen Sie Dataset-Speicherort festlegen aus. Sie werden aufgefordert, einen leeren Cloud Storage-Bucket oder -Ordner auszuwählen oder zu erstellen.

Wählen Sie Durchsuchen aus, um Ordner auswählen zu öffnen.
Klicken Sie auf das Symbol Neuen Bucket erstellen und folgen Sie den Anweisungen, um einen neuen Bucket zu erstellen. Nachdem Sie den Bucket erstellt haben, wird die Seite Ordner auswählen für diesen Bucket angezeigt. Weitere Informationen zum Erstellen eines Cloud Storage-Buckets finden Sie in Cloud Storage-Buckets.
Klicken Sie auf der Seite Ordner auswählen für Ihren Bucket auf den Button Auswählen unten im Dialogfeld.

Geben Sie im Feld Zielpfad den von Ihnen ausgewählten Bucket-Namen ein. Wählen Sie Dataset erstellen aus. Das Erstellen des Datasets kann mehrere Minuten dauern.
(Optional) Vortrainierte Modellversion auswählen
Wenn Sie sich für ein vortrainiertes Modell entschieden haben, müssen Sie es zuerst im Abschnitt Bereitstellen und verwenden auswählen. Sie können die Abschnitte nach dem nächsten Abschnitt („Prozessorschema definieren“) ignorieren.
Gehen Sie zu Bereitstellen und verwenden.

Klicken Sie auf das Drop-down-Menü Versionen verwalten.
Wählen Sie die gewählte Prozessorversion aus.