Anda dapat menggunakan Enterprise Document OCR sebagai bagian dari Document AI untuk mendeteksi dan mengekstrak teks serta informasi tata letak dari berbagai dokumen. Dengan fitur yang dapat dikonfigurasi, Anda dapat menyesuaikan sistem untuk memenuhi persyaratan pemrosesan dokumen tertentu.
Ringkasan
Anda dapat menggunakan Enterprise Document OCR untuk tugas seperti entri data berdasarkan algoritma atau machine learning serta meningkatkan dan memverifikasi akurasi data. Anda juga dapat menggunakan Enterprise Document OCR untuk menangani tugas seperti berikut:
- Mendigitalkan teks: Mengekstrak data teks dan tata letak dari dokumen untuk penelusuran, pipeline pemrosesan dokumen berbasis aturan, atau pembuatan model kustom.
- Menggunakan aplikasi model bahasa besar: Gunakan pemahaman kontekstual LLM dan kemampuan ekstraksi teks dan tata letak OCR untuk mengotomatiskan pertanyaan dan jawaban. Dapatkan insight dari data, dan sederhanakan alur kerja.
- Pengarsipan: Mendigitalkan dokumen kertas menjadi teks yang dapat dibaca mesin untuk meningkatkan aksesibilitas dokumen.
Memilih OCR terbaik untuk kasus penggunaan Anda
| Solusi | Produk | Deskripsi | Kasus penggunaan |
|---|---|---|---|
| Document AI | Enterprise Document OCR | Model khusus untuk kasus penggunaan dokumen. Fitur lanjutan mencakup skor kualitas gambar, petunjuk bahasa, dan koreksi rotasi. | Direkomendasikan saat mengekstrak teks dari dokumen. Kasus penggunaan mencakup PDF, dokumen yang dipindai sebagai gambar, atau file Microsoft DocX. |
| Document AI | Add-on OCR | Fitur premium untuk persyaratan tertentu. Hanya kompatibel dengan Enterprise Document OCR versi 2.0 dan yang lebih baru. | Perlu mendeteksi dan mengenali formula matematika, menerima informasi gaya font, atau mengaktifkan ekstraksi kotak centang. |
| Cloud Vision API | Deteksi teks | REST API yang tersedia secara global berdasarkan model OCR standar. Google Cloud Kuota default 1.800 permintaan per menit. | Kasus penggunaan ekstraksi teks umum yang memerlukan latensi rendah dan kapasitas tinggi. |
| Cloud Vision | OCR Google Distributed Cloud (Tidak digunakan lagi) | Aplikasi Google Cloud Marketplace yang dapat di-deploy sebagai container ke cluster GKE mana pun menggunakan GKE Enterprise. | Untuk memenuhi persyaratan residensi atau kepatuhan data. |
Deteksi dan ekstraksi
Enterprise Document OCR dapat mendeteksi blok, paragraf, baris, kata, dan simbol dari PDF dan gambar, serta meluruskan dokumen untuk akurasi yang lebih baik.
Atribut deteksi dan ekstraksi tata letak yang didukung:
| Teks cetak | Tulisan tangan | Paragraf | Blokir | Line | Word | Tingkat simbol | Nomor halaman |
|---|---|---|---|---|---|---|---|
| Default | Default | Default | Default | Default | Default | Dapat Dikonfigurasi | Default |
Fitur Enterprise Document OCR yang dapat dikonfigurasi meliputi:
Mengekstrak teks native atau yang disematkan dari PDF digital: Fitur ini mengekstrak teks dan simbol persis seperti yang muncul di dokumen sumber, bahkan untuk teks yang diputar, ukuran atau gaya font yang ekstrem, dan teks yang sebagian tersembunyi.
Koreksi rotasi: Gunakan Enterprise Document OCR untuk memproses awal gambar dokumen guna mengoreksi masalah rotasi yang dapat memengaruhi kualitas ekstraksi atau pemrosesan.
Skor kualitas gambar: Menerima metrik kualitas yang dapat membantu perutean dokumen. Skor kualitas gambar memberikan metrik kualitas tingkat halaman dalam delapan dimensi, termasuk keburaman, keberadaan font yang lebih kecil dari biasanya, dan silau.
Tentukan rentang halaman: Menentukan rentang halaman dalam dokumen input untuk OCR. Hal ini menghemat waktu pemrosesan dan pembelanjaan di halaman yang tidak diperlukan.
Deteksi bahasa: Mendeteksi bahasa yang digunakan dalam teks yang diekstrak.
Petunjuk bahasa dan tulisan tangan: Tingkatkan akurasi dengan memberikan petunjuk bahasa atau tulisan tangan kepada model OCR berdasarkan karakteristik yang diketahui dari set data Anda.
Untuk mempelajari cara mengaktifkan konfigurasi OCR, lihat Mengaktifkan konfigurasi OCR.
Add-on OCR
Enterprise Document OCR menawarkan kemampuan analisis opsional yang dapat diaktifkan pada permintaan pemrosesan individual sesuai kebutuhan.
Kemampuan add-on berikut tersedia untuk versi Stabil
pretrained-ocr-v2.0-2023-06-02 dan pretrained-ocr-v2.1-2024-08-07,
serta versi Release Candidate pretrained-ocr-v2.1.1-2025-01-31.
- OCR Matematika: Mengidentifikasi dan mengekstrak formula dari dokumen dalam format LaTeX.
- Ekstraksi kotak centang: Mendeteksi kotak centang dan mengekstrak statusnya (dicentang/tidak dicentang) dalam respons Enterprise Document OCR.
- Deteksi gaya font: Mengidentifikasi properti font tingkat kata, termasuk jenis font, gaya font, tulisan tangan, ketebalan, dan warna.
Untuk mempelajari cara mengaktifkan add-on yang tercantum, lihat Mengaktifkan add-on OCR.
Format file yang didukung
OCR Dokumen Perusahaan mendukung format file PDF, GIF, TIFF, JPEG, PNG, BMP, dan WebP. Untuk mengetahui informasi selengkapnya, lihat File yang didukung.
Enterprise Document OCR juga mendukung file DocX hingga 15 halaman dalam sinkron dan 30 halaman dalam asinkron. Untuk membuat permintaan penambahan kuota (QIR), ikuti langkah-langkah untuk meminta penyesuaian kuota. Dukungan DocX dalam pratinjau pribadi. Untuk meminta akses, hubungi tim akun Google Anda.
Pembuatan versi lanjutan
Pembuatan versi lanjutan masih dalam Pratinjau. Upgrade pada model OCR AI/ML pokok dapat menyebabkan perubahan pada perilaku OCR. Jika konsistensi ketat diperlukan, gunakan versi model yang dibekukan untuk menyematkan perilaku ke model OCR lama hingga 18 bulan. Hal ini memastikan hasil fungsi OCR gambar yang sama. Lihat tabel tentang versi pemroses.
Versi pemroses
Versi prosesor berikut kompatibel dengan fitur ini. Untuk mengetahui informasi selengkapnya, lihat Mengelola versi pemroses.
| ID versi | Saluran rilis | Deskripsi |
|---|---|---|
pretrained-ocr-v1.2-2022-11-10 |
Stabil | Versi model v1.0 yang di-freeze: File model, konfigurasi, dan biner snapshot versi yang di-freeze dalam image container hingga 18 bulan. |
pretrained-ocr-v2.0-2023-06-02 |
Stabil | Model siap produksi yang dikhususkan untuk kasus penggunaan dokumen. Mencakup akses ke semua add-on OCR. |
pretrained-ocr-v2.1-2024-08-07 |
Stabil | Area utama peningkatan untuk v2.1 adalah: pengenalan teks cetak yang lebih baik, deteksi kotak centang yang lebih akurat, dan urutan pembacaan yang lebih akurat. |
pretrained-ocr-v2.1.1-2025-01-31 |
Kandidat rilis | v2.1.1 mirip dengan V2.1, dan tersedia di semua wilayah kecuali: US, EU, dan asia-southeast1. |
Menggunakan Enterprise Document OCR untuk memproses dokumen
Panduan memulai ini memperkenalkan Enterprise Document OCR. Bagian ini menunjukkan cara mengoptimalkan hasil OCR dokumen untuk alur kerja Anda dengan mengaktifkan atau menonaktifkan salah satu konfigurasi OCR yang tersedia.
- Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Document AI API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
Membuat pemroses Enterprise Document OCR
Pertama, buat pemroses Enterprise Document OCR. Untuk mengetahui informasi selengkapnya, lihat membuat dan mengelola pemroses.
Konfigurasi OCR
Semua konfigurasi OCR dapat diaktifkan dengan menyetel kolom masing-masing di ProcessOptions.ocrConfig dalam ProcessDocumentRequest atau BatchProcessDocumentsRequest.
Untuk mengetahui informasi selengkapnya, lihat Mengirim permintaan pemrosesan.
Analisis kualitas gambar
Analisis kualitas dokumen cerdas menggunakan machine learning untuk melakukan penilaian kualitas dokumen berdasarkan keterbacaan kontennya.
Penilaian kualitas ini ditampilkan sebagai skor kualitas [0, 1], dengan 1 berarti kualitas sempurna.
Jika skor kualitas yang terdeteksi lebih rendah dari 0.5, daftar alasan kualitas negatif (diurutkan berdasarkan kemungkinan) juga akan ditampilkan.
Kemungkinan lebih besar dari 0.5 dianggap sebagai deteksi positif.
Jika dokumen dianggap rusak, API akan menampilkan delapan jenis kerusakan dokumen berikut:
quality/defect_blurryquality/defect_noisyquality/defect_darkquality/defect_faintquality/defect_text_too_smallquality/defect_document_cutoffquality/defect_text_cutoffquality/defect_glare
Ada beberapa batasan pada analisis kualitas dokumen saat ini:
- Deteksi positif palsu dapat terjadi pada dokumen digital yang tidak memiliki kerusakan. Fitur ini paling baik digunakan pada dokumen yang dipindai atau difoto.
Cacat silau bersifat lokal. Keberadaannya mungkin tidak menghalangi keterbacaan dokumen secara keseluruhan.
Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.enableImageQualityScores ke true dalam permintaan pemrosesan.
Fitur tambahan ini menambahkan latensi yang sebanding dengan pemrosesan OCR ke panggilan proses.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableImageQualityScores": true
}
}
}
Output
Hasil deteksi kerusakan akan muncul di Document.pages[].imageQualityScores[].
{
"pages": [
{
"imageQualityScores": {
"qualityScore": 0.7811847,
"detectedDefects": [
{
"type": "quality/defect_document_cutoff",
"confidence": 1.0
},
{
"type": "quality/defect_glare",
"confidence": 0.97849524
},
{
"type": "quality/defect_text_cutoff",
"confidence": 0.5
}
]
}
}
]
}
Lihat Contoh output pemroses untuk contoh output lengkap.
Petunjuk bahasa
Prosesor OCR mendukung petunjuk bahasa yang Anda tentukan untuk meningkatkan performa mesin OCR. Dengan menerapkan petunjuk bahasa, OCR dapat mengoptimalkan bahasa yang dipilih, bukan bahasa yang disimpulkan.
Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.hints[].languageHints[] dengan daftar kode bahasa BCP-47.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"hints": {
"languageHints": ["en", "es"]
}
}
}
}
Lihat Contoh output pemroses untuk contoh output lengkap.
Deteksi simbol
Mengisi data di tingkat simbol (atau huruf individual) dalam respons dokumen.
Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.enableSymbol ke true dalam permintaan pemrosesan.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableSymbol": true
}
}
}
Output
Jika fitur ini diaktifkan, kolom Document.pages[].symbols[] akan diisi.
Lihat Contoh output pemroses untuk contoh output lengkap.
Penguraian PDF bawaan
Mengekstrak teks tersemat dari file PDF digital. Jika diaktifkan, model PDF digital bawaan akan otomatis digunakan jika ada teks digital. Jika ada teks non-digital, model OCR optik akan digunakan secara otomatis. Pengguna menerima kedua hasil teks yang digabungkan.
Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.enableNativePdfParsing ke true dalam permintaan pemrosesan.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"enableNativePdfParsing": true
}
}
}
Deteksi karakter dalam kotak
Secara default, Enterprise Document OCR mengaktifkan detektor untuk meningkatkan kualitas ekstraksi teks karakter yang berada dalam kotak. Berikut ini contohnya:

Jika Anda mengalami masalah kualitas OCR dengan karakter di dalam kotak, Anda dapat menonaktifkannya.
Input
Nonaktifkan dengan menyetel ProcessOptions.ocrConfig.disableCharacterBoxesDetection ke true dalam permintaan pemrosesan.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"disableCharacterBoxesDetection": true
}
}
}
Tata letak lama
Jika memerlukan algoritma deteksi tata letak heuristik, Anda dapat mengaktifkan tata letak lama, yang berfungsi sebagai alternatif untuk algoritma deteksi tata letak berbasis ML saat ini. Ini bukan konfigurasi yang direkomendasikan. Pelanggan dapat memilih algoritma tata letak yang paling sesuai berdasarkan alur kerja dokumen mereka.
Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.advancedOcrOptions ke ["legacy_layout"] dalam permintaan pemrosesan.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"advancedOcrOptions": ["legacy_layout"]
}
}
}
Menentukan rentang halaman
Secara default, OCR mengekstrak informasi teks dan tata letak dari semua halaman dalam dokumen. Anda dapat memilih nomor halaman atau rentang halaman tertentu dan hanya mengekstrak teks dari halaman tersebut.
Ada tiga cara untuk mengonfigurasi ini di ProcessOptions:
- Untuk hanya memproses halaman kedua dan kelima:
{
"individualPageSelector": {"pages": [2, 5]}
}
- Untuk hanya memproses tiga halaman pertama:
{
"fromStart": 3
}
- Untuk memproses hanya empat halaman terakhir:
{
"fromEnd": 4
}
Dalam respons, setiap Document.pages[].pageNumber sesuai dengan halaman yang sama yang ditentukan dalam permintaan.
Penggunaan add-on OCR
Kemampuan analisis opsional Enterprise Document OCR ini dapat diaktifkan pada setiap permintaan pemrosesan sesuai kebutuhan.
OCR Matematika
OCR Matematika mendeteksi, mengenali, dan mengekstrak formula, seperti persamaan matematika yang ditampilkan sebagai LaTeX beserta koordinat kotak pembatas.
Berikut adalah contoh representasi LaTeX:
Gambar terdeteksi

Konversi ke LaTeX

Input
Aktifkan dengan menyetel ProcessOptions.ocrConfig.premiumFeatures.enableMathOcr ke true dalam permintaan pemrosesan.
{
"rawDocument": {
"mimeType": "MIME_TYPE",
"content": "IMAGE_CONTENT"
},
"processOptions": {
"ocrConfig": {
"premiumFeatures": {
"enableMathOcr": true
}
}
}
}
Output
Output OCR Matematika muncul di Document.pages[].visualElements[] dengan "type": "math_formula".

"visualElements": [
{
"layout": {
"textAnchor": {
"textSegments": [
{
"endIndex": "46"
}
]
},
"confidence": 1,
"boundingPoly": {