Lista de procesadores

En esta página se incluye información detallada sobre todos los procesadores que ofrece Document AI. Puedes ver una lista de todos los procesadores por tipo de solución.

Todos los procesadores de Document AI cumplen los Términos de Seguridad y Tratamiento de Datos.

Consulta más información en la documentación sobre gestión de versiones de procesador. Además, se aplican límites específicos a los procesadores, que se suman a las cuotas y los límites generales del producto.

Digitalizar texto

Reconocimiento óptico de caracteres (OCR) en documentos de empresa

Descripción

Identifica y extrae texto de diferentes tipos de documentos.

Este procesador identifica y extrae texto, incluido texto escrito a mano, de documentos en más de 200 idiomas. El procesador también usa el aprendizaje automático para evaluar la calidad de un documento en función de la legibilidad de su contenido.

Categoría Digitalizar
Funciones OCR y análisis de calidad
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API OCR_PROCESSOR
Idiomas admitidos
Lista completa de idiomas
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Afrikáans af Latn
Albanés sq Latn
Árabe ar Arab
Armenio hy Armn
Bielorruso be Cyrl
Bengalí bn Beng
Bengalí bn Beng
Búlgaro bg Cyrl
Catalán ca Latn
Chino zh Hani
Croata hr Latn
Checo cs Latn
Danés da Latn
neerlandés nl Latn
Inglés en Latn
Estonio et Latn
Filipino fil Latn
Finés fi Latn
Francés fr Latn
Alemán de Latn
Griego el Grek
Guyaratí gu Gujr
Hebreo iw Hebr
Hindi hi Deva
Húngaro hu Latn
Islandés is Latn
Indonesio id Latn
Italiano it Latn
Japonés ja Jpan
Canarés kn Knda
Jemer km Khmr
Coreano ko Kore
Lao lo Laoo
Letón lv Latn
Lituano lt Latn
Macedonio mk Cyrl
Malayo ms Latn
Malabar ml Mlym
Marathi mr Deva
Nepalí ne Deva
Noruego no Latn
Persa fa Arab
Polaco pl Latn
Portugués (Brasil y Portugal) pt Latn
Panyabí pa Guru
Rumano ro Latn
Ruso ru Cyrl
Serbio sr Cyrl
Eslovaco sk Latn
Esloveno sl Latn
Español es Latn
Sueco sv Latn
Tagalo tl Latn
Tamil ta Taml
Telugú te Telu
Tailandés th Thai
Turco tr Latn
Ucraniano uk Cyrl
Vietnamita vi Latn
Yiddish yi Hebr
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Descripción
pretrained-ocr-v1.2-2022-11-10 Estable GA Versión del modelo inmovilizada de la versión 1.0: archivos de modelo, configuraciones y archivos binarios de una instantánea de la versión inmovilizada en una imagen de contenedor durante un máximo de 18 meses.
pretrained-ocr-v2.0-2023-06-02 Estable GA Modelo listo para producción especializado en casos prácticos de documentos. Incluye acceso a todos los complementos de OCR.
pretrained-ocr-v2.1-2024-08-07 Estable GA Las principales áreas de mejora de la versión 2.1 son las siguientes: mejor reconocimiento de texto impreso, detección más precisa de casillas de verificación y orden de lectura más preciso.
pretrained-ocr-v2.1.1-2025-01-31 Versión candidata Vista previa pública La versión 2.1.1 es similar a la 2.1 y está disponible en todas las regiones, excepto en US, EU y asia-southeast1.

Para obtener más información, consulta Gestionar versiones de procesador.

Cuotas y límites
Número máximo de páginas (solicitudes online o síncronas): 15
Número máximo de páginas (solicitudes por lotes, sin conexión o asíncronas): 500
Número máximo de páginas (modo sin imágenes online o solicitudes síncronas): 30
Uptraining
Archivo de entrada de ejemplo Abrir en una ventana nueva.
Ejemplo de salida Abrir en una ventana nueva.
Regiones admitidas
  • asia-south1
  • asia-southeast1
  • australia-southeast1
  • eu
  • europe-west2
  • europe-west3
  • northamerica-northeast1
  • us
Más información Enterprise Document OCR

Extraer entidades de documentos

Consulta Conjuntos de datos de ejemplo para ver conjuntos de datos etiquetados y sin etiquetar que puedes usar para el entrenamiento.

Extractor personalizado

Descripción

Extrae campos de documentos con IA generativa o modelos personalizados, y ajusta los modelos para extraer datos de tus documentos con precisión.

Categoría Extraer
Funciones OCR y extracción de entidades
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API CUSTOM_EXTRACTION_PROCESSOR
Notas
  • Si usas la IA generativa para la extracción, haz lo siguiente:

    • Solo se admite oficialmente el inglés.
    • La disponibilidad regional es en US, EU, northamerica-northeast1 y asia-southeast1.

Idiomas admitidos
Lista completa de idiomas
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Afrikáans af Latn
Árabe ar Arab
Azerí az Latn
Azerí (cirílico) az-Cyrl Cyrl
Bielorruso be Cyrl
Búlgaro bg Cyrl
Bosnio bs Latn
Catalán ca Latn
Cebuano ceb Latn
Checo cs Latn
Galés cy Latn
Danés da Latn
Alemán de Latn
Griego el Grek
Inglés en Latn
Esperanto eo Latn
Español es Latn
Estonio et Latn
Euskera eu Latn
Persa fa Arab
Finés fi Latn
Filipino fil Latn
Francés fr Latn
Irlandés ga Latn
Gallego gl Latn
Hindi hi Deva
Croata hr Latn
Criollo haitiano ht Latn
Húngaro hu Latn
Indonesio id Latn
Islandés is Latn
Italiano it Latn
Hebreo iw Hebr
Japonés ja Jpan
Javanés jv Latn
Kazajo kk Cyrl
Coreano ko Kore
Kirguís ky Cyrl
Latín la Latn
Lituano lt Latn
Letón lv Latn
Macedonio mk Cyrl
Mongol mn Cyrl
Marathi mr Deva
Malayo ms Latn
Maltés mt Latn
Nepalí ne Deva
neerlandés nl Latn
Noruego no Latn
Polaco pl Latn
Pastún ps Arab
Portugués (Brasil y Portugal) pt Latn
Rumano ro Latn
Ruso ru Cyrl
Ruso (ortografía petrina) ru-PETR1708 Cyrl
Sánscrito sa Deva
Eslovaco sk Latn
Esloveno sl Latn
Albanés sq Latn
Serbio sr Cyrl
Sueco sv Latn
Swahili sw Latn
Tagalo tl Latn
Turco tr Latn
Ucraniano uk Cyrl
Urdu ur Arab
Uzbeko uz Latn
Uzbeko (cirílico) uz-Cyrl Cyrl
Vietnamita vi Latn
Yiddish yi Hebr
Chino simplificado zh-Hans Hani
Chino tradicional zh-Hant Hani
Zulú zu Latn
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Descripción
pretrained-foundation-model-v1.4-2025-02-05 Estable GA Modelo GA basado en el LLM Gemini 2.0 Flash. También incluye funciones avanzadas de OCR, como la detección de casillas de verificación.
pretrained-foundation-model-v1.5-2025-05-05 Estable GA Candidato listo para producción que usa el MLE Gemini 2.5 Flash. Recomendado para quienes quieran experimentar con modelos más recientes.
pretrained-foundation-model-v1.5-pro-2025-06-20 Estable GA Modelo listo para producción basado en el LLM Gemini 2.5 Pro. Admite una cuota de hasta 30 páginas por minuto para las solicitudes de proceso online. Este modelo tiene una calidad mejorada en comparación con la versión 1.5 y puede tener una latencia mayor.
pretrained-foundation-model-v1.5.1-2025-08-07 Versión candidata Vista previa pública Modelo de vista previa pública basado en el LLM Gemini 2.5 Flash. Este modelo tiene las mismas funciones que la versión 1.5 y ha mejorado el aprendizaje adaptativo con pocos ejemplos.

Para obtener más información, consulta Gestionar versiones de procesador.

Cuotas y límites
Número máximo de páginas (solicitudes online o síncronas): 15
Número máximo de páginas (solicitudes por lotes, sin conexión o asíncronas): 200
Número máximo de páginas (modo sin imágenes, solicitudes online o síncronas): 30
Tipos de datos normalizados

Puedes consultar más información en las páginas Enriquecimiento y normalización y Crear conjunto de datos.

Lista completa de tipos de datos normalizados
  • dateTime as STRING
  • currency as STRING
  • money as google.type.Money
  • number as FLOAT or INTEGER
Uptraining
Archivo de entrada de ejemplo Abrir en una ventana nueva.
Ejemplo de salida Abrir en una ventana nueva.
Regiones admitidas
  • asia-south1
  • asia-southeast1
  • australia-southeast1
  • eu
  • europe-west2
  • europe-west3
  • northamerica-northeast1
  • us
Más información Extractor personalizado

Análisis de formularios

Descripción

Extrae pares clave-valor generales (entidades y casillas de verificación), tablas y entidades genéricas de documentos, además de texto de OCR.

Este procesador aplica tecnologías avanzadas de aprendizaje automático para extraer pares clave-valor, casillas de verificación y tablas de documentos en más de 200 idiomas. Este procesador también utiliza modelos de aprendizaje profundo para extraer 11 entidades genéricas que son habituales en varios tipos de documentos.

Categoría Extraer
Funciones Reconocimiento óptico de caracteres, análisis de formularios y extracción de entidades
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API FORM_PARSER_PROCESSOR
Idiomas admitidos
Lista completa de idiomas
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Afrikáans af Latn
Albanés sq Latn
Árabe ar Arab
Bielorruso be Cyrl
Catalán ca Latn
Chino zh Hani
Croata hr Latn
Checo cs Latn
Danés da Latn
neerlandés nl Latn
Inglés en Latn
Estonio et Latn
Filipino fil Latn
Finés fi Latn
Francés fr Latn
Alemán de Latn
Hebreo iw Hebr
Hindi hi Deva
Húngaro hu Latn
Islandés is Latn
Indonesio id Latn
Italiano it Latn
Japonés ja Jpan
Coreano ko Kore
Letón lv Latn
Lituano lt Latn
Macedonio mk Cyrl
Malayo ms Latn
Marathi mr Deva
Nepalí ne Deva
Noruego no Latn
Persa fa Arab
Polaco pl Latn
Portugués (Brasil y Portugal) pt Latn
Rumano ro Latn
Ruso ru Cyrl
Serbio sr Cyrl
Eslovaco sk Latn
Esloveno sl Latn
Español es Latn
Sueco sv Latn
Tagalo tl Latn
Turco tr Latn
Ucraniano uk Cyrl
Vietnamita vi Latn
Yiddish yi Hebr
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Campos adicionales detectados Descripción
pretrained-form-parser-v1.0-2020-09-23 Estable GA

Ninguno

Versión antigua. Para obtener la mejor calidad y el conjunto de funciones completo, usa la versión 2.0 del analizador de formularios.
pretrained-form-parser-v2.0-2022-11-10 Estable GA
Mostrar campos
  • email
  • phone
  • url
  • date_time
  • address
  • person
  • organization
  • quantity
  • price
  • id
  • page_number
Versión recomendada. Admite entidades genéricas e incluye modelos de tabla, KVP y casilla mejorados, así como más de 200 idiomas.
pretrained-form-parser-v2.1-2023-06-26 Versión candidata Vista previa pública

Ninguno

versión de Vista Previa Pública. Es el mismo modelo que la versión 2.0, pero con la extracción de texto nativa de archivos PDF digitales habilitada.

Para obtener más información, consulta Gestionar versiones de procesador.

Cuotas y límites
Número máximo de páginas (solicitudes online o síncronas): 15
Número máximo de páginas (solicitudes por lotes, sin conexión o asíncronas): 100
Número máximo de páginas (modo sin imágenes online o solicitudes síncronas): 30
Uptraining
Archivo de entrada de ejemplo Abrir en una ventana nueva.
Ejemplo de salida Abrir en una ventana nueva.
Regiones admitidas
  • asia-south1
  • asia-southeast1
  • australia-southeast1
  • eu
  • europe-west2
  • europe-west3
  • northamerica-northeast1
  • us
Más información Analizador de formularios

Analizador de diseños

Descripción

Extrae elementos de contenido de documentos (texto, tablas y listas) y crea fragmentos contextualizados.

Layout Parser extrae elementos de contenido de documentos, como texto, tablas y listas, y crea fragmentos contextualizados que facilitan la recuperación de información en aplicaciones de IA generativa y de descubrimiento.

Categoría Extraer
Funciones Análisis de diseños y división de documentos en fragmentos
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API LAYOUT_PARSER_PROCESSOR
Notas
  • Este analizador admite archivos PDF, HTML, DOCX, PPTX, XLSX y XLSM.
Idiomas admitidos
Lista completa de idiomas
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Afrikáans af Latn
Albanés sq Latn
Árabe ar Arab
Armenio hy Armn
Bielorruso be Cyrl
Bengalí bn Beng
Bengalí bn Beng
Búlgaro bg Cyrl
Catalán ca Latn
Chino zh Hani
Croata hr Latn
Checo cs Latn
Danés da Latn
neerlandés nl Latn
Inglés en Latn
Estonio et Latn
Filipino fil Latn
Finés fi Latn
Francés fr Latn
Alemán de Latn
Griego el Grek
Guyaratí gu Gujr
Hebreo iw Hebr
Hindi hi Deva
Húngaro hu Latn
Islandés is Latn
Indonesio id Latn
Italiano it Latn
Japonés ja Jpan
Canarés kn Knda
Jemer km Khmr
Coreano ko Kore
Lao lo Laoo
Letón lv Latn
Lituano lt Latn
Macedonio mk Cyrl
Malayo ms Latn
Malabar ml Mlym
Marathi mr Deva
Nepalí ne Deva
Noruego no Latn
Persa fa Arab
Polaco pl Latn
Portugués (Brasil y Portugal) pt Latn
Panyabí pa Guru
Rumano ro Latn
Ruso ru Cyrl
Serbio sr Cyrl
Eslovaco sk Latn
Esloveno sl Latn
Español es Latn
Sueco sv Latn
Tagalo tl Latn
Tamil ta Taml
Telugú te Telu
Tailandés th Thai
Turco tr Latn
Ucraniano uk Cyrl
Vietnamita vi Latn
Yiddish yi Hebr
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Descripción
pretrained-layout-parser-v1.0-2024-06-03 Estable GA Versión de disponibilidad general para el análisis de diseño de documentos. Esta es la versión predeterminada del procesador preentrenado.
pretrained-layout-parser-v1.5-2025-08-25 Versión candidata Vista previa pública Versión de vista previa basada en el MLE Gemini 2.5 Flash para mejorar el análisis de diseño en archivos PDF. Recomendado para quienes quieran probar nuevas versiones. Si se usa en archivos que no son PDF, tendrá el mismo comportamiento que la versión estable pretrained-layout-parser-v1.0-2024-06-03.
pretrained-layout-parser-v1.5-pro-2025-08-25 Versión candidata Vista previa pública Versión de vista previa basada en el LLM Gemini 2.5 Pro para mejorar el análisis de diseño en archivos PDF. La latencia de la versión 1.5 Pro es mayor que la de la versión 1.5. Si se usa en archivos que no son PDF, tendrá el mismo comportamiento que la versión estable 1.0.

Para obtener más información, consulta Gestionar versiones de procesador.

Cuotas y límites
Número máximo de páginas (solicitudes online o síncronas): 15
Número máximo de páginas (solicitudes por lotes, sin conexión o asíncronas): 500
Número máximo de páginas (modo sin imágenes online o solicitudes síncronas): 30
Uptraining
Archivo de entrada de ejemplo Abrir en una ventana nueva.
Ejemplo de salida Abrir en una ventana nueva.
Regiones admitidas
  • eu
  • us
Más información Analizador de diseños

Consultar procesadores preentrenados

Analizador de extractos bancarios

Descripción

Extraer información de extractos bancarios, como el nombre, la cuenta, las transacciones, etc.

Categoría Preentrenado
Funciones OCR y extracción de entidades
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API BANK_STATEMENT_PROCESSOR
Notas
  • Si una página de un archivo de entrada de varias páginas es del tipo de documento correcto y de una de las versiones admitidas, el procesador realiza la extracción de entidades en el primer documento admitido. Si el procesador no encuentra ningún documento aplicable en el archivo de entrada, devuelve un mensaje de error.
Idiomas admitidos
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Inglés en Latn
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Descripción
pretrained-bankstatement-v1.0-2021-08-08 Estable GA
pretrained-bankstatement-v1.1-2021-08-13 Estable GA
pretrained-bankstatement-v2.0-2021-12-10 Estable GA
pretrained-bankstatement-v3.0-2022-05-16 Estable GA En esta versión se presupone que el archivo de entrada contiene un único extracto bancario. A diferencia de la versión predeterminada, esta versión no comprueba si el archivo de entrada contiene extractos bancarios y no devolverá ningún error si no se encuentra ninguno.
pretrained-bankstatement-v4.0-2023-07-31 Versión candidata Vista previa pública
pretrained-bankstatement-v5.0-2023-12-06 Versión candidata Vista previa pública

Para obtener más información, consulta Gestionar versiones de procesador.

Cuotas y límites
Número máximo de páginas (solicitudes online o síncronas): 15
Número máximo de páginas (solicitudes por lotes, sin conexión o asíncronas): 30
Número máximo de páginas (modo sin imágenes online o solicitudes síncronas): 30
Campos detectados en la versión más antigua

También puedes encontrar esta información en la página Campo detectado.

Lista completa de campos
  • account_number
  • account_type
  • bank_address
  • bank_name
  • client_address
  • client_name
  • ending_balance
  • starting_balance
  • statement_date
  • statement_end_date
  • statement_start_date
  • table_item
    • table_item/transaction_deposit
    • table_item/transaction_deposit_date
    • table_item/transaction_deposit_description
    • table_item/transaction_withdrawal
    • table_item/transaction_withdrawal_date
    • table_item/transaction_withdrawal_description
Campos enriquecidos

Puedes consultar más información en la página Enriquecimiento y normalización.

Lista completa de campos enriquecidos
  • bank_address
  • bank_name
Campos normalizados

Puedes consultar más información en la página Enriquecimiento y normalización.

Lista completa de campos normalizados
  • ending_balance
  • starting_balance
  • statement_date
  • statement_end_date
  • statement_start_date
  • table_item/transaction_deposit
  • table_item/transaction_deposit_date
  • table_item/transaction_withdrawal
  • table_item/transaction_withdrawal_date
Uptraining
Instrucciones de etiquetado Abrir en una ventana nueva.
Archivo de entrada de ejemplo Abrir en una ventana nueva.
Ejemplo de salida Abrir en una ventana nueva.
Regiones admitidas
  • eu
  • us

Analizador de formularios W‐2

Descripción

Extrae información del formulario W2, como el empleado, la empresa, los salarios, etc.

Categoría Preentrenado
Funciones OCR y extracción de entidades
Fase de lanzamiento Disponibilidad general
Estado de acceso Público
Escribir en la API FORM_W2_PROCESSOR
Notas
  • Si una página de un archivo de entrada de varias páginas es del tipo de documento correcto y de una de las versiones admitidas, el procesador realiza la extracción de entidades en el primer documento admitido. Si el procesador no encuentra ningún documento aplicable en el archivo de entrada, devuelve un mensaje de error.
Idiomas admitidos
Idioma Etiqueta BCP 47 Secuencia de comandos Escritura a mano admitida
Inglés en Latn
Formulario o versiones admitidas
  • 2020 (versiones estándar y personalizadas)
  • 2019 (versiones estándar y personalizadas)
  • 2018 (versiones estándar y personalizadas)
Versiones del procesador
ID de versión Canal de lanzamiento Madurez de la versión Campos adicionales detectados Descripción
pretrained-w2-v1.0-2020-10-01 Estable GA

Ninguno

pretrained-w2-v1.1-2022-01-27 Estable GA

Ninguno

pretrained-w2-v1.2-2022-01-28 Estable GA
Mostrar campos
  • AllocatedTips
  • ControlNumber
  • DependentCareBenefits
  • EIN
  • EmployeeAddress
  • EmployeeName
  • EmployerNameAndAddress
  • EmployerStateIdNumber_Line1
  • FederalIncomeTaxWithheld
  • FormYear
  • LocalIncomeTax_Line1
  • LocalityName_Line1
  • LocalWagesTipsEtc_Line1
  • MedicareTaxWithheld
  • MedicareWagesAndTips
  • NonqualifiedPlans
  • SocialSecurityTaxWithheld
  • SocialSecurityTips
  • SocialSecurityWages
  • SSN
  • State_Line1
  • StateIncomeTax_Line1
  • StateWagesTipsEtc_Line1
  • WagesTipsOtherCompensation

Mejoras de calidad y compatibilidad con nuevos campos; no incluye el separador.

pretrained-w2-v2.0-2022-03-30 Versión candidata Vista previa pública
Mostrar campos
  • AllocatedTips
  • ControlNumber
  • DependentCareBenefits
  • EIN
  • EmployeeAddress_AdditionalStreetAddressOrPostalBox
  • EmployeeAddress_City
  • EmployeeAddress_State
  • EmployeeAddress_StreetAddressOrPostalBox
  • EmployeeAddress_Zip
  • EmployeeName_FirstName
  • EmployeeName_LastName
  • EmployeeName_MiddleNameOrInitial
  • EmployerAddress_AdditionalStreetAddressOrPostalBox
  • EmployerAddress_City
  • EmployerAddress_State
  • EmployerAddress_StreetAddressOrPostalBox
  • EmployerAddress_Zip
  • EmployerName
  • EmployerStateIdNumber_Line1
  • FederalIncomeTaxWithheld