Lista de procesadores
Organízate con las colecciones
Guarda y clasifica el contenido según tus preferencias.
En esta página se incluye información detallada sobre todos los procesadores que ofrece Document AI. Puedes ver una lista de todos los procesadores por tipo de solución.
Reconocimiento óptico de caracteres (OCR) en documentos de empresa
Descripción
Identifica y extrae texto de diferentes tipos de documentos.
Este procesador identifica y extrae texto, incluido texto escrito a mano, de documentos en más de 200 idiomas. El procesador también usa el aprendizaje automático para evaluar la calidad de un documento en función de la legibilidad de su contenido.
Versión del modelo inmovilizada de la versión 1.0: archivos de modelo, configuraciones y archivos binarios de una instantánea de la versión inmovilizada en una imagen de contenedor durante un máximo de 18 meses.
pretrained-ocr-v2.0-2023-06-02
Estable
GA
Modelo listo para producción especializado en casos prácticos de documentos. Incluye acceso a todos los complementos de OCR.
pretrained-ocr-v2.1-2024-08-07
Estable
GA
Las principales áreas de mejora de la versión 2.1 son las siguientes: mejor reconocimiento de texto impreso, detección más precisa de casillas de verificación y orden de lectura más preciso.
pretrained-ocr-v2.1.1-2025-01-31
Versión candidata
Vista previa pública
La versión 2.1.1 es similar a la 2.1 y está disponible en todas las regiones, excepto en US, EU y asia-southeast1.
Si usas la IA generativa para la extracción, haz lo siguiente:
Solo se admite oficialmente el inglés.
La disponibilidad regional es en US, EU, northamerica-northeast1 y asia-southeast1.
Idiomas admitidos
Lista completa de idiomas
Idioma
Etiqueta BCP 47
Secuencia de comandos
Escritura a mano admitida
Afrikáans
af
Latn
Árabe
ar
Arab
Azerí
az
Latn
Azerí (cirílico)
az-Cyrl
Cyrl
Bielorruso
be
Cyrl
Búlgaro
bg
Cyrl
Bosnio
bs
Latn
Catalán
ca
Latn
Cebuano
ceb
Latn
Checo
cs
Latn
Galés
cy
Latn
Danés
da
Latn
Alemán
de
Latn
Griego
el
Grek
Inglés
en
Latn
Esperanto
eo
Latn
Español
es
Latn
Estonio
et
Latn
Euskera
eu
Latn
Persa
fa
Arab
Finés
fi
Latn
Filipino
fil
Latn
Francés
fr
Latn
Irlandés
ga
Latn
Gallego
gl
Latn
Hindi
hi
Deva
Croata
hr
Latn
Criollo haitiano
ht
Latn
Húngaro
hu
Latn
Indonesio
id
Latn
Islandés
is
Latn
Italiano
it
Latn
Hebreo
iw
Hebr
Japonés
ja
Jpan
Javanés
jv
Latn
Kazajo
kk
Cyrl
Coreano
ko
Kore
Kirguís
ky
Cyrl
Latín
la
Latn
Lituano
lt
Latn
Letón
lv
Latn
Macedonio
mk
Cyrl
Mongol
mn
Cyrl
Marathi
mr
Deva
Malayo
ms
Latn
Maltés
mt
Latn
Nepalí
ne
Deva
neerlandés
nl
Latn
Noruego
no
Latn
Polaco
pl
Latn
Pastún
ps
Arab
Portugués (Brasil y Portugal)
pt
Latn
Rumano
ro
Latn
Ruso
ru
Cyrl
Ruso (ortografía petrina)
ru-PETR1708
Cyrl
Sánscrito
sa
Deva
Eslovaco
sk
Latn
Esloveno
sl
Latn
Albanés
sq
Latn
Serbio
sr
Cyrl
Sueco
sv
Latn
Swahili
sw
Latn
Tagalo
tl
Latn
Turco
tr
Latn
Ucraniano
uk
Cyrl
Urdu
ur
Arab
Uzbeko
uz
Latn
Uzbeko (cirílico)
uz-Cyrl
Cyrl
Vietnamita
vi
Latn
Yiddish
yi
Hebr
Chino simplificado
zh-Hans
Hani
Chino tradicional
zh-Hant
Hani
Zulú
zu
Latn
Versiones del procesador
ID de versión
Canal de lanzamiento
Madurez de la versión
Descripción
pretrained-foundation-model-v1.4-2025-02-05
Estable
GA
Modelo GA basado en el LLM Gemini 2.0 Flash. También incluye funciones avanzadas de OCR, como la detección de casillas de verificación.
pretrained-foundation-model-v1.5-2025-05-05
Estable
GA
Candidato listo para producción que usa el MLE Gemini 2.5 Flash. Recomendado para quienes quieran experimentar con modelos más recientes.
pretrained-foundation-model-v1.5-pro-2025-06-20
Estable
GA
Modelo listo para producción basado en el LLM Gemini 2.5 Pro. Admite una cuota de hasta 30 páginas por minuto para las solicitudes de proceso online. Este modelo tiene una calidad mejorada en comparación con la versión 1.5 y puede tener una latencia mayor.
pretrained-foundation-model-v1.5.1-2025-08-07
Versión candidata
Vista previa pública
Modelo de vista previa pública basado en el LLM Gemini 2.5 Flash. Este modelo tiene las mismas funciones que la versión 1.5 y ha mejorado el aprendizaje adaptativo con pocos ejemplos.
Extrae pares clave-valor generales (entidades y casillas de verificación), tablas y entidades genéricas de documentos, además de texto de OCR.
Este procesador aplica tecnologías avanzadas de aprendizaje automático para extraer pares clave-valor, casillas de verificación y tablas de documentos en más de 200 idiomas. Este procesador también utiliza modelos de aprendizaje profundo para extraer 11 entidades genéricas que son habituales en varios tipos de documentos.
Categoría
Extraer
Funciones
Reconocimiento óptico de caracteres, análisis de formularios y extracción de entidades
Extrae elementos de contenido de documentos (texto, tablas y listas) y crea fragmentos contextualizados.
Layout Parser extrae elementos de contenido de documentos, como texto, tablas y listas, y crea fragmentos contextualizados que facilitan la recuperación de información en aplicaciones de IA generativa y de descubrimiento.
Categoría
Extraer
Funciones
Análisis de diseños y división de documentos en fragmentos
Este analizador admite archivos PDF, HTML, DOCX, PPTX, XLSX y XLSM.
Idiomas admitidos
Lista completa de idiomas
Idioma
Etiqueta BCP 47
Secuencia de comandos
Escritura a mano admitida
Afrikáans
af
Latn
Albanés
sq
Latn
Árabe
ar
Arab
Armenio
hy
Armn
Bielorruso
be
Cyrl
Bengalí
bn
Beng
Bengalí
bn
Beng
Búlgaro
bg
Cyrl
Catalán
ca
Latn
Chino
zh
Hani
Croata
hr
Latn
Checo
cs
Latn
Danés
da
Latn
neerlandés
nl
Latn
Inglés
en
Latn
Estonio
et
Latn
Filipino
fil
Latn
Finés
fi
Latn
Francés
fr
Latn
Alemán
de
Latn
Griego
el
Grek
Guyaratí
gu
Gujr
Hebreo
iw
Hebr
Hindi
hi
Deva
Húngaro
hu
Latn
Islandés
is
Latn
Indonesio
id
Latn
Italiano
it
Latn
Japonés
ja
Jpan
Canarés
kn
Knda
Jemer
km
Khmr
Coreano
ko
Kore
Lao
lo
Laoo
Letón
lv
Latn
Lituano
lt
Latn
Macedonio
mk
Cyrl
Malayo
ms
Latn
Malabar
ml
Mlym
Marathi
mr
Deva
Nepalí
ne
Deva
Noruego
no
Latn
Persa
fa
Arab
Polaco
pl
Latn
Portugués (Brasil y Portugal)
pt
Latn
Panyabí
pa
Guru
Rumano
ro
Latn
Ruso
ru
Cyrl
Serbio
sr
Cyrl
Eslovaco
sk
Latn
Esloveno
sl
Latn
Español
es
Latn
Sueco
sv
Latn
Tagalo
tl
Latn
Tamil
ta
Taml
Telugú
te
Telu
Tailandés
th
Thai
Turco
tr
Latn
Ucraniano
uk
Cyrl
Vietnamita
vi
Latn
Yiddish
yi
Hebr
Versiones del procesador
ID de versión
Canal de lanzamiento
Madurez de la versión
Descripción
pretrained-layout-parser-v1.0-2024-06-03
Estable
GA
Versión de disponibilidad general para el análisis de diseño de documentos. Esta es la versión predeterminada del procesador preentrenado.
pretrained-layout-parser-v1.5-2025-08-25
Versión candidata
Vista previa pública
Versión de vista previa basada en el MLE Gemini 2.5 Flash para mejorar el análisis de diseño en archivos PDF. Recomendado para quienes quieran probar nuevas versiones. Si se usa en archivos que no son PDF, tendrá el mismo comportamiento que la versión estable pretrained-layout-parser-v1.0-2024-06-03.
pretrained-layout-parser-v1.5-pro-2025-08-25
Versión candidata
Vista previa pública
Versión de vista previa basada en el LLM Gemini 2.5 Pro para mejorar el análisis de diseño en archivos PDF. La latencia de la versión 1.5 Pro es mayor que la de la versión 1.5. Si se usa en archivos que no son PDF, tendrá el mismo comportamiento que la versión estable 1.0.
Si una página de un archivo de entrada de varias páginas es del tipo de documento correcto y de una de las versiones admitidas, el procesador realiza la extracción de entidades en el primer documento admitido. Si el procesador no encuentra ningún documento aplicable en el archivo de entrada, devuelve un mensaje de error.
Idiomas admitidos
Idioma
Etiqueta BCP 47
Secuencia de comandos
Escritura a mano admitida
Inglés
en
Latn
Versiones del procesador
ID de versión
Canal de lanzamiento
Madurez de la versión
Descripción
pretrained-bankstatement-v1.0-2021-08-08
Estable
GA
pretrained-bankstatement-v1.1-2021-08-13
Estable
GA
pretrained-bankstatement-v2.0-2021-12-10
Estable
GA
pretrained-bankstatement-v3.0-2022-05-16
Estable
GA
En esta versión se presupone que el archivo de entrada contiene un único extracto bancario. A diferencia de la versión predeterminada, esta versión no comprueba si el archivo de entrada contiene extractos bancarios y no devolverá ningún error si no se encuentra ninguno.
Si una página de un archivo de entrada de varias páginas es del tipo de documento correcto y de una de las versiones admitidas, el procesador realiza la extracción de entidades en el primer documento admitido. Si el procesador no encuentra ningún documento aplicable en el archivo de entrada, devuelve un mensaje de error.
Idiomas admitidos
Idioma
Etiqueta BCP 47
Secuencia de comandos
Escritura a mano admitida
Inglés
en
Latn
Formulario o versiones admitidas
2020 (versiones estándar y personalizadas)
2019 (versiones estándar y personalizadas)
2018 (versiones estándar y personalizadas)
Versiones del procesador
ID de versión
Canal de lanzamiento
Madurez de la versión
Campos adicionales detectados
Descripción
pretrained-w2-v1.0-2020-10-01
Estable
GA
Ninguno
pretrained-w2-v1.1-2022-01-27
Estable
GA
Ninguno
pretrained-w2-v1.2-2022-01-28
Estable
GA
Mostrar campos
AllocatedTips
ControlNumber
DependentCareBenefits
EIN
EmployeeAddress
EmployeeName
EmployerNameAndAddress
EmployerStateIdNumber_Line1
FederalIncomeTaxWithheld
FormYear
LocalIncomeTax_Line1
LocalityName_Line1
LocalWagesTipsEtc_Line1
MedicareTaxWithheld
MedicareWagesAndTips
NonqualifiedPlans
SocialSecurityTaxWithheld
SocialSecurityTips
SocialSecurityWages
SSN
State_Line1
StateIncomeTax_Line1
StateWagesTipsEtc_Line1
WagesTipsOtherCompensation
Mejoras de calidad y compatibilidad con nuevos campos; no incluye el separador.