Treinar e avaliar o modelo

A Document AI permite treinar novas versões de processador usando seus próprios dados de treinamento e avaliar a qualidade da versão do processador em relação aos seus dados de teste.

Isso é útil quando você quer usar um processador personalizado. Há um processador da Document AI para seu tipo de documento, mas você pode treinar uma versão personalizada dele para atender às suas necessidades.

O treinamento e a avaliação são normalmente realizados em conjunto para iterar em direção a uma versão de processador utilizável e de alta qualidade.

Document AI

A Document AI permite criar seu próprio extrator personalizado, que extrai entidades de documentos de um tipo específico, por exemplo, os itens de um menu ou o nome e dados de contato de um currículo.

Ao contrário de outros processadores, os personalizados não vêm com versões pré-treinadas e, portanto, não podem processar documentos até que você treine uma versão do zero.

Para começar a usar a Document AI, consulte Criar seu próprio processador personalizado.

Aprimoramento do treinamento de um processador

É possível aprimorar o treinamento de novas versões de processador para melhorar a acurácia dos dados, extrair campos personalizados adicionais dos documentos e adicionar suporte a novos idiomas.

O aprimoramento do treinamento funciona aplicando o aprendizado por transferência em versões de processador pré-treinadas do Google e geralmente exige menos dados do que o treinamento do zero.

Para começar, consulte Aprimorar o treinamento de um processador pré-treinado.

Processadores compatíveis

Nem todos os processadores especializados oferecem suporte ao aprimoramento do treinamento. Estes são os processadores que oferecem suporte ao aprimoramento do treinamento.

Considerações e recomendações de dados

A qualidade e a quantidade dos dados determinam a qualidade do treinamento, do aprimoramento do treinamento e da avaliação.

A obtenção de um conjunto de documentos representativos e reais e o fornecimento de rótulos de alta qualidade suficientes costumam ser a parte mais demorada e com maior uso de recursos do processo.

Número de documentos

Se todos os documentos tiverem um formato semelhante (por exemplo, um formulário fixo com variação muito baixa), menos documentos serão necessários para alcançar a precisão. Quanto maior a variação, mais documentos serão necessários.

Os gráficos a seguir fornecem uma estimativa aproximada do número de documentos necessários para que um extrator de documentos personalizado alcance uma pontuação de qualidade específica.

Variação baixa Variação alta
processor-training-and-evaluation-overview-1 processor-training-and-evaluation-overview-2

Rotulagem de dados

Considere suas opções de rotulagem de documentos e verifique se você tem recursos suficientes para anotar os documentos no seu conjunto de dados.

Como treinar modelos

Os processadores de extratores personalizados podem usar diferentes tipos de modelo, dependendo do caso de uso específico e dos dados de treinamento disponíveis.

A tabela a seguir ilustra quais casos de uso correspondem a cada tipo de modelo.

Modelo personalizado IA generativa
Baseado em modelo Com base no modelo
Variação de layout Nenhuma Baixa a média Alta
Quantidade de texto de formato livre (por exemplo, parágrafos em um contrato) Baixa Baixo