Entendimento de documentos

Os modelos do Gemini podem processar documentos em formato PDF usando a visão nativa para entender contextos de documentos inteiros. Isso vai além da extração de texto, permitindo que o Gemini:

  • Analise e interprete conteúdo, incluindo texto, imagens, diagramas, gráficos e tabelas, mesmo em documentos longos de até 1.000 páginas.
  • Extraia informações em formatos de saída estruturados.
  • Resuma e responda a perguntas com base nos elementos visuais e textuais de um documento.
  • Transcreva o conteúdo do documento (por exemplo, para HTML), preservando layouts e formatação, para uso em aplicativos downstream.

Também é possível transmitir documentos que não sejam em PDF da mesma maneira, mas o Gemini os verá como texto normal, o que eliminará o contexto, como gráficos ou formatação.

Como transmitir dados PDF inline

É possível transmitir dados PDF inline na solicitação. Isso é mais adequado para documentos menores ou processamento temporário em que não é necessário referenciar o arquivo em solicitações subsequentes. Recomendamos o uso da API Files para documentos maiores que precisam ser referenciados em interações multiturno para melhorar a latência da solicitação e reduzir o uso de largura de banda.

O exemplo a seguir mostra como transmitir dados PDF inline:

Python

from google import genai
import base64

client = genai.Client()

with open('path/to/document.pdf', 'rb') as f:
    pdf_bytes = f.read()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=[
        {
            "type": "document",
            "data": base64.b64encode(pdf_bytes)