Os modelos do Gemini podem processar documentos em formato PDF usando a visão nativa para entender contextos de documentos inteiros. Isso vai além da extração de texto, permitindo que o Gemini:
- Analise e interprete conteúdo, incluindo texto, imagens, diagramas, gráficos e tabelas, mesmo em documentos longos de até 1.000 páginas.
- Extraia informações em formatos de saída estruturados.
- Resuma e responda a perguntas com base nos elementos visuais e textuais de um documento.
- Transcreva o conteúdo do documento (por exemplo, para HTML), preservando layouts e formatação, para uso em aplicativos downstream.
Também é possível transmitir documentos que não sejam em PDF da mesma maneira, mas o Gemini os verá como texto normal, o que eliminará o contexto, como gráficos ou formatação.
Como transmitir dados PDF inline
É possível transmitir dados PDF inline na solicitação. Isso é mais adequado para documentos menores ou processamento temporário em que não é necessário referenciar o arquivo em solicitações subsequentes. Recomendamos o uso da API Files para documentos maiores que precisam ser referenciados em interações multiturno para melhorar a latência da solicitação e reduzir o uso de largura de banda.
O exemplo a seguir mostra como transmitir dados PDF inline:
Python
from google import genai
import base64
client = genai.Client()
with open('path/to/document.pdf', 'rb') as f:
pdf_bytes = f.read()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=[
{
"type": "document",
"data": base64.b64encode(pdf_bytes)