Modele Gemini są budowane od podstaw z myślą o multimodalności, co umożliwia wykonywanie wielu zadań związanych z przetwarzaniem obrazów i widzeniem komputerowym, w tym m.in. tworzenie podpisów do obrazów, klasyfikację i wizualne odpowiedzi na pytania, bez konieczności trenowania wyspecjalizowanych modeli ML.
Oprócz ogólnych możliwości multimodalnych modele Gemini oferują większą dokładność w konkretnych przypadkach użycia, takich jak wykrywanie obiektów i segmentacja, dzięki dodatkowemu trenowaniu.
Przekazywanie obrazów do Gemini
Obrazy możesz przekazywać do Gemini na kilka sposobów:
- Przekazywanie obrazu za pomocą adresu URL: idealne rozwiązanie w przypadku obrazów dostępnych publicznie.
- Przekazywanie danych obrazu w tekście: w przypadku danych obrazu zakodowanych w formacie Base64.
- Przesyłanie obrazów za pomocą interfejsu File API: zalecane w przypadku większych plików lub ponownego używania obrazów w wielu żądaniach.
Przekazywanie obrazu za pomocą adresu URL
Obraz możesz przesłać za pomocą interfejsu Files API i przekazać go w żądaniu:
Python
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/organ.jpg")
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=[
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const uploadedFile = await client.files.upload({
file: "path/to/organ.jpg",
config: { mimeType: "image/jpeg" }
});
const interaction = await client.interactions.create({
model: "gemini-3.6-flash",
input: [
{type: "text", text: "Caption this image."},
{
type: "image",
uri: uploadedFile.uri,
mime_type: uploadedFile.mimeType
}
]
});
console.log(interaction.output_text);
REST
# First upload the file using the Files API, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.6-flash",
"input": [
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"uri": "YOUR_FILE_URI",
"mime_type": "image/jpeg"
}
]
}'
Przekazywanie danych obrazu w tekście
Dane obrazu możesz przekazywać jako ciągi tekstowe zakodowane w formacie Base64:
Python
import base64
from google import genai
with open('path/to/small-sample.jpg', 'rb') as f:
image_bytes = f.read()
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=[
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"data": base64.b64encode(image_bytes).decode('utf-8'),
"mime_type": "image/jpeg"
}
]
)
print(interaction