Modelet Gemini janë ndërtuar për të qenë multimodale që nga themelet, duke zhbllokuar një gamë të gjerë detyrash të përpunimit të imazheve dhe vizionit kompjuterik, duke përfshirë, por pa u kufizuar në, mbishkrimin e imazheve, klasifikimin dhe përgjigjen e pyetjeve vizuale pa pasur nevojë të trajnohen modele të specializuara të ML.
Përveç aftësive të tyre të përgjithshme multimodale, modelet Gemini ofrojnë saktësi të përmirësuar për raste specifike përdorimi si zbulimi dhe segmentimi i objekteve, përmes trajnimit shtesë.
Kalimi i imazheve te Binjakët
Ju mund të jepni imazhe si të dhëna për Gemini duke përdorur disa metoda:
- Kalimi i imazhit duke përdorur URL-në : Ideale për imazhe të aksesueshme publikisht.
- Kalimi i të dhënave të imazhit brenda rreshtit : Për të dhënat e imazhit të koduara me base64.
- Ngarkimi i imazheve duke përdorur File API : Rekomandohet për skedarë më të mëdhenj ose për ripërdorimin e imazheve në kërkesa të shumëfishta.
Kalimi i imazhit duke përdorur URL-në
Mund të ngarkoni një imazh duke përdorur API-n e Files dhe ta kaloni atë në kërkesë:
Python
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/organ.jpg")
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const uploadedFile = await client.files.upload({
file: "path/to/organ.jpg",
config: { mimeType: "image/jpeg" }
});
const interaction = await client.interactions.create({
model: "gemini-3.7-flash",
input: [
{type: "text", text: "Caption this image."},
{
type: "image",
uri: uploadedFile.uri,
mime_type: uploadedFile.mimeType
}
]
});
console.log(interaction.output_text);