Les modèles Gemini sont conçus dès le départ pour être multimodaux, ce qui permet d'effectuer un large éventail de tâches de traitement d'images et de vision par ordinateur, y compris, mais sans s'y limiter, la légende d'images, la classification et la réponse visuelle à des questions, sans avoir à entraîner des modèles de ML spécialisés.
En plus de leurs capacités multimodales générales, les modèles Gemini offrent une précision accrue pour des cas d'utilisation spécifiques tels que la détection d'objets et la segmentation, grâce à un entraînement supplémentaire.
Transmettre des images à Gemini
Vous pouvez fournir des images en entrée à Gemini à l'aide de plusieurs méthodes :
- Transmettre une image à l'aide d'une URL : idéal pour les images accessibles au public.
- Transmettre des données d'image intégrées : pour les données d'image encodées en base64.
- Importer des images à l'aide de l'API Files : recommandé pour les fichiers plus volumineux ou pour réutiliser des images dans plusieurs requêtes.
Transmettre une image à l'aide d'une URL
Vous pouvez importer une image à l'aide de l'API Files et la transmettre dans la requête :
Python
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/organ.jpg")
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=[
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)