Compréhension des images

Les modèles Gemini sont conçus dès le départ pour être multimodaux, ce qui permet d'effectuer un large éventail de tâches de traitement d'images et de vision par ordinateur, y compris, mais sans s'y limiter, la légende d'images, la classification et la réponse visuelle à des questions, sans avoir à entraîner des modèles de ML spécialisés.

En plus de leurs capacités multimodales générales, les modèles Gemini offrent une précision accrue pour des cas d'utilisation spécifiques tels que la détection d'objets et la segmentation, grâce à un entraînement supplémentaire.

Transmettre des images à Gemini

Vous pouvez fournir des images en entrée à Gemini à l'aide de plusieurs méthodes :

Transmettre une image à l'aide d'une URL

Vous pouvez importer une image à l'aide de l'API Files et la transmettre dans la requête :

Python

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="path/to/organ.jpg")

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=[
        {"type": "text", "text": "Caption this image."},
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        }
    ]
)