دیدگاه عامل‌گرایانه

مدل‌های ER ربات‌های Gemini می‌توانند کد پایتون را برای دستکاری تصاویر بنویسند و اجرا کنند و قبل از پاسخ دادن، منطق را اعمال کنند. این صفحه نمونه‌هایی از اجرای کد را پوشش می‌دهد: تشخیص شیء با بزرگنمایی و برش، خواندن ابزار، اندازه‌گیری سیال، خواندن برد مدار و حاشیه‌نویسی تصویر.

برای تطبیق این مثال‌ها با مورد استفاده خودتان، متن اعلان و فایل تصویر آپلود شده را با متن خودتان جایگزین کنید. همچنین می‌توانید طرحواره JSON درخواستی را در اعلان تنظیم کنید تا با ساختار خروجی مورد نیاز برنامه شما مطابقت داشته باشد، یا یک system_instruction برای اعمال فرمت و دقت خروجی اضافه کنید.

برای کد کامل قابل اجرا، به کتاب آشپزی رباتیک مراجعه کنید.

سطح تفکر

شما می‌توانید سطح تفکر مدل را کنترل کنید تا تأخیر را با دقت جایگزین کنید. وظایف مکانی مانند تشخیص اشیا با سطح تفکر پایین به خوبی انجام می‌شوند. وظایف پیچیده مانند شمارش یا تخمین وزن از سطح تفکر بالاتر سود می‌برند.

مثال زیر سطح تفکر را برای یک کار شمارش پیچیده در high قرار می‌دهد:

پایتون

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="scene.jpeg")

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": "Identify and count all objects on the table."}
    ],
    generation_config={
        "thinking_level": "high"  # Use "minimal" or "low" for faster spatial tasks
    }
)

print(interaction.output_text)

برای جزئیات بیشتر به تفکر مراجعه کنید.

تشخیص اشیا (بزرگنمایی و برش)

مثال زیر از اجرای کد برای بزرگنمایی و برش تصویر برای نمایش واضح‌تر هنگام تشخیص اشیاء و بازگرداندن کادرهای محصورکننده استفاده می‌کند.

پایتون

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="sorting.jpeg")

prompt = """
Return JSON in the format {label: val, y: val, x: val, y2: val, x2: val} for
the compostable objects in this scene. Please Zoom and crop the image for a
clearer view. Return an annotated image of the final result with the bounding
boxes drawn on it to the API caller as a part of your process.
"""

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": prompt}
    ],
    tools=[{"type": "code_execution"}]
)

print(interaction.output_text)

خروجی مدل مشابه پاسخ json زیر خواهد بود:

[
  {"label": "compostable", "y": 256, "x": 482, "y2": 295,