مدلهای ER رباتهای Gemini میتوانند کد پایتون را برای دستکاری تصاویر بنویسند و اجرا کنند و قبل از پاسخ دادن، منطق را اعمال کنند. این صفحه نمونههایی از اجرای کد را پوشش میدهد: تشخیص شیء با بزرگنمایی و برش، خواندن ابزار، اندازهگیری سیال، خواندن برد مدار و حاشیهنویسی تصویر.
برای تطبیق این مثالها با مورد استفاده خودتان، متن اعلان و فایل تصویر آپلود شده را با متن خودتان جایگزین کنید. همچنین میتوانید طرحواره JSON درخواستی را در اعلان تنظیم کنید تا با ساختار خروجی مورد نیاز برنامه شما مطابقت داشته باشد، یا یک system_instruction برای اعمال فرمت و دقت خروجی اضافه کنید.
برای کد کامل قابل اجرا، به کتاب آشپزی رباتیک مراجعه کنید.
سطح تفکر
شما میتوانید سطح تفکر مدل را کنترل کنید تا تأخیر را با دقت جایگزین کنید. وظایف مکانی مانند تشخیص اشیا با سطح تفکر پایین به خوبی انجام میشوند. وظایف پیچیده مانند شمارش یا تخمین وزن از سطح تفکر بالاتر سود میبرند.
مثال زیر سطح تفکر را برای یک کار شمارش پیچیده در high قرار میدهد:
پایتون
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="scene.jpeg")
interaction = client.interactions.create(
model="gemini-robotics-er-2-preview",
input=[
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{"type": "text", "text": "Identify and count all objects on the table."}
],
generation_config={
"thinking_level": "high" # Use "minimal" or "low" for faster spatial tasks
}
)
print(interaction.output_text)
برای جزئیات بیشتر به تفکر مراجعه کنید.
تشخیص اشیا (بزرگنمایی و برش)
مثال زیر از اجرای کد برای بزرگنمایی و برش تصویر برای نمایش واضحتر هنگام تشخیص اشیاء و بازگرداندن کادرهای محصورکننده استفاده میکند.
پایتون
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="sorting.jpeg")
prompt = """
Return JSON in the format {label: val, y: val, x: val, y2: val, x2: val} for
the compostable objects in this scene. Please Zoom and crop the image for a
clearer view. Return an annotated image of the final result with the bounding
boxes drawn on it to the API caller as a part of your process.
"""
interaction = client.interactions.create(
model="gemini-robotics-er-2-preview",
input=[
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{"type": "text", "text": prompt}
],
tools=[{"type": "code_execution"}]
)
print(interaction.output_text)
خروجی مدل مشابه پاسخ json زیر خواهد بود:
[
{"label": "compostable", "y": 256, "x": 482, "y2": 295,