بخش اورژانس رباتیک جمینی

مدل‌های ER (استدلال تجسمی) Gemini Robotics، مدل‌های زبان بینایی (VLM) هستند که به ربات‌ها اجازه می‌دهند دنیای فیزیکی را درک کرده و با آن تعامل داشته باشند. آن‌ها داده‌های بصری را تفسیر می‌کنند، استدلال مکانی و زمانی انجام می‌دهند، وظایف چند مرحله‌ای را برنامه‌ریزی می‌کنند و ربات‌ها و ابزارها را هماهنگ می‌کنند.

مدل‌ها

مدل Gemini Robotics ER 2 جدیدترین مدل در Gemini Robotics است. این مدل استدلال به‌روز شده ما است که ربات‌ها را قادر می‌سازد محیط خود را دقیقاً درک کنند. این مدل در قابلیت‌های استدلال تجسمی، مانند هماهنگی عامل ربات‌ها (مثلاً با استفاده از VLAها)، درک ویدیوی ربات از جمله درک پیشرفت و تشخیص موفقیت، خواندن ابزار، اشاره و استدلال فضایی تخصص دارد.

مدل Gemini Robotics ER 2 دو نقطه پایانی مدل را معرفی می‌کند:

  • gemini-robotics-er-2-preview : مدل استاندارد ER 2. بر اساس Gemini 3.5 Flash ساخته شده و استدلال فضایی، یافتن لحظات ویدیویی، طبقه‌بندی پیشرفت ویدیو، هماهنگی چند ربات و استفاده از ابزار چند مرحله‌ای بهبود یافته است.
  • gemini-robotics-er-2-streaming-preview : برای جریان‌سازی بلادرنگ از طریق Live API بهینه‌سازی شده است. از این مدل برای ربات‌های عامل با تأخیر کم که ورودی‌های صوتی و تصویری مداوم را پردازش می‌کنند، استفاده کنید.

اگر از Gemini Robotics ER 1.6 استفاده می‌کنید، با جایگزینی model="gemini-robotics-er-1.6-preview" با model="gemini-robotics-er-2-preview" یا model="gemini-robotics-er-2-streaming-preview" در فراخوانی‌های API خود، به Gemini Robotics ER 2 ارتقا دهید. توجه داشته باشید که مدل Gemini Robotics ER 1.6 در پایان ماه آگوست غیرفعال خواهد شد.

Gemini Robotics ER 2 را در استودیوی هوش مصنوعی گوگل امتحان کنید

قابلیت‌های رباتیک

ربات Gemini Robotics ER از طیف وسیعی از قابلیت‌های استدلال تجسمی پشتیبانی می‌کند. برای کسب اطلاعات بیشتر، یکی از قابلیت‌ها را انتخاب کنید:

قابلیت توضیحات راهنما
استدلال فضایی به اشیاء اشاره کنید، آنها را در ویدیو ردیابی کنید، با جعبه‌های محدودکننده تشخیص دهید، مسیرها را برنامه‌ریزی کنید. استدلال فضایی
دیدگاه عامل‌گرایانه با استفاده از ابزارهای دستکاری تصویر، از اجرای کد برای بهبود سایر قابلیت‌ها استفاده کنید. دیدگاه عامل‌گرایانه