مدلهای ER (استدلال تجسمی) Gemini Robotics، مدلهای زبان بینایی (VLM) هستند که به رباتها اجازه میدهند دنیای فیزیکی را درک کرده و با آن تعامل داشته باشند. آنها دادههای بصری را تفسیر میکنند، استدلال مکانی و زمانی انجام میدهند، وظایف چند مرحلهای را برنامهریزی میکنند و رباتها و ابزارها را هماهنگ میکنند.
مدلها
مدل Gemini Robotics ER 2 جدیدترین مدل در Gemini Robotics است. این مدل استدلال بهروز شده ما است که رباتها را قادر میسازد محیط خود را دقیقاً درک کنند. این مدل در قابلیتهای استدلال تجسمی، مانند هماهنگی عامل رباتها (مثلاً با استفاده از VLAها)، درک ویدیوی ربات از جمله درک پیشرفت و تشخیص موفقیت، خواندن ابزار، اشاره و استدلال فضایی تخصص دارد.
مدل Gemini Robotics ER 2 دو نقطه پایانی مدل را معرفی میکند:
-
gemini-robotics-er-2-preview: مدل استاندارد ER 2. بر اساس Gemini 3.5 Flash ساخته شده و استدلال فضایی، یافتن لحظات ویدیویی، طبقهبندی پیشرفت ویدیو، هماهنگی چند ربات و استفاده از ابزار چند مرحلهای بهبود یافته است. -
gemini-robotics-er-2-streaming-preview: برای جریانسازی بلادرنگ از طریق Live API بهینهسازی شده است. از این مدل برای رباتهای عامل با تأخیر کم که ورودیهای صوتی و تصویری مداوم را پردازش میکنند، استفاده کنید.
اگر از Gemini Robotics ER 1.6 استفاده میکنید، با جایگزینی model="gemini-robotics-er-1.6-preview" با model="gemini-robotics-er-2-preview" یا model="gemini-robotics-er-2-streaming-preview" در فراخوانیهای API خود، به Gemini Robotics ER 2 ارتقا دهید. توجه داشته باشید که مدل Gemini Robotics ER 1.6 در پایان ماه آگوست غیرفعال خواهد شد.
Gemini Robotics ER 2 را در استودیوی هوش مصنوعی گوگل امتحان کنید
قابلیتهای رباتیک
ربات Gemini Robotics ER از طیف وسیعی از قابلیتهای استدلال تجسمی پشتیبانی میکند. برای کسب اطلاعات بیشتر، یکی از قابلیتها را انتخاب کنید:
| قابلیت | توضیحات | راهنما |
|---|---|---|
| استدلال فضایی | به اشیاء اشاره کنید، آنها را در ویدیو ردیابی کنید، با جعبههای محدودکننده تشخیص دهید، مسیرها را برنامهریزی کنید. | استدلال فضایی |
| دیدگاه عاملگرایانه | با استفاده از ابزارهای دستکاری تصویر، از اجرای کد برای بهبود سایر قابلیتها استفاده کنید. | دیدگاه عاملگرایانه |
| هماهنگسازی وظایف | استدلال فضایی را با API های ربات سفارشی ترکیب کنید تا وظایف بلندمدت را انجام دهید. | هماهنگسازی وظایف |
| پخش جریانی (فقط نقطه پایانی پخش جریانی Gemini Robotics ER 2) | جریان دو طرفه برای عاملهای ربات بلادرنگ با فراخوانی تابع با تأخیر کم | پخش زنده برای رباتیک |
| پیشرفت ویدیویی (فقط Gemini Robotics ER 2) | یافتن لحظه و طبقهبندی پیشرفت از فیدهای ویدیویی پیوسته | درک ویدیو |
شروع به کار
مثال زیر اشیاء را در یک تصویر پیدا میکند و مختصات دوبعدی و برچسبهای نرمالشدهی آنها را برمیگرداند. میتوانید این خروجی را مستقیماً به یک API رباتیک یا یک مدل VLA ارسال کنید تا اقدامات ربات تولید شود.
پایتون
from google import genai
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
image_response = client.interactions.create(
model="gemini-robotics-er-2-preview",
input=[
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{"type": "text", "text": PROMPT}
],
generation_config={"thinking_level": "high"},
)
print(image_response.output_text)