بخش اورژانس رباتیک جمینی

مدل‌های ER (استدلال تجسمی) Gemini Robotics، مدل‌های زبان بینایی (VLM) هستند که به ربات‌ها اجازه می‌دهند دنیای فیزیکی را درک کرده و با آن تعامل داشته باشند. آن‌ها داده‌های بصری را تفسیر می‌کنند، استدلال مکانی و زمانی انجام می‌دهند، وظایف چند مرحله‌ای را برنامه‌ریزی می‌کنند و ربات‌ها و ابزارها را هماهنگ می‌کنند.

مدل‌ها

مدل Gemini Robotics ER 2 جدیدترین مدل در Gemini Robotics است. این مدل استدلال به‌روز شده ما است که ربات‌ها را قادر می‌سازد محیط خود را دقیقاً درک کنند. این مدل در قابلیت‌های استدلال تجسمی، مانند هماهنگی عامل ربات‌ها (مثلاً با استفاده از VLAها)، درک ویدیوی ربات از جمله درک پیشرفت و تشخیص موفقیت، خواندن ابزار، اشاره و استدلال فضایی تخصص دارد.

مدل Gemini Robotics ER 2 دو نقطه پایانی مدل را معرفی می‌کند:

  • gemini-robotics-er-2-preview : مدل استاندارد ER 2. بر اساس Gemini 3.5 Flash ساخته شده و استدلال فضایی، یافتن لحظات ویدیویی، طبقه‌بندی پیشرفت ویدیو، هماهنگی چند ربات و استفاده از ابزار چند مرحله‌ای بهبود یافته است.
  • gemini-robotics-er-2-streaming-preview : برای جریان‌سازی بلادرنگ از طریق Live API بهینه‌سازی شده است. از این مدل برای ربات‌های عامل با تأخیر کم که ورودی‌های صوتی و تصویری مداوم را پردازش می‌کنند، استفاده کنید.

اگر از Gemini Robotics ER 1.6 استفاده می‌کنید، با جایگزینی model="gemini-robotics-er-1.6-preview" با model="gemini-robotics-er-2-preview" یا model="gemini-robotics-er-2-streaming-preview" در فراخوانی‌های API خود، به Gemini Robotics ER 2 ارتقا دهید. توجه داشته باشید که مدل Gemini Robotics ER 1.6 در پایان ماه آگوست غیرفعال خواهد شد.

Gemini Robotics ER 2 را در استودیوی هوش مصنوعی گوگل امتحان کنید

قابلیت‌های رباتیک

ربات Gemini Robotics ER از طیف وسیعی از قابلیت‌های استدلال تجسمی پشتیبانی می‌کند. برای کسب اطلاعات بیشتر، یکی از قابلیت‌ها را انتخاب کنید:

قابلیت توضیحات راهنما
استدلال فضایی به اشیاء اشاره کنید، آنها را در ویدیو ردیابی کنید، با جعبه‌های محدودکننده تشخیص دهید، مسیرها را برنامه‌ریزی کنید. استدلال فضایی
دیدگاه عامل‌گرایانه با استفاده از ابزارهای دستکاری تصویر، از اجرای کد برای بهبود سایر قابلیت‌ها استفاده کنید. دیدگاه عامل‌گرایانه
هماهنگ‌سازی وظایف استدلال فضایی را با API های ربات سفارشی ترکیب کنید تا وظایف بلندمدت را انجام دهید. هماهنگ‌سازی وظایف
پخش جریانی (فقط نقطه پایانی پخش جریانی Gemini Robotics ER 2) جریان دو طرفه برای عامل‌های ربات بلادرنگ با فراخوانی تابع با تأخیر کم پخش زنده برای رباتیک
پیشرفت ویدیویی (فقط Gemini Robotics ER 2) یافتن لحظه و طبقه‌بندی پیشرفت از فیدهای ویدیویی پیوسته درک ویدیو

شروع به کار

مثال زیر اشیاء را در یک تصویر پیدا می‌کند و مختصات دوبعدی و برچسب‌های نرمال‌شده‌ی آنها را برمی‌گرداند. می‌توانید این خروجی را مستقیماً به یک API رباتیک یا یک مدل VLA ارسال کنید تا اقدامات ربات تولید شود.

پایتون

from google import genai

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

image_response = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": PROMPT}
    ],
    generation_config={"thinking_level": "high"},
)

print(image_response.output_text)

استراحت