Các mô hình Gemini Robotics ER có thể chỉ vào các đối tượng, theo dõi các đối tượng đó trong video, phát hiện các đối tượng đó bằng khung hình chữ nhật và tạo quỹ đạo chuyển động.
Để xem toàn bộ mã có thể chạy, hãy xem Sổ tay về robot học.
Chỉ vào các đối tượng
Ví dụ sau đây tìm các đối tượng cụ thể trong một hình ảnh và trả về toạ độ [y, x] được chuẩn hoá của các đối tượng đó:
Python
from google import genai
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file=