Interpretacja obrazu

Modele Gemini są budowane od podstaw z myślą o multimodalności, co umożliwia wykonywanie wielu zadań związanych z przetwarzaniem obrazów i widzeniem komputerowym, w tym m.in. tworzenie podpisów do obrazów, klasyfikację i wizualne odpowiedzi na pytania, bez konieczności trenowania wyspecjalizowanych modeli ML.

Oprócz ogólnych możliwości multimodalnych modele Gemini oferują większą dokładność w konkretnych przypadkach użycia, takich jak wykrywanie obiektów i segmentacja, dzięki dodatkowemu trenowaniu.

Przekazywanie obrazów do Gemini

Obrazy możesz przekazywać do Gemini na kilka sposobów:

Przekazywanie obrazu za pomocą adresu URL

Obraz możesz przesłać za pomocą interfejsu Files API i przekazać go w żądaniu:

Python