Modele Gemini są budowane od podstaw z myślą o multimodalności, co umożliwia wykonywanie wielu zadań związanych z przetwarzaniem obrazów i widzeniem komputerowym, w tym m.in. tworzenie podpisów do obrazów, klasyfikację i wizualne odpowiedzi na pytania, bez konieczności trenowania wyspecjalizowanych modeli ML.
Oprócz ogólnych możliwości multimodalnych modele Gemini oferują większą dokładność w konkretnych przypadkach użycia, takich jak wykrywanie obiektów i segmentacja, dzięki dodatkowemu trenowaniu.
Przekazywanie obrazów do Gemini
Obrazy możesz przekazywać do Gemini na kilka sposobów:
- Przekazywanie obrazu za pomocą adresu URL: idealne rozwiązanie w przypadku obrazów dostępnych publicznie.
- Przekazywanie danych obrazu w tekście: w przypadku danych obrazu zakodowanych w formacie Base64.
- Przesyłanie obrazów za pomocą interfejsu File API: zalecane w przypadku większych plików lub ponownego używania obrazów w wielu żądaniach.
Przekazywanie obrazu za pomocą adresu URL
Obraz możesz przesłać za pomocą interfejsu Files API i przekazać go w żądaniu: