Pemahaman dokumen

Model Gemini dapat memproses dokumen dalam format PDF, menggunakan vision native untuk memahami seluruh konteks dokumen. Hal ini tidak hanya sekadar mengekstrak teks, tetapi juga memungkinkan Gemini untuk:

  • Menganalisis dan menafsirkan konten, termasuk teks, gambar, diagram, diagram, dan tabel, bahkan dalam dokumen panjang hingga 1.000 halaman.
  • Mengekstrak informasi ke dalam format output terstruktur.
  • Merangkum dan menjawab pertanyaan berdasarkan elemen visual dan tekstual dalam dokumen.
  • Mentranskripsikan konten dokumen (misalnya, ke HTML), mempertahankan tata letak dan pemformatan, untuk digunakan dalam aplikasi hilir.

Anda juga dapat meneruskan dokumen non-PDF dengan cara yang sama, tetapi Gemini akan melihatnya sebagai teks normal yang akan menghilangkan konteks seperti diagram atau pemformatan.

Meneruskan data PDF inline

Anda dapat meneruskan data PDF inline dalam permintaan. Cara ini paling cocok untuk dokumen yang lebih kecil atau pemrosesan sementara yang tidak memerlukan referensi file dalam permintaan berikutnya. Sebaiknya gunakan Files API untuk dokumen yang lebih besar yang perlu Anda referensikan dalam interaksi multi-turn untuk meningkatkan latensi permintaan dan mengurangi penggunaan bandwidth.

Contoh berikut menunjukkan cara meneruskan data PDF inline:

Python

from google import genai
import base64

client = genai.Client()

with open('path/to/document.pdf', 'rb') as f:
    pdf_bytes = f.read()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=[
        {
            "type": "document",
            "data": base64.b64encode(pdf_bytes).decode('utf-8'),
            "mime_type": "application/pdf"
        },
        {"type": "text", "text": "Summarize this document"}