Halaman ini menjelaskan cara menggunakan Agent Search untuk mengurai dan membagi dokumen Anda menjadi beberapa bagian.
Anda dapat mengonfigurasi setelan penguraian atau pengelompokan untuk:
Tentukan cara Agent Search mengurai konten. Anda dapat menentukan cara mem-parsing konten tidak terstruktur saat menguploadnya ke Agent Search. Penelusuran Agen menyediakan parser digital, parser OCR untuk PDF, dan parser tata letak. Anda juga dapat menggunakan dokumen yang sudah diuraikan sendiri. Parser tata letak direkomendasikan jika Anda memiliki konten lengkap dan elemen struktural seperti bagian, paragraf, tabel, gambar, dan daftar yang akan diekstrak dari dokumen untuk penelusuran dan pembuatan jawaban.
Gunakan Agent Search untuk retrieval-augmented generation (RAG). Tingkatkan kualitas output LLM dengan data relevan yang telah Anda upload ke aplikasi Penelusuran Agen. Untuk melakukannya, Anda akan mengaktifkan pemecahan dokumen menjadi bagian-bagian, yang mengindeks data Anda sebagai bagian-bagian untuk meningkatkan relevansi dan mengurangi beban komputasi untuk LLM. Anda juga akan mengaktifkan parser tata letak, yang mendeteksi elemen dokumen seperti judul dan daftar, untuk meningkatkan cara dokumen dikelompokkan.
Untuk mengetahui informasi tentang chunking untuk RAG dan cara menampilkan potongan dalam permintaan penelusuran, lihat Mengelompokkan dokumen untuk RAG.
Mengurai dokumen
Anda dapat mengontrol parsing konten dengan cara berikut:
Tentukan jenis parser. Anda dapat menentukan jenis parsing yang akan diterapkan bergantung pada jenis file:
Parser digital. Parser digital diaktifkan secara default untuk semua jenis file, kecuali jika jenis parser lain ditentukan. Parser digital memproses dokumen yang di-ingest jika tidak ada parser default lain yang ditentukan untuk datastore atau jika parser yang ditentukan tidak mendukung jenis file dokumen yang di-ingest.
Penguraian OCR untuk PDF. Parser ini dapat digunakan sebagai alternatif yang lebih murah untuk parser tata letak jika Anda mengupload PDF yang dipindai atau PDF dengan teks di dalam gambar. Lihat bagian Parser OCR untuk PDF dalam dokumen ini.
Parser tata letak. Jika Anda berencana menggunakan Penelusuran Agen untuk RAG, aktifkan parser tata letak untuk file HTML, PDF, DOCX, PPTX, dan XLSX. Lihat Mengelompokkan dokumen untuk RAG guna mengetahui informasi tentang parser ini dan cara mengaktifkannya. Parser tata letak dapat melakukan pengenalan karakter optik pada gambar dan dokumen yang dipindai.
Bawa dokumen yang sudah diuraikan sendiri. (Pratinjau) Jika telah mem-parsing dokumen tidak terstruktur, Anda dapat mengimpor konten yang telah di-parsing sebelumnya ke Penelusuran Agen. Lihat Membawa dokumen yang diuraikan sendiri.
Perbandingan ketersediaan parser
Tabel berikut mencantumkan ketersediaan setiap parser menurut jenis file dokumen dan menunjukkan elemen yang dapat dideteksi dan diuraikan oleh setiap parser.
| Jenis file | Parser digital | Pengurai OCR untuk PDF | Parser tata letak |
|---|---|---|---|
| HTML | Mendeteksi elemen paragraf | Tidak berlaku | Mendeteksi elemen paragraf, tabel, gambar, daftar, judul, dan heading |
| Mendeteksi elemen paragraf (teks digital) | Mendeteksi elemen paragraf | Mendeteksi elemen paragraf, tabel, gambar, judul, dan heading | |
| DOCX | Mendeteksi elemen paragraf | Tidak berlaku | Mendeteksi elemen paragraf, tabel, gambar, daftar, judul, heading |
| PPTX | Mendeteksi elemen paragraf | Tidak berlaku | Mendeteksi elemen paragraf, tabel, gambar, daftar, judul, heading |
| TXT | Mendeteksi elemen paragraf | Tidak berlaku | Tidak berlaku |
| XLSX | Mendeteksi elemen paragraf | Tidak berlaku | Mendeteksi elemen paragraf, tabel, judul, heading |
| XLSM | Mendeteksi elemen paragraf | Tidak berlaku | Mendeteksi elemen paragraf, tabel, judul, heading |
Ukuran file maksimum dokumen tidak terstruktur yang dapat Anda impor sama untuk ketiga parser. Lihat Menyiapkan data untuk penyerapan.
Parser digital
Parser digital mengekstrak teks yang dapat dibaca mesin dari dokumen. Deteksi blok teks, tetapi bukan elemen dokumen seperti tabel, daftar, dan heading.
Parser digital digunakan sebagai default jika Anda tidak menentukan parser lain sebagai default selama pembuatan penyimpanan data. Selain itu, parser digital digunakan jika parser yang ditentukan tidak mendukung jenis file yang diupload—misalnya, jika parser tata letak ditentukan, parser digital akan digunakan untuk mem-parsing file TXT karena parser tata letak tidak mendukung file teks.
Pengurai OCR untuk PDF
Untuk PDF yang dipindai dan PDF yang teksnya merupakan bagian dari gambar, seperti dokumen yang dipindai dan gambar seperti screenshot yang berisi teks, maka parser OCR untuk PDF dapat menjadi pilihan yang baik. Jika Anda memiliki PDF yang berisi teks yang tidak dapat ditelusuri (seperti teks hasil pindaian atau infografis) dan teks yang dapat dibaca mesin, Anda dapat menyetel kolom useNativeText ke benar (true) saat menentukan parser OCR. Dalam
kasus ini, teks yang dapat dibaca mesin digabungkan dengan output parsing OCR untuk meningkatkan kualitas ekstraksi teks.
Jika PDF Anda memiliki hierarki atau komponen visual atau tabel yang kompleks, pengurai Tata letak mungkin memberikan hasil yang lebih baik.
Jika Anda memiliki PDF yang dapat ditelusuri atau format digital lain yang sebagian besar terdiri dari teks yang dapat dibaca mesin, Anda biasanya tidak perlu menggunakan parser OCR untuk PDF.
Fitur pemrosesan OCR tersedia untuk aplikasi penelusuran kustom dengan penyimpanan data tidak terstruktur. Karena parser OCR hanya berlaku untuk file PDF, hanya file PDF yang di-ingest yang diproses oleh parser OCR; jenis file lain diproses oleh parser digital.
Prosesor OCR dapat mengurai 500 halaman pertama file PDF. Halaman di luar batas 500 tidak diproses.
Parser tata letak
Penguraian tata letak memungkinkan Agent Search mendeteksi tata letak untuk file PDF, HTML, DOCX, PPTX, XLSX, dan XLSM. Agent Search kemudian dapat mengidentifikasi elemen konten seperti blok teks, tabel, daftar, dan elemen struktural seperti judul dan heading, lalu menggunakannya untuk menentukan organisasi dan hierarki dokumen.
Anda dapat mengaktifkan penguraian tata letak untuk semua jenis file atau menentukan jenis file yang akan diaktifkan. Parser tata letak mendeteksi elemen konten seperti paragraf, tabel, daftar, dan elemen struktural seperti judul, heading, header, dan catatan kaki.
Jika Anda memiliki PDF kompleks yang tidak dapat ditelusuri, seperti PDF yang dipindai dengan hierarki atau tabel yang rumit, atau PDF dengan teks di dalam gambar, seperti infografis, Google merekomendasikan parser tata letak, bukan parser OCR.
Parser tata letak hanya tersedia saat menggunakan chunking dokumen untuk RAG. Jika pengelompokan dokumen diaktifkan, Penelusuran Agen akan memecah dokumen menjadi beberapa bagian pada saat penyerapan dan dapat menampilkan dokumen sebagai bagian. Mendeteksi tata letak dokumen memungkinkan pengelompokan yang sesuai dengan konten dan meningkatkan penelusuran serta pembuatan jawaban yang terkait dengan elemen dokumen. Untuk mengetahui informasi selengkapnya tentang membagi dokumen menjadi beberapa bagian untuk RAG, lihat Membagi dokumen menjadi beberapa bagian untuk RAG.
Anda dapat memilih satu atau beberapa add-on parser tata letak berikut saat Anda membuat penyimpanan data:
- Anotasi gambar
- Anotasi tabel
- Penguraian tata letak Gemini (Pratinjau Publik)
- Mengecualikan konten HTML
Anotasi gambar
Jika anotasi gambar diaktifkan, saat gambar terdeteksi dalam dokumen sumber, deskripsi (anotasi) gambar dan gambar itu sendiri akan ditetapkan ke potongan. Anotasi menentukan apakah potongan harus ditampilkan dalam hasil penelusuran. Jika jawaban dibuat, anotasi dapat menjadi sumber untuk jawaban.
Pengurai tata letak dapat mendeteksi jenis gambar berikut: BMP, GIF, JPEG, PNG, dan TIFF.
Untuk mengaktifkan anotasi gambar dalam penguraian tata letak, lakukan hal berikut saat Anda membuat penyimpanan data:
- Pilih Opsi pemrosesan dokumen > Setelan pengurai tata letak > Aktifkan anotasi gambar.
Anotasi tabel
Jika anotasi tabel diaktifkan, saat tabel terdeteksi dalam dokumen sumber, deskripsi (anotasi) tabel dan tabel itu sendiri akan ditetapkan ke potongan. Anotasi menentukan apakah potongan harus ditampilkan dalam hasil penelusuran. Jika jawaban dibuat, anotasi dapat menjadi sumber untuk jawaban.
Untuk mengaktifkan anotasi tabel dalam penguraian tata letak, lakukan hal berikut saat Anda membuat penyimpanan data:
- Pilih Opsi pemrosesan dokumen > Setelan parser tata letak > Aktifkan anotasi tabel.
Penguraian tata letak Gemini (Pratinjau Publik)
Jika penguraian tata letak Gemini diaktifkan, Gemini akan digunakan untuk memberikan analisis tata letak dan ekstraksi konten pada file PDF. Fitur ini memberikan pengenalan tabel berkualitas tinggi, urutan baca yang lebih baik, dan pengenalan teks yang lebih akurat. Fitur ini tersedia untuk penyimpanan data yang memiliki dokumen tidak terstruktur. Anda dapat menggunakan add-on parser Gemini bersama dengan add-on anotasi tabel.
Untuk mengaktifkan penguraian tata letak Gemini, lakukan langkah-langkah berikut saat Anda membuat penyimpanan data:
- Pilih Opsi pemrosesan dokumen > Setelan parser tata letak > Aktifkan peningkatan Gemini.
Mengecualikan konten HTML
Saat menggunakan parser tata letak untuk dokumen HTML, Anda dapat mengecualikan bagian tertentu dari konten HTML agar tidak diproses. Untuk meningkatkan kualitas data aplikasi penelusuran dan aplikasi RAG, Anda dapat mengecualikan boilerplate atau bagian seperti menu navigasi, header, footer, atau sidebar.
layoutParsingConfig menyediakan kolom berikut untuk tujuan ini:
excludeHtmlElements: Daftar tag HTML yang akan dikecualikan. Konten dalam tag ini dikecualikan.excludeHtmlClasses: Daftar atribut class HTML yang akan dikecualikan. Elemen HTML yang berisi atribut class ini, beserta kontennya, akan dikecualikan.excludeHtmlIds: Daftar atribut ID elemen HTML yang akan dikecualikan. Elemen HTML dengan atribut ID ini, beserta kontennya, akan dikecualikan.
Menentukan parser default
Dengan menyertakan objek documentProcessingConfig
saat membuat penyimpanan data, Anda dapat menentukan parser default untuk penyimpanan data tersebut. Jika Anda tidak menyertakan documentProcessingConfig.defaultParsingConfig, parser digital akan digunakan. Parser digital juga digunakan jika parser yang ditentukan tidak tersedia untuk jenis file.
REST
Untuk menentukan parser default:
Saat membuat penyimpanan data penelusuran menggunakan API, sertakan
documentProcessingConfig.defaultParsingConfigdalam permintaan pembuatan penyimpanan data. Anda dapat menentukan parser OCR, parser tata letak, atau parser digital:Untuk menentukan parser OCR:
"documentProcessingConfig": { "defaultParsingConfig": { "ocrParsingConfig": { "useNativeText": "NATIVE_TEXT_BOOLEAN" } } }NATIVE_TEXT_BOOLEANbersifat opsional. Tetapkan hanya jika Anda menyerap PDF. Jika disetel ketrue, opsi ini akan mengaktifkan pemrosesan teks yang dapat dibaca mesin untuk parser OCR. Defaultnya adalahfalse.
Untuk menentukan parser tata letak:
"documentProcessingConfig": { "defaultParsingConfig": { "layoutParsingConfig": {} } }Untuk menentukan parser digital:
"documentProcessingConfig": { "defaultParsingConfig": { "digitalParsingConfig": {} } }
Konsol
Saat membuat penyimpanan data penelusuran melalui konsol, Anda dapat menentukan parser default.
Contoh
Contoh berikut menentukan parser OCR sebagai parser default selama pembuatan penyimpanan data.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json" \
-H "X-Goog-User-Project: exampleproject" \
"https://discoveryengine.googleapis.com/v1/projects/exampleproject/locations/global/collections/default_collection/dataStores?dataStoreId=datastore123" \
-d '{
"displayName": "exampledatastore",
"industryVertical": "GENERIC",
"solutionTypes": ["SOLUTION_TYPE_SEARCH"],
"contentConfig": "CONTENT_REQUIRED",
"documentProcessingConfig": {
"defaultParsingConfig": {
"ocrParsingConfig": {
"useNativeText": "false"
}
}
}
}'
Menentukan penggantian parser untuk jenis file
Anda dapat menentukan bahwa jenis file tertentu (PDF, HTML, DOCX, PPTX, XLSX, dan XLSM) harus diuraikan oleh parser yang berbeda dengan parser default. Untuk melakukannya, sertakan kolom
documentProcessingConfig dalam permintaan pembuatan
penyimpanan data dan tentukan parser penggantian. Jika Anda tidak menentukan parser
default, parser digital akan menjadi default.
REST
Untuk menentukan penggantian parser khusus jenis file:
Saat membuat penyimpanan data penelusuran menggunakan API, sertakan
documentProcessingConfig.defaultParsingConfigdalam permintaan pembuatan penyimpanan data.Anda dapat menentukan parser untuk jenis file tertentu:
"documentProcessingConfig": { "parsingConfigOverrides": { "FILE_TYPE": { PARSING_CONFIG }, } }Ganti kode berikut:
FILE_TYPE: Nilai yang diterima adalahpdf,html,docx,pptx,xlsm, danxlsx.PARSING_CONFIG: Tentukan konfigurasi untuk parser yang ingin Anda terapkan ke jenis file. Anda dapat menentukan parser OCR, parser tata letak, atau parser digital:Untuk menentukan parser OCR:
"ocrParsingConfig": { "useNativeText": "NATIVE_TEXT_BOOLEAN" }NATIVE_TEXT_BOOLEAN: Opsional. Tetapkan hanya jika Anda memasukkan PDF. Jika disetel ketrue, opsi ini akan mengaktifkan pemrosesan teks yang dapat dibaca mesin untuk parser OCR. Defaultnya adalahfalse.
Untuk menentukan parser tata letak:
"layoutParsingConfig": {}Untuk menentukan parser digital:
"documentProcessingConfig": { "defaultParsingConfig": { "digitalParsingConfig": {} } }
Konsol
Saat membuat penyimpanan data penelusuran melalui konsol, Anda dapat menentukan penggantian parser untuk jenis file tertentu.
Contoh
Contoh berikut menentukan selama pembuatan penyimpanan data bahwa file PDF harus diproses oleh parser OCR dan file HTML harus diproses oleh parser tata letak. Dalam hal ini, file selain file PDF dan HTML akan diproses oleh parser digital.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json" \
-H "X-Goog-User-Project: exampleproject" \
"https://discoveryengine.googleapis.com/v1/projects/exampleproject/locations/global/collections/default_collection/dataStores?dataStoreId=datastore123" \
-d '{
"displayName": "exampledatastore",
"industryVertical": "GENERIC",
"solutionTypes": ["SOLUTION_TYPE_SEARCH"],
"contentConfig": "CONTENT_REQUIRED",
"documentProcessingConfig": {
"parsingConfigOverrides": {
"pdf": {
"ocrParsingConfig": {
"useNativeText": "false"
},
},
"html": {
"layoutParsingConfig": {}
}
}
}
}'
Mengedit penguraian dokumen untuk penyimpanan data yang ada
Jika sudah memiliki penyimpanan data, Anda dapat mengubah parser default dan menambahkan pengecualian format file. Namun, setelan parser yang diperbarui hanya berlaku untuk dokumen baru yang diimpor ke penyimpanan data. Dokumen yang sudah ada di penyimpanan data tidak diuraikan ulang dengan setelan baru.
Untuk mengubah setelan parsing dokumen untuk penyimpanan data, lakukan hal berikut:
Di konsol Google Cloud , buka halaman AI Applications.
Di menu navigasi, klik Data Stores.
Di kolom Nama, klik penyimpanan data yang ingin Anda edit.
Di tab Processing config, edit setelan Penguraian dokumen.
Setelan Pengelompokan dokumen tidak dapat diubah. Jika penyimpanan data tidak mengaktifkan chunking dokumen, Anda tidak dapat memilih parser tata letak.
Klik Kirim.
Mengonfigurasi parser tata letak untuk mengecualikan konten HTML
Anda dapat mengonfigurasi parser tata letak untuk
mengecualikan konten HTML dengan menentukan
excludeHtmlElements, excludeHtmlClasses, atau excludeHtmlIds di
documentProcessingConfig.defaultParsingConfig.layoutParsingConfig.
REST
Untuk mengecualikan konten HTML tertentu agar tidak diproses oleh parser tata letak, ikuti langkah-langkah berikut:
Saat membuat penyimpanan data penelusuran menggunakan API, sertakan
documentProcessingConfig.defaultParsingConfig.layoutParsingConfigdalam permintaan pembuatan penyimpanan data.Untuk mengecualikan jenis tag HTML tertentu, gunakan:
"documentProcessingConfig": { "defaultParsingConfig": { "layoutParsingConfig": { "excludeHtmlElements": ["HTML_TAG_1","HTML_TAG_2","HTML_TAG_N"] } } }Ganti variabel HTML_TAG dengan nama tag, misalnya,
navdanfooter.Untuk mengecualikan atribut class elemen HTML tertentu, gunakan:
"documentProcessingConfig": { "defaultParsingConfig": { "layoutParsingConfig": { "excludeHtmlClasses": ["HTML_CLASS_1","HTML_CLASS_2","HTML_CLASS_N"]