Auf dieser Seite wird beschrieben, wie Sie Agent Search verwenden, um Ihre Dokumente zu parsen und in Chunks aufzuteilen.
Sie können Einstellungen für das Parsen oder Aufteilen in Blöcke konfigurieren, um:
Festlegen, wie Agent Search Inhalte parst Wenn Sie unstrukturierte Inhalte in Agent Search hochladen, können Sie festlegen, wie diese geparst werden sollen. Agent Search bietet einen digitalen Parser, einen OCR-Parser für PDFs und einen Layoutparser. Sie können auch Ihre eigenen geparsten Dokumente mitbringen. Der Layoutparser wird empfohlen, wenn Sie Rich Content und Strukturelemente wie Abschnitte, Absätze, Tabellen, Bilder und Listen haben, die für die Suche und Antwortgenerierung aus Dokumenten extrahiert werden sollen.
Weitere Informationen finden Sie unter Dokumente parsen.
Agent Search für Retrieval-Augmented Generation (RAG) verwenden Sie können die Ausgabe von LLMs mit relevanten Daten verbessern, die Sie in Ihre Agent Search-App hochgeladen haben. Dazu aktivieren Sie die Aufteilung von Dokumenten in Blöcke. Dadurch werden Ihre Daten als Blöcke indexiert, um die Relevanz zu verbessern und die Rechenlast für LLMs zu verringern. Außerdem aktivieren Sie den Layout-Parser, der Dokumentelemente wie Überschriften und Listen erkennt, um die Aufteilung von Dokumenten in Chunks zu verbessern.
Informationen zum Aufteilen von Dokumenten in Blöcke für RAG und zum Zurückgeben von Blöcken in Suchanfragen finden Sie unter Dokumente für RAG in Blöcke aufteilen.
Dokumente parsen
Sie haben folgende Möglichkeiten, das Parsen von Inhalten zu steuern:
Parsertyp angeben: Sie können je nach Dateityp den zu verwendenden Parsertyp angeben:
Digitaler Parser: Der digitale Parser ist standardmäßig für alle Dateitypen aktiviert, sofern kein anderer Parser angegeben ist. Der digitale Parser verarbeitet aufgenommene Dokumente, wenn kein anderer Standardparser für den Datenspeicher angegeben ist oder wenn der angegebene Parser den Dateityp eines aufgenommenen Dokuments nicht unterstützt.
OCR-Parser für PDFs: Dieser Parser kann als kostengünstigere Alternative zum Layoutparser verwendet werden, wenn Sie gescannte PDFs oder PDFs mit Text in Bildern hochladen. Weitere Informationen finden Sie in diesem Dokument im Abschnitt OCR-Parser für PDFs.
Layoutparser: Wenn Sie Agent Search für RAG verwenden möchten, aktivieren Sie den Layoutparser für HTML-, PDF-, DOCX-, PPTX- und XLSX-Dateien. Weitere Informationen zu diesem Parser und dazu, wie Sie ihn aktivieren, finden Sie unter Dokumente für RAG in Blöcke aufteilen. Der Layout-Parser kann die optische Zeichenerkennung für Bilder und gescannte Dokumente durchführen.
Eigenes geparstes Dokument verwenden: (Vorabversion) Wenn Sie Ihre unstrukturierten Dokumente bereits geparst haben, können Sie die geparsten Inhalte in Agent Search importieren. Weitere Informationen finden Sie unter Eigene geparste Dokumente verwenden.
Vergleich der Parser
In der folgenden Tabelle sind die einzelnen Parser für die verschiedenen Dokumentdateitypen aufgeführt. Außerdem wird beschrieben, welche Elemente die Parser erkennen und parsen können.
| Dateityp | Digitaler Parser | OCR-Parser für PDFs | Layoutparser |
|---|---|---|---|
| HTML | Erkennt Absatzelemente | Nicht zutreffend | Erkennt Absatz-, Tabellen-, Bilder-, Listen-, Titel- und Überschriftenelemente |
| Erkennt Absatzelemente (digitaler Text) | Erkennt Absatzelemente | Erkennt Absatz-, Tabellen-, Bild-, Titel- und Überschriftenelemente | |
| DOCX | Erkennt Absatzelemente | Nicht zutreffend | Erkennt Absatz-, Tabellen-, Bild-, Listen-, Titel- und Überschriftenelemente |
| PPTX | Erkennt Absatzelemente | Nicht zutreffend | Erkennt Absatz-, Tabellen-, Bild-, Listen-, Titel- und Überschriftenelemente |
| TXT | Erkennt Absatzelemente | Nicht zutreffend | Nicht zutreffend |
| XLSX | Erkennt Absatzelemente | Nicht zutreffend | Erkennt Absatz-, Tabellen-, Titel- und Überschriftenelemente |
| XLSM | Erkennt Absatzelemente | Nicht zutreffend | Erkennt Absatz-, Tabellen-, Titel- und Überschriftenelemente |
Die maximale Dateigröße eines unstrukturierten Dokuments, das Sie importieren können, ist für alle drei Parser gleich. Weitere Informationen finden Sie unter Daten für die Aufnahme vorbereiten.
Digitaler Parser
Der digitale Parser extrahiert maschinenlesbaren Text aus Dokumenten. Er erkennt zwar Textblöcke, jedoch keine Dokumentelemente wie Tabellen, Listen oder Überschriften.
Der digitale Parser wird als Standardparser verwendet, wenn Sie bei der Erstellung des Datenspeichers keinen anderen Parser als Standardparser angeben. Der digitale Parser wird auch verwendet, wenn der angegebene Parser einen hochgeladenen Dateityp nicht unterstützt. Wenn beispielsweise der Layout-Parser angegeben ist, wird der digitale Parser zum Parsen von TXT-Dateien verwendet, da der Layout-Parser Textdateien nicht unterstützt.
OCR-Parser für PDFs
Für gescannte PDFs und PDFs, in denen der Text Teil eines Bildes ist, z. B. gescannte Dokumente und Bilder wie Screenshots, die Text enthalten, kann der OCR-Parser für PDFs eine gute Wahl sein. Wenn Sie PDFs mit nicht durchsuchbarem (z. B. gescannten Text oder Infografiken) und maschinenlesbarem Text haben, können Sie das Feld useNativeText auf „true“ setzen, wenn Sie den OCR-Parser angeben. In diesem Fall wird der maschinenlesbare Text mit den OCR-Parsingausgaben zusammengeführt, um die Qualität der Textextraktion zu verbessern.
Wenn Ihre PDFs eine komplexe Hierarchie oder visuelle oder Tabellenkomponenten enthalten, liefert der Layout-Parser möglicherweise bessere Ergebnisse.
Wenn Sie durchsuchbare PDFs oder andere digitale Formate haben, die hauptsächlich aus maschinenlesbarem Text bestehen, müssen Sie den OCR-Parser für PDFs in der Regel nicht verwenden.
Die OCR-Verarbeitungsfunktionen sind für benutzerdefinierte Such-Apps mit unstrukturierten Datenspeichern verfügbar. Da der OCR-Parser nur für PDF-Dateien verwendet wird, werden nur aufgenommene PDF-Dateien vom OCR-Parser verarbeitet. Andere Dateitypen werden vom digitalen Parser verarbeitet.
Der OCR-Parser kann die ersten 500 Seiten einer PDF-Datei parsen. Alle Seiten darüber werden nicht verarbeitet.
Layoutparser
Mit der Layoutanalyse kann Agent Search Layouts für PDF-, HTML-, DOCX-, PPTX-, XLSX- und XLSM-Dateien erkennen. Agent Search kann dann Inhaltselemente wie Textblöcke, Tabellen, Listen und strukturelle Elemente wie Titel und Überschriften erkennen und damit die Anordnung und Hierarchie eines Dokuments definieren.
Sie können die Layoutanalyse entweder für alle Dateitypen aktivieren oder angeben, für welche Dateitypen sie aktiviert werden soll. Der Layoutparser erkennt Inhaltselemente wie Absätze, Tabellen und Listen sowie strukturelle Elemente wie Titel, Überschriften, Kopf- und Fußzeilen.
Wenn Sie komplexe, nicht durchsuchbare PDFs haben, z. B. gescannte PDFs mit komplizierter Hierarchie oder Tabellen oder PDFs mit Text in Bildern, z. B. Infografiken, empfiehlt Google den Layout-Parser anstelle des OCR-Parsers.
Der Layout-Parser ist nur verfügbar, wenn die Aufteilung von Dokumenten in Blöcke für RAG verwendet wird. Wenn die Dokumentaufteilung aktiviert ist, teilt Agent Search Dokumente bei der Aufnahme in Blöcke auf und kann die Dokumente auch als Blöcke zurückgeben. Das Erkennen des Dokumentlayouts ermöglicht das inhaltsbezogene Aufteilen in Blöcke und verbessert dadurch die Suche und Antwortgenerierung im Zusammenhang mit den Dokumentelementen. Weitere Informationen zum Aufteilen von Dokumenten in Blöcke für die Retrieval-Augmented Generation (RAG) finden Sie unter Dokumente für RAG in Blöcke aufteilen.
Sie können beim Erstellen Ihres Datenspeichers eines oder mehrere der folgenden Add-ons für Layoutparser auswählen:
- Bildannotation
- Tabellenanmerkung
- Gemini-Layoutanalyse (öffentliche Vorschau)
- HTML-Inhalte ausschließen
Bildannotation
Wenn die Bildannotation aktiviert ist und in einem Quelldokument ein Bild erkannt wird, werden eine Beschreibung (Annotation) des Bildes sowie das Bild selbst einem Block zugewiesen. Anhand der Annotation wird bestimmt, ob der Block in einem Suchergebnis zurückgegeben werden soll. Wenn eine Antwort generiert wird, kann die Annotation als Quelle für die Antwort dienen.
Der Layoutparser kann die folgenden Bildtypen erkennen: BMP, GIF, JPEG, PNG und TIFF.
So aktivieren Sie die Bildannotation beim Layout-Parsing, wenn Sie den Datenspeicher erstellen:
- Wählen Sie Optionen für die Dokumentverarbeitung > Einstellungen für den Layout-Parser > Bildanmerkungen aktivieren aus.
Tabellenannotation
Wenn die Tabellenannotation aktiviert ist und in einem Quelldokument eine Tabelle erkannt wird, werden eine Beschreibung (Annotation) der Tabelle sowie die Tabelle selbst einem Block zugewiesen. Anhand der Annotation wird bestimmt, ob der Block in einem Suchergebnis zurückgegeben werden soll. Wenn eine Antwort generiert wird, kann die Annotation als Quelle für die Antwort dienen.
So aktivieren Sie die Tabellenannotation beim Parsen des Layouts, wenn Sie den Datenspeicher erstellen:
- Wählen Sie Optionen für die Dokumentverarbeitung > Einstellungen für den Layout-Parser > Tabellenanmerkungen aktivieren aus.
Gemini-Layout-Parsing (öffentliche Vorschau)
Wenn die Gemini-Layoutanalyse aktiviert ist, wird Gemini verwendet, um PDF-Dateien zu analysieren und Inhalte daraus zu extrahieren. Diese Funktion bietet eine hochwertige Tabellenerkennung, eine verbesserte Lesereihenfolge und eine genauere Texterkennung. Sie ist für Datenspeicher mit unstrukturierten Dokumenten verfügbar. Sie können das Gemini Parser-Add-on zusammen mit dem Add-on für Tabellenanmerkungen verwenden.
So aktivieren Sie das Gemini-Layout-Parsing beim Erstellen des Datenspeichers:
- Wählen Sie Optionen für die Dokumentverarbeitung > Einstellungen für den Layout-Parser > Gemini-Optimierung aktivieren aus.
HTML-Inhalte ausschließen
Wenn Sie den Layoutparser für HTML-Dokumente verwenden, können Sie bestimmte Teile des HTML-Inhalts von der Verarbeitung ausschließen. Um die Datenqualität für Such- und RAG-Anwendungen zu verbessern, können Sie Standardtext oder Abschnitte wie Navigationsmenüs, Kopf- und Fußzeilen oder Seitenleisten ausschließen.
Die layoutParsingConfig bietet hierfür die folgenden Felder:
excludeHtmlElements: Liste der auszuschließenden HTML-Tags. Die Inhalte innerhalb dieser Tags werden ausgeschlossen.excludeHtmlClasses: Liste der auszuschließenden HTML-Klassenattribute. Die HTML-Elemente mit diesen Klassenattributen werden zusammen mit ihrem Inhalt ausgeschlossen.excludeHtmlIds: Liste der auszuschließenden ID-Attribute von HTML-Elementen. Die HTML-Elemente mit diesen ID-Attributen werden zusammen mit ihrem Inhalt ausgeschlossen.
Standardparser angeben
Wenn Sie beim Erstellen eines Datenspeichers das Objekt documentProcessingConfig einschließen, können Sie für diesen Datenspeicher einen Standardparser angeben. Wenn Sie documentProcessingConfig.defaultParsingConfig nicht angeben, wird der digitale Parser verwendet. Der digitale Parser wird auch verwendet, wenn der angegebene Parser für einen Dateityp nicht verfügbar ist.
REST
So legen Sie einen Standardparser fest: