分割器處理器輸出內容包含輸入文件的分割資訊,包括信賴分數。Document AI API 會輸出 Document JSON 物件,輸出格式則會使用 entities 欄位表示文件分割。其他資訊取決於特定類型的分配器。
Entity.type指定文件分類。如需可辨識的文件類型完整清單,請參閱下列清單。Entity.pageAnchor.pageRefs[]指定包含各個子文件的頁面。請注意,pageRefs[].page是從零開始計算,也是document.pages[]欄位的索引。
使用生成式 AI 的分割器版本不適用於分割超過 500 頁的邏輯文件。如果邏輯文件超過 500 頁,您可以手動將其分割成兩份以上的文件,然後分別執行分割器,進行分類。
分隔符會標示頁面界線,但不會實際分割輸入文件。Document AI Toolbox SDK 提供公用程式函式,可根據分割器處理器的輸出內容分割輸入文件。
識別的文件類型
[1] 這個表單的對應剖析器不支援這個文件類型。也就是說,分割器可以識別及分類這類文件,但 Document AI 不提供剖析器來擷取資訊。
輸出範例
| 處理器 | 輸出範例 |
|---|
程式碼範例
分割器會找出頁面邊界,但不會實際分割輸入文件。您可以使用 Document AI 工具箱,依據頁面界線實際分割 PDF 檔案。下列程式碼範例會列印頁面範圍,而不分割 PDF:
Java
詳情請參閱 Document AI Java API 參考文件。
如要向 Document AI 進行驗證,請設定應用程式預設憑證。詳情請參閱「