本頁面詳細說明 Document AI 提供的所有處理器。您可以依解決方案類型查看所有處理器的清單。
所有 Document AI 處理器都遵守資料處理與安全性條款。
詳情請參閱「管理處理器版本」說明文件。此外,除了整體產品的配額和限制外,還適用特定處理器限制。
數位化文字
Enterprise Document OCR (光學字元辨識)
| 說明 |
辨識及擷取不同類型文件中的文字。
這個處理器支援辨識和擷取文件中的文字,包括手寫文字,支援超過 200 種語言。處理器也會運用機器學習技術,根據文件內容的可讀性評估文件品質。
|
| 類別 |
數位化 |
| 函式 |
OCR、品質分析 |
| 發布階段 |
正式發布版 |
| 存取狀態 |
公開
lock_open
|
| 輸入 API |
OCR_PROCESSOR |
| 支援的語言 |
完整語言清單
| 語言名稱 |
BCP 47 代碼 |
指令碼 |
支援手寫 |
| 南非荷蘭文 |
af |
Latn |
|
| 阿爾巴尼亞文 |
sq |
Latn |
|
| 阿拉伯文 |
ar |
Arab |
|
| 亞美尼亞文 |
hy |
Armn |
|
| 白俄羅斯文 |
be |
Cyrl |
|
| 孟加拉文 |
bn |
Beng |
|
| 孟加拉文 |
bn |
Beng |
|
| 保加利亞文 |
bg |
Cyrl |
|
| 加泰隆尼亞文 |
ca |
Latn |
|
| 中文 |
zh |
Hani |
|
| 克羅埃西亞文 |
hr |
Latn |
|
| 捷克文 |
cs |
Latn |
|
| 丹麥文 |
da |
Latn |
|
| 荷蘭文 |
nl |
Latn |
|
| 英文 |
en |
Latn |
|
| 愛沙尼亞文 |
et |
Latn |
|
| 菲律賓文 |
fil |
Latn |
|
| 芬蘭文 |
fi |
Latn |
|
| 法文 |
fr |
Latn |
|
| 德文 |
de |
Latn |
|
| 希臘文 |
el |
Grek |
|
| 古吉拉特文 |
gu |
Gujr |
|
| 希伯來文 |
iw |
Hebr |
|
| 北印度文 |
hi |
Deva |
|
| 匈牙利文 |
hu |
Latn |
|
| 冰島文 |
is |
Latn |
|
| 印尼文 |
id |
Latn |
|
| 義大利文 |
it |
Latn |
|
| 日文 |
ja |
Jpan |
|
| 卡納達文 |
kn |
Knda |
|
| 高棉文 |
km |
Khmr |
|
| 韓文 |
ko |
Kore |
|
| 寮文 |
lo |
Laoo |
|
| 拉脫維亞文 |
lv |
Latn |
|
| 立陶宛文 |
lt |
Latn |
|
| 馬其頓文 |
mk |
Cyrl |
|
| 馬來文 |
ms |
Latn |
|
| 馬拉雅拉姆文 |
ml |
Mlym |
|
| 馬拉地文 |
mr |
Deva |
|
| 尼泊爾文 |
ne |
Deva |
|
| 挪威文 |
no |
Latn |
|
| 波斯文 |
fa |
Arab |
|
| 波蘭文 |
pl |
Latn |
|
| 葡萄牙文 (葡萄牙和巴西) |
pt |
Latn |
|
| 旁遮普文 |
pa |
Guru |
|
| 羅馬尼亞文 |
ro |
Latn |
|
| 俄文 |
ru |
Cyrl |
|
| 塞爾維亞文 |
sr |
Cyrl |
|
| 斯洛伐克文 |
sk |
Latn |
|
| 斯洛維尼亞文 |
sl |
Latn |
|
| 西班牙文 |
es |
Latn |
|
| 瑞典文 |
sv |
Latn |
|
| 塔加路文 |
tl |
Latn |
|
| 泰米爾文 |
ta |
Taml |
|
| 泰盧固文 |
te |
Telu |
|
| 泰文 |
th |
Thai |
|
| 土耳其文 |
tr |
Latn |
|
| 烏克蘭文 |
uk |
Cyrl |
|
| 越南文 |
vi |
Latn |
|
| 意第緒語 |
yi |
Hebr |
|
|
| 處理器版本 |
| 版本 ID |
發布頻道 |
版本成熟度 |
說明 |
pretrained-ocr-v1.2-2022-11-10 |
穩定 |
GA
|
凍結的 v1.0 模型版本:模型檔案、設定和二進位檔,這些都是在容器映像檔中凍結的版本快照,最多可保留 18 個月。
|
pretrained-ocr-v2.0-2023-06-02 |
穩定 |
GA
|
專為文件用途設計的實際工作環境模型。包括所有 OCR 附加元件的存取權。 |
pretrained-ocr-v2.1-2024-08-07 |
穩定 |
GA
|
2.1 版的主要改良項目包括:提升印刷文字辨識能力、更精準地偵測核取方塊,以及更準確地判讀閱讀順序。
|
pretrained-ocr-v2.1.1-2025-01-31 |
候選版本 |
公開預先發布版
|
v2.1.1 與 V2.1 類似,適用於所有區域,但 US、EU 和 asia-southeast1 除外。
|
詳情請參閱「管理處理器版本」。
|
| 配額與限制 |
| 頁面數量上限 (線上/同步要求): |
15 |
| 頁數上限 (批次/離線/非同步要求): |
500 |
| 頁數上限 (無圖片模式的線上/同步要求): |
30 |
|
| Uptraining |
|
| 輸入檔案範例 |
在新視窗中開啟。
|
| 輸出內容範例 |
在新視窗中開啟。
|
| 支援的地區 |
asia-south1
asia-southeast1
australia-southeast1
eu
europe-west2
europe-west3
northamerica-northeast1
us
|
| 更多資訊 |
Enterprise Document OCR
|
如需用於訓練的已加上標籤和未加上標籤的範例資料集,請參閱範例資料集。
Custom Extractor
| 說明 |
使用生成式 AI 或自訂模型從文件中擷取欄位;微調模型,準確擷取文件中的資料。
|
| 類別 |
擷取 |
| 函式 |
OCR、實體擷取 |
| 發布階段 |
正式發布版 |
| 存取狀態 |
公開
lock_open
|
| 輸入 API |
CUSTOM_EXTRACTION_PROCESSOR |
| 注意事項 |
如果使用生成式 AI 擷取內容,請注意: - 目前僅正式支援英文。
- 適用地區為
US、EU、northamerica-northeast1 和 asia-southeast1。
|
| 支援的語言 |
完整語言清單
| 語言名稱 |
BCP 47 代碼 |
指令碼 |
支援手寫 |
| 南非荷蘭文 |
af |
Latn |
|
| 阿拉伯文 |
ar |
Arab |
|
| 亞塞拜然文 |
az |
Latn |
|
| 亞塞拜然文 (西里爾字母) |
az-Cyrl |
Cyrl |
|
| 白俄羅斯文 |
be |
Cyrl |
|
| 保加利亞文 |
bg |
Cyrl |
|
| 波士尼亞文 |
bs |
Latn |
|
| 加泰隆尼亞文 |
ca |
Latn |
|
| 宿霧文 |
ceb |
Latn |
|
| 捷克文 |
cs |
Latn |
|
| 威爾斯文 |
cy |
Latn |
|
| 丹麥文 |
da |
Latn |
|
| 德文 |
de |
Latn |
|
| 希臘文 |
el |
Grek |
|
| 英文 |
en |
Latn |
|
| 世界文 |
eo |
Latn |
|
| 西班牙文 |
es |
Latn |
|
| 愛沙尼亞文 |
et |
Latn |
|
| 巴斯克文 |
eu |
Latn |
|
| 波斯文 |
fa |
Arab |
|
| 芬蘭文 |
fi |
Latn |
|
| 菲律賓文 |
fil |
Latn |
|
| 法文 |
fr |
Latn |
|
| 愛爾蘭文 |
ga |
Latn |
|
| 加里西亞文 |
gl |
Latn |
|
| 北印度文 |
hi |
Deva |
|
| 克羅埃西亞文 |
hr |
Latn |
|
| 海地克里奧爾文 |
ht |
Latn |
|
| 匈牙利文 |
hu |
Latn |
| |