目標對象
本教學課程的目標是協助您使用 Google Cloud Vision API 文件文字偵測功能開發應用程式。本教學課程假設您熟悉基本程式設計結構和技術,但即使您是程式設計新手,也應該能夠輕鬆完成本教學課程,然後使用 Cloud Vision API 參考說明文件建立基本應用程式。
必要條件
- 在 Google Cloud 控制台中設定 Cloud Vision API 專案。
設定環境,以便使用應用程式預設憑證。
Python
使用文件文字 OCR 為圖片加上註解
本教學課程會逐步引導您操作基本的 Vision API 應用程式,該應用程式會發出 DOCUMENT_TEXT_DETECTION 要求,然後處理 fullTextAnnotation
回應。
fullTextAnnotation 是從圖片擷取的 UTF-8 文字結構化階層式回應,依序為「頁面」→「區塊」→「段落」→「字詞」→「符號」:
Page是區塊的集合,以及頁面的中繼資訊:大小、解析度 (X 解析度和 Y 解析度可能不同)。Block代表網頁的「邏輯」元素,例如文字涵蓋的區域,或是欄之間的圖片或分隔符。文字和表格區塊包含擷取文字所需的主要資訊。Paragraph是文字的結構單元,代表依序排列的字詞。根據預設,系統會將斷字視為字詞分隔符。Word是最小的文字單位。並以符號陣列表示。Symbol代表字元或標點符號。
fullTextAnnotation 也可提供網頁圖片的網址,這些圖片與要求中的圖片部分或完全相符。
完整程式碼清單
閱讀程式碼時,建議您一併參閱 Cloud Vision API Python 參考資料。