Zielgruppe
Diese Anleitung soll Ihnen die Anwendungsentwicklung mithilfe der Dokumenttexterkennung der Google Cloud Vision API erleichtern. Es wird davon ausgegangen, dass Sie mit grundlegenden Programmierkonstrukten und ‑techniken vertraut sind. Aber auch als Einsteiger in die Programmierarbeit sollten Sie dieser Anleitung gut folgen und im Anschluss unter Verwendung der Referenzdokumentation für die Cloud Vision API einfache Anwendungen erstellen können.
Vorbereitung
- Richten Sie in der Google Cloud Console ein Cloud Vision API-Projekt ein.
Konfigurieren Sie Ihre Umgebung für die Verwendung von Standardanmeldedaten für Anwendungen.
Python
- Installieren Sie Python.
- Installieren Sie pip.
- Installieren Sie die Google Cloud-Clientbibliothek und die Python Imaging Library.
Bild mit Dokumenttext-OCR annotieren
In dieser Anleitung wird anhand einer einfachen Vision API-Anwendung die Verwendung der Anfrage DOCUMENT_TEXT_DETECTION sowie die Verarbeitung der Antwort fullTextAnnotation erläutert.
Eine fullTextAnnotation ist eine strukturierte hierarchische Antwort zum UTF‑8-Text, der aus dem Bild extrahiert wurde. Die Auflistung erfolgt nach Seiten→Blöcken→Absätzen→Wörtern→Symbolen:
Pageist eine Sammlung von Blöcken mit Metainformationen zur Seite: Größen und Auflösungen. Die X- und die Y‑Auflösung können unterschiedlich sein.Blocksteht für ein „logisches“ Element der Seite, beispielsweise einen Textbereich, ein Bild oder eine Spaltentrennung. Die Text- und Tabellenblöcke enthalten die wichtigsten Informationen für die Textextrahierung.Paragraphist eine strukturelle Texteinheit, die eine geordnete Wortfolge darstellt. Standardmäßig wird davon ausgegangen, dass zwischen Wörtern Worttrennungen vorhanden sind.Wordist die kleinste Texteinheit. Sie wird als eine Reihe von Symbolen dargestellt.Symbolsteht für ein Zeichen oder Satzzeichen.
Mit der fullTextAnnotation können auch URLs zu Webbildern angegeben werden, die teilweise oder vollständig mit dem Bild in der Anfrage übereinstimmen.
Vollständige Codeliste
Wir empfehlen, beim Lesen des Codes die Python-Referenz für die Cloud Vision API hinzuzuziehen.
Diese einfache Anwendung führt folgende Aufgaben aus:
- Importiert die für die Ausführung der Anwendung erforderlichen Bibliotheken
- Übergibt drei Argumente an die Funktion
main():image_file: die eingegebene Bilddatei, die annotiert werden solloutput_file: der Name der Ausgabedatei, in der mit Cloud Vision ein Ausgabebild mit vieleckigen Rahmen (Polygonen) generiert wird
- Erstellt die Instanz
ImageAnnotatorClientfür die Interaktion mit dem Dienst - Sendet die Anfrage und gibt eine Antwort zurück
- Erstellt ein Ausgabebild, in dem der Text eingerahmt ist