קהל
המדריך הזה נועד לעזור לכם לפתח אפליקציות באמצעות Google Cloud Vision API Document Text Detection. המדריך מניח שיש לכם היכרות עם מבנים וטכניקות תכנות בסיסיים, אבל גם אם אתם מתחילים בתחום התכנות, תוכלו לעקוב אחרי המדריך ולהריץ אותו בלי קושי, ואז להשתמש במאמרי העזרה של Cloud Vision API כדי ליצור אפליקציות בסיסיות.
דרישות מוקדמות
- מגדירים פרויקט Cloud Vision API במסוף Google Cloud .
מגדירים את הסביבה לשימוש ב-Application Default Credentials.
Python
- מתקינים את Python.
- מתקינים את pip.
- מתקינים את ספריית הלקוח של Google Cloud ואת Python Imaging Library.
הוספת הערות לתמונה באמצעות OCR של טקסט במסמך
במדריך הזה מוסבר איך ליצור אפליקציה בסיסית של Vision API ששולחת DOCUMENT_TEXT_DETECTION בקשה ואז מעבדת את fullTextAnnotation
התגובה.
fullTextAnnotation היא תשובה היררכית מובנית לטקסט UTF-8
שחולץ מהתמונה, והיא מאורגנת כך:
דפים→בלוקים→פסקאות→מילים→סמלים:
Pageהוא אוסף של בלוקים, בתוספת מידע על הדף: גדלים, רזולוציות (רזולוציית X ורזולוציית Y עשויות להיות שונות).
Blockמייצג רכיב אחד 'לוגי' בדף – לדוגמה, אזור שמכוסה בטקסט, תמונה או קו הפרדה בין עמודות. בלוקים של טקסט וטבלה מכילים את המידע העיקרי שנדרש לחילוץ הטקסט.
Paragraphהיא יחידה מבנית של טקסט שמייצגת רצף מסודר של מילים. כברירת מחדל, המילים נחשבות מופרדות על ידי מעברי מילים.
Wordהיא יחידת הטקסט הקטנה ביותר. הוא מיוצג כמערך של סמלים.
Symbolמייצג תו או סימן פיסוק.
בנוסף, fullTextAnnotation יכול לספק כתובות URL לתמונות באינטרנט שתואמות באופן חלקי או מלא לתמונה שבבקשה.
רשימת קוד מלאה
במהלך הקריאה של הקוד, מומלץ לעיין בהפניה ל-Cloud Vision API Python.