במאמר הזה מוסבר איך ליצור, להציג ולנהל תובנות לגבי נתונים מובְנים. תובנות מבוססות-AI עוזרות לכם לחקור את הנתונים מהר יותר, כי הן יוצרות באופן אוטומטי תיאורים, תרשימי קשרים ושאילתות SQL ממטא-נתונים של טבלאות ושל מערכי נתונים.
ב-BigQuery Studio אפשר ליצור תובנות לגבי נתונים ב-BigQuery מערכי נתונים, טבלאות, תצוגות, Google Cloud טבלאות BigLake, טבלאות חיצוניות ב-BigQuery ומרחבי שמות של Apache Iceberg.
ב-Knowledge Catalog, אפשר ליצור תובנות לגבי נתונים של טבלאות ומרחבי שמות של Apache Iceberg, Apache Hive ו-SAP BDC שמנוהלים על ידי Lakehouse for Apache Iceberg של Google Cloud.
לפני שמתחילים
לפני שמשתמשים בתובנות לגבי נתונים, צריך לוודא שמתקיימים התנאים המוקדמים הבאים:
התפקידים הנדרשים
כדי לקבל את ההרשאות שדרושות לשימוש בתובנות מנתונים, אתם צריכים לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:
-
קבלת גישת קריאה בלבד לתובנות שנוצרו על ידי AI:
Dataplex DataScan DataViewer (
roles/dataplex.dataScanDataViewer) בפרויקט שמכיל את המשאב -
קריאת נתוני טבלאות של Apache Iceberg, Apache Hive או SAP BDC:
BigLake Viewer (
roles/biglake.viewer) במשאב -
פרסום תיאורים כהיבטים:
Dataplex Catalog Editor (
roles/dataplex.catalogEditor) במשאב -
פרסום שאילתות כהיבטים:
בעלים של רשומת Dataplex ושל EntryLink (
roles/dataplex.entryOwner) במשאב
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
התפקידים המוגדרים מראש כוללים את ההרשאות שנדרשות לשימוש בתובנות לגבי נתונים. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:
ההרשאות הנדרשות
כדי להשתמש בתובנות לגבי נתונים, צריך את ההרשאות הבאות:
-
dataplex.datascans.create -
dataplex.datascans.get -
dataplex.datascans.getData -
dataplex.datascans.run
יכול להיות שתקבלו את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.
הפעלת ממשקי ה-API
כדי להשתמש בתובנות לגבי נתונים, צריך להפעיל את ממשקי ה-API הבאים בפרויקט:
- Dataplex API
- BigQuery API
- Gemini for Google Cloud API
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק 'שימוש בשירות'' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים
מידע נוסף על הפעלת Gemini for Google Cloud API זמין במאמר בנושא הפעלת Gemini for Google Cloud API בפרויקט. Google Cloud
הכנת הנתונים
במקרה של Google Cloud טבלאות Lakehouse, צריך לוודא שהנתונים נמצאים ב-Cloud Storage ושיצרתם טבלת Google Cloud Lakehouse.
בטבלאות של קטלוג REST של Apache Iceberg, מוודאים שהטבלאות רשומות בקטלוג של זמן הריצה של Lakehouse.
יצירת תובנות ב-BigQuery
תובנות לגבי נתונים במערכי נתונים, בטבלאות, בתצוגות מפורטות, בטבלאות שלGoogle Cloud Lakehouse ובטבלאות חיצוניות של BigQuery נוצרות באמצעות Gemini ב-BigQuery, ואפשר ליצור אותן רק ב-BigQuery Studio.
קודם צריך להגדיר את Gemini ב-BigQuery, ואז ליצור תובנות. אחרי שיוצרים תובנות, אפשר לראות ולשנות אותן ב-Knowledge Catalog.
מידע נוסף על יצירת תובנות ב-BigQuery זמין במאמרים הבאים: