Utilizzare la qualità dei dati automatica

Questo documento descrive come utilizzare le scansioni della qualità dei dati di Knowledge Catalog (in precedenza Dataplex Universal Catalog) per misurare, monitorare e gestire la qualità dei dati. Le scansioni della qualità dei dati ti aiutano ad automatizzare il processo di convalida dei dati per completezza, validità e coerenza.

Con le scansioni della qualità dei dati, puoi definire regole per verificare la presenza di valori mancanti, assicurarti che i valori corrispondano a un'espressione regolare o appartengano a un insieme, verificare l'unicità o utilizzare SQL personalizzato per convalide più complesse, come il rilevamento delle anomalie. Questo documento spiega come creare e gestire le analisi della qualità dei dati.

Scopri di più sulle scansioni della qualità dei dati. Scopri di più sul riutilizzo delle regole di qualità dei dati in più scansioni.

Prima di iniziare

  1. Abilitare l'API Dataplex.

    Ruoli richiesti per abilitare le API

    Per abilitare le API, devi disporre dell'autorizzazione serviceusage.services.enable. Se hai creato il progetto, probabilmente disponi già di questa autorizzazione tramite il ruolo Proprietario (roles/owner). In caso contrario, puoi ottenere questa autorizzazione tramite il ruolo Amministratore utilizzo dei servizi (roles/serviceusage.serviceUsageAdmin). Scopri come concedere i ruoli.

    Abilitare l'API

  2. (Facoltativo) Per generare suggerimenti per le regole di qualità dei dati in base ai risultati di una scansione del profilo di dati, crea ed esegui la scansione del profilo di dati.

Ruoli e autorizzazioni richiesti

Questa sezione descrive i ruoli e le autorizzazioni IAM necessari per utilizzare le scansioni della qualità dei dati di Knowledge Catalog.

Ruoli utente e autorizzazioni

Per ottenere le autorizzazioni necessarie per eseguire e gestire le scansioni della qualità dei dati, chiedi all'amministratore di concederti i seguenti ruoli IAM:

Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.

Questi ruoli predefiniti contengono le autorizzazioni necessarie per eseguire e gestire le scansioni della qualità dei dati. Per vedere quali sono esattamente le autorizzazioni richieste, espandi la sezione Autorizzazioni obbligatorie:

Autorizzazioni obbligatorie

Per eseguire e gestire le scansioni della qualità dei dati sono necessarie le seguenti autorizzazioni:

  • Esegui una scansione della qualità dei dati su una tabella BigQuery:
    • bigquery.jobs.create sul progetto per eseguire i job di scansione
    • bigquery.tables.get nella tabella BigQuery da scansionare
    • bigquery.tables.getData nella tabella BigQuery da scansionare
  • Pubblica i risultati della scansione della qualità dei dati in Knowledge Catalog:
    • bigquery.tables.update nella tabella scansionata
    • dataplex.entryGroups.useDataQualityScorecardAspect nel gruppo di voci @bigquery nella stessa posizione della tabella
  • Crea un DataScan: dataplex.datascans.create sul progetto
  • Elimina un DataScan: dataplex.datascans.delete sul progetto
  • Visualizza i metadati di DataScan: dataplex.datascans.get sul progetto
  • Visualizza i dettagli di DataScan, tra cui regole e risultati: dataplex.datascans.getData sul progetto
  • Elenca i DataScan: dataplex.datascans.list sul progetto
  • Esegui un DataScan: dataplex.datascans.run sul progetto
  • Aggiorna un DataScan: dataplex.datascans.update sul progetto
  • Recupera o imposta il criterio IAM su un DataScan:
    • dataplex.datascans.getIamPolicy sul progetto
    • dataplex.datascans.setIamPolicy sul progetto

Potresti anche ottenere queste autorizzazioni con ruoli personalizzati o altri ruoli predefiniti.

Se devi accedere a colonne protette da criteri di accesso a livello di colonna di BigQuery, devi disporre anche delle autorizzazioni per queste colonne.

Ruoli e autorizzazioni del account di servizio di Knowledge Catalog

Se non hai creato scansioni della qualità dei dati o del profilo di dati oppure non hai un lake Knowledge Catalog in questo progetto, crea un identificatore di servizio eseguendo: gcloud beta services identity create --service=dataplex.googleapis.com. Questo comando restituisce un identificatore del servizio Knowledge Catalog, se esistente.

Per assicurarti che il account di servizio Knowledge Catalog del progetto contenente la scansione della qualità dei dati disponga delle autorizzazioni necessarie per leggere i dati da varie origini ed esportare i risultati, chiedi all'amministratore di concedere i seguenti ruoli IAMaccount di servizioount Knowledge Catalog del progetto contenente la scansione della qualità dei dati:

  • Leggi i dati della tabella BigQuery: Visualizzatore dati BigQuery (roles/bigquery.dataViewer) nelle tabelle BigQuery da analizzare e in qualsiasi altra tabella a cui viene fatto riferimento nelle regole
  • Leggi i dati delle tabelle del catalogo REST Iceberg: Visualizzatore BigLake (roles/biglake.viewer) sulle tabelle del catalogo REST Iceberg da analizzare e su qualsiasi altra tabella a cui viene fatto riferimento nelle regole
  • Esporta i risultati della scansione in una tabella BigQuery: BigQuery Data Editor (roles/bigquery.dataEditor) nel set di dati e nella tabella dei risultati
  • Scansiona i dati BigQuery organizzati in un data lake Knowledge Catalog:
  • Scansiona una tabella esterna BigQuery da Cloud Storage: Visualizzatore oggetti Storage (roles/storage.objectViewer) nel bucket Cloud Storage

Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.

Questi ruoli predefiniti contengono le autorizzazioni necessarie per leggere i dati da varie origini ed esportare i risultati. Per vedere quali sono esattamente le autorizzazioni richieste, espandi la sezione Autorizzazioni obbligatorie:

Autorizzazioni obbligatorie

Per leggere i dati da varie origini ed esportare i risultati sono necessarie le seguenti autorizzazioni:

  • Leggi i dati della tabella BigQuery:
    • bigquery.tables.get nelle tabelle BigQuery
    • bigquery.tables.getData nelle tabelle BigQuery
  • Esporta i risultati della scansione in una tabella BigQuery:
    • bigquery.datasets.get sul set di dati e sulla tabella dei risultati
    • bigquery.tables.create sul set di dati e sulla tabella dei risultati
    • bigquery.tables.get sul set di dati e sulla tabella dei risultati
    • bigquery.tables.getData sul set di dati e sulla tabella dei risultati
    • bigquery.tables.update sul set di dati e sulla tabella dei risultati
    • bigquery.tables.updateData sul set di dati e sulla tabella dei risultati
  • Scansiona i dati BigQuery organizzati in un data lake Knowledge Catalog:
    • dataplex.lakes.list sulle risorse Dataplex
    • dataplex.lakes.get sulle risorse Dataplex
    • dataplex.zones.list sulle risorse Dataplex
    • dataplex.zones.get sulle risorse Dataplex
    • dataplex.entities.list sulle risorse Dataplex
    • dataplex.entities.get sulle risorse Dataplex
    • dataplex.operations.get sulle risorse Dataplex
  • Esegui la scansione di una tabella esterna BigQuery da Cloud Storage:
    • storage.buckets.get sul bucket Cloud Storage
    • storage.objects.get sul bucket Cloud Storage

L'amministratore potrebbe anche essere in grado di concedere al account di servizio Knowledge Catalog del progetto contenente la scansione della qualità dei dati queste autorizzazioni tramite ruoli personalizzati o altri