Questo documento descrive come utilizzare le scansioni della qualità dei dati di Knowledge Catalog (in precedenza Dataplex Universal Catalog) per misurare, monitorare e gestire la qualità dei dati. Le scansioni della qualità dei dati ti aiutano ad automatizzare il processo di convalida dei dati per completezza, validità e coerenza.
Con le scansioni della qualità dei dati, puoi definire regole per verificare la presenza di valori mancanti, assicurarti che i valori corrispondano a un'espressione regolare o appartengano a un insieme, verificare l'unicità o utilizzare SQL personalizzato per convalide più complesse, come il rilevamento delle anomalie. Questo documento spiega come creare e gestire le analisi della qualità dei dati.
Scopri di più sulle scansioni della qualità dei dati. Scopri di più sul riutilizzo delle regole di qualità dei dati in più scansioni.
Prima di iniziare
-
Abilitare l'API Dataplex.
Ruoli richiesti per abilitare le API
Per abilitare le API, devi disporre dell'autorizzazione
serviceusage.services.enable. Se hai creato il progetto, probabilmente disponi già di questa autorizzazione tramite il ruolo Proprietario (roles/owner). In caso contrario, puoi ottenere questa autorizzazione tramite il ruolo Amministratore utilizzo dei servizi (roles/serviceusage.serviceUsageAdmin). Scopri come concedere i ruoli. - (Facoltativo) Per generare suggerimenti per le regole di qualità dei dati in base ai risultati di una scansione del profilo di dati, crea ed esegui la scansione del profilo di dati.
Ruoli e autorizzazioni richiesti
Questa sezione descrive i ruoli e le autorizzazioni IAM necessari per utilizzare le scansioni della qualità dei dati di Knowledge Catalog.
Ruoli utente e autorizzazioni
Per ottenere le autorizzazioni necessarie per eseguire e gestire le scansioni della qualità dei dati, chiedi all'amministratore di concederti i seguenti ruoli IAM:
-
Esegui una scansione della qualità dei dati su una tabella BigQuery:
- Utente job BigQuery (
roles/bigquery.jobUser) sul progetto per eseguire job di scansione - Visualizzatore dati BigQuery (
roles/bigquery.dataViewer) nella tabella BigQuery da scansionare
- Utente job BigQuery (
-
Pubblica i risultati della scansione della qualità dei dati in Knowledge Catalog:
- Editor dati BigQuery (
roles/bigquery.dataEditor) nella tabella scansionata - Editor di Dataplex Catalog (
roles/dataplex.catalogEditor) nel gruppo di voci@bigquerynella stessa posizione della tabella
- Editor dati BigQuery (
-
Esegui attività specifiche sulle risorse
DataScan:- Dataplex DataScan Administrator (
roles/dataplex.dataScanAdmin) sul progetto per l'accesso completo - Dataplex DataScan Creator (
roles/dataplex.dataScanCreator) sul progetto per creare scansioni - Dataplex DataScan Editor (
roles/dataplex.dataScanEditor) sul progetto per l'accesso in scrittura - Visualizzatore Dataplex DataScan (
roles/dataplex.dataScanViewer) sul progetto per leggere i metadati della scansione - Dataplex DataScan DataViewer (
roles/dataplex.dataScanDataViewer) sul progetto per leggere i dati di scansione, incluse regole e risultati
- Dataplex DataScan Administrator (
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Questi ruoli predefiniti contengono le autorizzazioni necessarie per eseguire e gestire le scansioni della qualità dei dati. Per vedere quali sono esattamente le autorizzazioni richieste, espandi la sezione Autorizzazioni obbligatorie:
Autorizzazioni obbligatorie
Per eseguire e gestire le scansioni della qualità dei dati sono necessarie le seguenti autorizzazioni:
-
Esegui una scansione della qualità dei dati su una tabella BigQuery:
-
bigquery.jobs.createsul progetto per eseguire i job di scansione -
bigquery.tables.getnella tabella BigQuery da scansionare -
bigquery.tables.getDatanella tabella BigQuery da scansionare
-
-
Pubblica i risultati della scansione della qualità dei dati in Knowledge Catalog:
-
bigquery.tables.updatenella tabella scansionata -
dataplex.entryGroups.useDataQualityScorecardAspectnel gruppo di voci@bigquerynella stessa posizione della tabella
-
-
Crea un
DataScan:dataplex.datascans.createsul progetto -
Elimina un
DataScan:dataplex.datascans.deletesul progetto -
Visualizza i metadati di
DataScan:dataplex.datascans.getsul progetto -
Visualizza i dettagli di
DataScan, tra cui regole e risultati:dataplex.datascans.getDatasul progetto -
Elenca i
DataScan:dataplex.datascans.listsul progetto -
Esegui un
DataScan:dataplex.datascans.runsul progetto -
Aggiorna un
DataScan:dataplex.datascans.updatesul progetto -
Recupera o imposta il criterio IAM su un
DataScan:-
dataplex.datascans.getIamPolicysul progetto -
dataplex.datascans.setIamPolicysul progetto
-
Potresti anche ottenere queste autorizzazioni con ruoli personalizzati o altri ruoli predefiniti.
Se devi accedere a colonne protette da criteri di accesso a livello di colonna di BigQuery, devi disporre anche delle autorizzazioni per queste colonne.
Ruoli e autorizzazioni del account di servizio di Knowledge Catalog
Se non hai creato scansioni della qualità dei dati o del profilo di dati oppure
non hai un lake Knowledge Catalog in questo progetto, crea un
identificatore di servizio eseguendo:
gcloud beta services identity create --service=dataplex.googleapis.com.
Questo comando restituisce un identificatore del servizio Knowledge Catalog, se esistente.
Per assicurarti che il account di servizio Knowledge Catalog del progetto contenente la scansione della qualità dei dati disponga delle autorizzazioni necessarie per leggere i dati da varie origini ed esportare i risultati, chiedi all'amministratore di concedere i seguenti ruoli IAMaccount di servizioount Knowledge Catalog del progetto contenente la scansione della qualità dei dati:
-
Leggi i dati della tabella BigQuery:
Visualizzatore dati BigQuery (
roles/bigquery.dataViewer) nelle tabelle BigQuery da analizzare e in qualsiasi altra tabella a cui viene fatto riferimento nelle regole -
Leggi i dati delle tabelle del catalogo REST Iceberg:
Visualizzatore BigLake (
roles/biglake.viewer) sulle tabelle del catalogo REST Iceberg da analizzare e su qualsiasi altra tabella a cui viene fatto riferimento nelle regole -
Esporta i risultati della scansione in una tabella BigQuery:
BigQuery Data Editor (
roles/bigquery.dataEditor) nel set di dati e nella tabella dei risultati -
Scansiona i dati BigQuery organizzati in un data lake Knowledge Catalog:
- Dataplex Metadata Reader (
roles/dataplex.metadataReader) sulle risorse Dataplex - Dataplex Viewer (
roles/dataplex.viewer) sulle risorse Dataplex
- Dataplex Metadata Reader (
-
Scansiona una tabella esterna BigQuery da Cloud Storage:
Visualizzatore oggetti Storage (
roles/storage.objectViewer) nel bucket Cloud Storage
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Questi ruoli predefiniti contengono le autorizzazioni necessarie per leggere i dati da varie origini ed esportare i risultati. Per vedere quali sono esattamente le autorizzazioni richieste, espandi la sezione Autorizzazioni obbligatorie:
Autorizzazioni obbligatorie
Per leggere i dati da varie origini ed esportare i risultati sono necessarie le seguenti autorizzazioni:
-
Leggi i dati della tabella BigQuery:
-
bigquery.tables.getnelle tabelle BigQuery -
bigquery.tables.getDatanelle tabelle BigQuery
-
-
Esporta i risultati della scansione in una tabella BigQuery:
-
bigquery.datasets.getsul set di dati e sulla tabella dei risultati -
bigquery.tables.createsul set di dati e sulla tabella dei risultati -
bigquery.tables.getsul set di dati e sulla tabella dei risultati -
bigquery.tables.getDatasul set di dati e sulla tabella dei risultati -
bigquery.tables.updatesul set di dati e sulla tabella dei risultati -
bigquery.tables.updateDatasul set di dati e sulla tabella dei risultati
-
-
Scansiona i dati BigQuery organizzati in un data lake Knowledge Catalog:
-
dataplex.lakes.listsulle risorse Dataplex -
dataplex.lakes.getsulle risorse Dataplex -
dataplex.zones.listsulle risorse Dataplex -
dataplex.zones.getsulle risorse Dataplex -
dataplex.entities.listsulle risorse Dataplex -
dataplex.entities.getsulle risorse Dataplex -
dataplex.operations.getsulle risorse Dataplex
-
-
Esegui la scansione di una tabella esterna BigQuery da Cloud Storage:
-
storage.buckets.getsul bucket Cloud Storage -
storage.objects.getsul bucket Cloud Storage
-
L'amministratore potrebbe anche essere in grado di concedere al account di servizio Knowledge Catalog del progetto contenente la scansione della qualità dei dati queste autorizzazioni tramite ruoli personalizzati o altri