La fonctionnalité d'insights sur les données de Knowledge Catalog (anciennement Dataplex Universal Catalog) génère automatiquement des descriptions, des graphiques de relations et des requêtes SQL à partir des métadonnées de votre table et de votre ensemble de données. Ces informations vous aident à comprendre rapidement la structure, le contenu et les relations des données sans configuration manuelle approfondie. Pour en savoir plus, vous pouvez poser des questions complémentaires dans Data Canvas.
Lorsqu'ils explorent une nouvelle table inconnue, les analystes de données ont souvent du mal à savoir comment commencer à écrire des requêtes. Le problème peut impliquer des incertitudes concernant la structure des données et les approches clés dans les données. La fonctionnalité d'insights sur les données de Knowledge Catalog offre un moyen automatisé d'explorer et de comprendre vos données. Cela vous permet de découvrir des modèles, d'évaluer la qualité des données et d'effectuer des analyses statistiques.
Présentation
Les insights sur les données utilisent Gemini pour analyser vos métadonnées et générer les éléments suivants :
Descriptions : résumés générés par l'IA expliquant l'objectif de l'ensemble de données ou de l'espace de noms, la structure de la table et les détails de colonnes spécifiques.
Exemples de requêtes : requêtes SQL personnalisées conçues spécifiquement pour le schéma et le contenu de votre ensemble de données, de votre espace de noms ou de votre table.
Graphiques de relations : visualisations qui montrent les connexions et les dépendances entre différentes tables de votre ensemble de données ou de votre espace de noms.
Ressources compatibles
Les insights sur les données sont disponibles pour les types de données structurées suivants :
- Ensembles de données, tables et vues BigQuery
- Google Cloud Tables Lakehouse (y compris Apache Iceberg)
- Tables externes
- Tables du catalogue REST Apache Iceberg
- Espaces de noms Apache Iceberg (représentés sous forme d'ensembles de données dans BigQuery)
Exemple d'exécution d'insights
Les insights sur les données génèrent automatiquement des requêtes en langage naturel et leurs équivalents SQL en fonction des métadonnées d'une table.
Prenons l'exemple d'une table appelée telco_churn contenant les métadonnées suivantes :
| Nom du champ | Type |
|---|---|
| CustomerID | STRING |
| Sexe | STRING |
| Ancienneté | INT64 |
| InternetService | STRING |
| StreamingTV | STRING |
| OnlineBackup | STRING |
| Contrat | STRING |
| TechSupport | STRING |
| PaymentMethod | STRING |
| MonthlyCharges | FLOAT |
| Churn | BOOLEAN |
Voici quelques exemples de requêtes générées par les insights sur les données pour cette table :
Identifiez les clients qui sont abonnés à tous les services Premium et qui sont clients depuis plus de 50 mois.
SELECT CustomerID, Contract, Tenure FROM agentville_datasets.telco_churn WHERE OnlineBackup = 'Yes' AND TechSupport = 'Yes' AND StreamingTV = 'Yes' AND Tenure > 50;Identifiez le service Internet qui compte le plus de clients perdus.
SELECT InternetService, COUNT(DISTINCT CustomerID) AS total_customers FROM agentville_datasets.telco_churn WHERE Churn = TRUE GROUP BY InternetService ORDER BY total_customers DESC LIMIT 1;Identifiez les taux de perte d'utilisateurs par segment parmi les clients à fort potentiel.
SELECT Contract, InternetService, Gender, PaymentMethod, COUNT(DISTINCT CustomerID) AS total_customers, SUM(CASE WHEN Churn = TRUE THEN 1 ELSE 0 END) AS churned_customers, (SUM(CASE WHEN Churn = TRUE THEN 1 ELSE 0 END) / COUNT(DISTINCT CustomerID)) * 100 AS churn_rate FROM agentville_datasets.telco_churn WHERE MonthlyCharges > 100