Dataplex Universal Catalog vous permet de définir et d'évaluer la qualité des données de vos tables BigQuery. Vous pouvez automatiser l'analyse des données, les valider par rapport à des règles définies et enregistrer des alertes si vos données ne répondent pas aux exigences de qualité. La qualité automatique des données vous permet de gérer les règles et les déploiements de qualité des données en tant que code, ce qui améliore l'intégrité des pipelines de production de données.
Pour analyser les données à la recherche d'anomalies, consultez Analyse de profilage des données Dataplex Universal Catalog. L'analyse peut générer des règles de qualité des données. Vous pouvez également utiliser des règles de qualité prédéfinies ou créer des règles personnalisées.
Dataplex Universal Catalog fournit des fonctionnalités de surveillance, de dépannage et d'alerte Cloud Logging intégrées à la qualité automatique des données.
Modèle conceptuel
Une analyse de la qualité des données est un type d'analyse des données Dataplex Universal Catalog qui valide vos données par rapport à un ensemble de règles prédéfinies. Une analyse de données est un job Dataplex Universal Catalog qui échantillonne les données de BigQuery et Cloud Storage, et infère différents types de métadonnées. Pour mesurer la qualité d'une table à l'aide de la qualité automatique des données, vous créez un objet DataScan de type data quality. L'analyse ne s'exécute que sur une seule table BigQuery.
L'analyse utilise les ressources d'un projet locataire Google. Vous n'avez donc pas besoin de configurer votre propre infrastructure.
Pour créer et utiliser une analyse de la qualité des données, effectuez les opérations suivantes :
- Définir des règles de qualité des données
- Configurer l'exécution des règles
- Analyser les résultats de l'analyse de la qualité des données
- Configurer la surveillance et les alertes
- Résoudre les échecs liés à la qualité des données
Définition de la règle
Les règles de qualité des données associées à une analyse de la qualité des données définissent les attentes concernant les données. Vous pouvez créer des règles de qualité des données des différentes manières suivantes :
- Utiliser les recommandations du profil de données Dataplex Universal Catalog
- Utiliser les règles prédéfinies
- Créer des règles SQL personnalisées
Règles prédéfinies
Dataplex Universal Catalog est compatible avec les catégories de règles prédéfinies suivantes :
- Au niveau des lignes
Pour les règles de catégorie au niveau des lignes, l'attente est appliquée à chaque ligne de données. Chaque ligne réussit ou échoue indépendamment face à la condition. Par exemple :
column_A_value < 1.Les vérifications au niveau des lignes vous obligent à spécifier un seuil de réussite. Lorsque le pourcentage de lignes respectant la règle est inférieur à la valeur seuil, la règle échoue.
- Agrégat
Pour les règles d'agrégation, l'attente est appliquée à une seule valeur agrégée sur l'ensemble des données. Par exemple,
Avg(someCol) >= 10. Pour réussir, la vérification doit renvoyer la valeur booléennetrue. Les règles d'agrégation ne fournissent pas de nombre indépendant de réussites ou d'échecs pour chaque ligne.
Pour les deux catégories de règles, vous pouvez définir les paramètres suivants :
- Colonne à laquelle s'applique la règle
- Une dimension
Le tableau suivant liste les types de règles agrégées et au niveau des lignes compatibles :
| Type de règle (nom dans la console Google Cloud ) |
Règle au niveau des lignes ou agrégée | Description | Types de colonnes acceptés | Paramètres spécifiques aux règles |
|---|---|---|---|---|
RangeExpectation(Vérification de la plage) |
Au niveau des lignes | Vérifiez si la valeur est comprise entre le minimum et le maximum. |