Dataplex Universal Catalog te permite definir y medir la calidad de los datos de tus tablas de BigQuery. Puedes automatizar el análisis de datos, validar los datos según las reglas definidas y registrar alertas si los datos no cumplen los requisitos de calidad. La calidad de los datos automática te permite gestionar las reglas y las implementaciones de calidad de los datos como código, lo que mejora la integridad de las canalizaciones de producción de datos.
Para analizar datos en busca de anomalías, consulta Análisis de perfil de datos de Dataplex Universal Catalog. El análisis puede generar reglas de calidad de los datos. También puede usar reglas de calidad predefinidas o crear reglas personalizadas.
Dataplex Universal Catalog ofrece monitorización, solución de problemas y alertas de Cloud Logging integradas con la calidad de los datos automática.
Modelo conceptual
Un análisis de calidad de los datos es un tipo de análisis de datos de Dataplex Universal Catalog que valida los datos con un conjunto de reglas predefinidas. Un análisis de datos es una tarea de Dataplex Universal Catalog que toma muestras de datos de BigQuery y Cloud Storage, e infiere varios tipos de metadatos. Para medir la calidad de una tabla con la calidad de los datos automática, crea un objeto DataScan de tipo data quality. El análisis se ejecuta en una sola tabla de BigQuery.
El análisis usa recursos de un proyecto de inquilino de Google, por lo que no tienes que configurar tu propia infraestructura.
Para crear y usar un análisis de calidad de los datos, sigue estos pasos:
- Definir reglas de calidad de los datos
- Configurar la ejecución de reglas
- Analizar los resultados de los análisis de calidad de los datos
- Configurar la monitorización y las alertas
- Solucionar problemas de calidad de los datos
Definición de la regla
Las reglas de calidad de los datos asociadas a un análisis de calidad de los datos definen las expectativas de los datos. Puede crear reglas de calidad de los datos de las siguientes formas:
- Usar las recomendaciones de la elaboración de perfiles de datos de Dataplex Universal Catalog
- Usar las reglas predefinidas
- Crear reglas SQL personalizadas
Reglas predefinidas
Dataplex Universal Catalog admite las siguientes categorías de reglas predefinidas:
- A nivel de fila
En el caso de las reglas de categorías a nivel de fila, la expectativa se aplica a cada fila de datos. Cada fila supera o no la condición de forma independiente. Por ejemplo,
column_A_value < 1.En las comprobaciones a nivel de fila, debes especificar un umbral de aprobación. Si el porcentaje de filas que cumplen la regla es inferior al valor umbral, la regla falla.
- Agregar
En el caso de las reglas agregadas, la expectativa se aplica a un solo valor agregado en todos los datos. Por ejemplo,
Avg(someCol) >= 10. Para aprobarla, la comprobación debe dar como resultado el valor booleanotrue. Las reglas agregadas no proporcionan un recuento independiente de aprobaciones o fallos para cada fila.
En ambas categorías de reglas, puedes definir los siguientes parámetros:
- Columna a la que se aplica la regla
- Una dimensión
En la siguiente tabla se indican los tipos de reglas de nivel de fila y agregadas admitidos:
| Tipo de regla (nombre en la consola) Google Cloud |
Regla a nivel de fila o agregada | Descripción | Tipos de columna admitidos | Parámetros específicos de la regla |
|---|---|---|---|---|
RangeExpectation(Comprobación de intervalo) |
A nivel de fila | Comprueba si el valor está entre el mínimo y el máximo. | Todas las columnas de tipo numérico, de fecha y de marca de tiempo. | Obligatorio:
|
NonNullExpectation |