Información general sobre la calidad de los datos de Auto

Dataplex Universal Catalog te permite definir y medir la calidad de los datos de tus tablas de BigQuery. Puedes automatizar el análisis de datos, validar los datos según las reglas definidas y registrar alertas si los datos no cumplen los requisitos de calidad. La calidad de los datos automática te permite gestionar las reglas y las implementaciones de calidad de los datos como código, lo que mejora la integridad de las canalizaciones de producción de datos.

Para analizar datos en busca de anomalías, consulta Análisis de perfil de datos de Dataplex Universal Catalog. El análisis puede generar reglas de calidad de los datos. También puede usar reglas de calidad predefinidas o crear reglas personalizadas.

Dataplex Universal Catalog ofrece monitorización, solución de problemas y alertas de Cloud Logging integradas con la calidad de los datos automática.

Modelo conceptual

Un análisis de calidad de los datos aplica reglas de calidad a los datos de una tabla para generar un informe con los resultados.

Un análisis de calidad de los datos es un tipo de análisis de datos de Dataplex Universal Catalog que valida los datos con un conjunto de reglas predefinidas. Un análisis de datos es una tarea de Dataplex Universal Catalog que toma muestras de datos de BigQuery y Cloud Storage, e infiere varios tipos de metadatos. Para medir la calidad de una tabla con la calidad de los datos automática, crea un objeto DataScan de tipo data quality. El análisis se ejecuta en una sola tabla de BigQuery. El análisis usa recursos de un proyecto de inquilino de Google, por lo que no tienes que configurar tu propia infraestructura.

Para crear y usar un análisis de calidad de los datos, sigue estos pasos:

  1. Definir reglas de calidad de los datos
  2. Configurar la ejecución de reglas
  3. Analizar los resultados de los análisis de calidad de los datos
  4. Configurar la monitorización y las alertas
  5. Solucionar problemas de calidad de los datos

Definición de la regla

Las reglas de calidad de los datos asociadas a un análisis de calidad de los datos definen las expectativas de los datos. Puede crear reglas de calidad de los datos de las siguientes formas:

Reglas predefinidas

Dataplex Universal Catalog admite las siguientes categorías de reglas predefinidas:

A nivel de fila

En el caso de las reglas de categorías a nivel de fila, la expectativa se aplica a cada fila de datos. Cada fila supera o no la condición de forma independiente. Por ejemplo, column_A_value < 1.

En las comprobaciones a nivel de fila, debes especificar un umbral de aprobación. Si el porcentaje de filas que cumplen la regla es inferior al valor umbral, la regla falla.

Agregar

En el caso de las reglas agregadas, la expectativa se aplica a un solo valor agregado en todos los datos. Por ejemplo, Avg(someCol) >= 10. Para aprobarla, la comprobación debe dar como resultado el valor booleano true. Las reglas agregadas no proporcionan un recuento independiente de aprobaciones o fallos para cada fila.

En ambas categorías de reglas, puedes definir los siguientes parámetros:

  • Columna a la que se aplica la regla
  • Una dimensión

En la siguiente tabla se indican los tipos de reglas de nivel de fila y agregadas admitidos:

Tipo de regla
(nombre en la consola) Google Cloud
Regla a nivel de fila o agregada Descripción Tipos de columna admitidos Parámetros específicos de la regla
RangeExpectation
(Comprobación de intervalo)
A nivel de fila Comprueba si el valor está entre el mínimo y el máximo. Todas las columnas de tipo numérico, de fecha y de marca de tiempo. Obligatorio:
  • Porcentaje del umbral de aprobación
  • Valores de min o max: especifique al menos un valor.
Opcional:
  • Habilitar strict min: si está habilitada, la comprobación de la regla usa ">" en lugar de ">=".
  • Habilitar strict max: si está habilitada, la comprobación de la regla usa "<" en lugar de "<=".
  • Habilitar ignore null: si se habilita, los valores nulos se ignoran en la comprobación de la regla.
NonNullExpectation