자동 데이터 품질 개요

Dataplex Universal Catalog를 사용하면 BigQuery 테이블의 데이터 품질을 정의하고 측정할 수 있습니다. 데이터 스캔을 자동화하고 정의된 규칙을 기준으로 데이터를 검증하며 데이터가 품질 요구사항을 충족하지 않으면 알림을 로깅할 수 있습니다. 자동 데이터 품질을 사용하면 데이터 품질 규칙과 배포를 코드로 관리하여 데이터 프로덕션 파이프라인 무결성을 향상시킬 수 있습니다.

데이터에서 이상치를 스캔하려면 Dataplex Universal Catalog 데이터 프로필 스캔을 참고하세요. 스캔을 통해 데이터 품질 규칙을 생성할 수 있습니다. 사전 정의된 품질 규칙을 사용하거나 커스텀 규칙을 빌드할 수도 있습니다.

Dataplex Universal Catalog는 자동 데이터 품질과 통합된 모니터링, 문제 해결, Cloud Logging 알림을 제공합니다.

개념 모델

데이터 품질 스캔은 테이블 데이터에 품질 규칙을 적용하여 결과를 보고합니다.

데이터 품질 스캔은 사전 정의된 규칙을 기준으로 데이터를 검증하는 Dataplex Universal Catalog 데이터 스캔의 한 유형입니다. 데이터 스캔은 BigQuery 및 Cloud Storage에서 데이터를 샘플링하고 다양한 유형의 메타데이터를 추론하는 Dataplex Universal Catalog 작업입니다. 자동 데이터 품질을 사용하여 테이블 품질을 측정하려면 data quality 유형의 DataScan 객체를 만듭니다. 스캔은 BigQuery 테이블 하나에서만 실행됩니다. 스캔은 Google 테넌트 프로젝트의 리소스를 사용하므로 자체 인프라를 설정하지 않아도 됩니다.

데이터 품질 스캔을 만들고 사용하는 단계는 다음과 같습니다.

  1. 데이터 품질 규칙 정의
  2. 규칙 실행 구성
  3. 데이터 품질 스캔 결과 분석
  4. 모니터링 및 알림 설정
  5. 데이터 품질 오류 문제 해결

규칙 정의

데이터 품질 스캔과 관련된 데이터 품질 규칙에서 데이터 기대치를 정의합니다. 다음과 같은 방법으로 데이터 품질 규칙을 만들 수 있습니다.

사전 정의된 규칙

Dataplex Universal Catalog는 다음과 같은 사전 정의된 규칙 카테고리를 지원합니다.

행 수준

행 수준 카테고리 규칙의 경우 각 데이터 행에 대해 예측이 적용됩니다. 각 행은 조건을 독립적으로 통과하거나 실패합니다. 예를 들면 column_A_value < 1입니다.

행 수준 검사를 수행하려면 통과 기준을 지정해야 합니다. 규칙을 통과하는 행의 비율이 기준 값 미만이면 규칙은 실패합니다.

집계

집계 규칙의 경우 예측은 전체 데이터에서 집계된 단일 값에 적용됩니다. 예를 들면 Avg(someCol) >= 10입니다. 통과하려면 검사가 불리언 true로 평가되어야 합니다. 집계 규칙에서는 각 행의 독립적인 통과 수나 실패 수를 제공하지 않습니다.

두 규칙 카테고리 모두에서 다음 매개변수를 설정할 수 있습니다.

다음 표에는 지원되는 행 수준 및 집계 규칙 유형이 나열되어 있습니다.

규칙 유형
( Google Cloud 콘솔에서의 이름)
행 수준 또는 집계 규칙 설명 지원되는 열 유형 규칙별 파라미터
RangeExpectation
(범위 검사)
행 수준 값이 최솟값과 최댓값 사이인지 확인합니다. 모든 숫자, 날짜, 타임스탬프 유형 열 필수:
  • 통과 기준 비율
  • min 또는 max 값: 값을 최소한 하나 이상 지정합니다.
선택사항:
  • strict min 사용 설정: 사용 설정하면 규칙 검사에서 '>=' 대신 '>'를 사용합니다.
  • strict max 사용 설정: 사용 설정하면 규칙 검사에서 '<=' 대신 '<'를 사용합니다.
  • ignore null 사용 설정: 사용 설정하면 규칙 검사에서 null 값이 무시됩니다.
NonNullExpectation
(Null 검사)
행 수준 열 값이 NULL이 아닌지 확인합니다. 지원되는 모든 열 유형 필수:
  • 통과 기준 비율
SetExpectation
(설정 검사)
행 수준 열의 값이 설정에 지정된 값 중 하나인지 확인합니다. 지원되는 모든 열 유형(RecordStruct 제외) 필수:
  • 확인할 문자열 값의 집합입니다.
  • 통과 기준 비율
선택사항:
  • ignore null 사용 설정: 사용 설정하면 규칙 검사에서 null 값이 무시됩니다.
RegexExpectation
(정규 표현식 검사)
행 수준 지정된 정규 표현식으로 값을 확인합니다. 문자열 필수:
  • 검사에 사용되는 정규 표현식 패턴입니다.
  • 통과 기준 비율
  • 참고: GoogleSQL은 re2 라이브러리를 사용하여 정규 표현식을 지원합니다. 정규 표현식 문법은 해당 문서를 참고하세요.
선택사항:
  • ignore null 사용 설정: 사용 설정하면 규칙 검사에서 null 값이 무시됩니다.
Uniqueness
(고유성 검사)
집계 열의 모든 값이 고유한지 확인합니다. 지원되는 모든 열 유형(RecordStruct 제외) 필수:
  • 지원되는 파라미터의 열 및 측정기준입니다.
선택사항:
  • ignore null 사용 설정: 사용 설정하면 규칙 검사에서 null 값이 무시됩니다.
StatisticRangeExpectation
(통계 검사)
집계 제공된 통계 측정이 예상 범위와 일치하는지 확인합니다. 지원되는 모든 숫자 열 유형입니다. 필수:
  • mean, min 또는 max 값: 값을 최소한 하나 이상 지정합니다.
선택사항:
  • strict min 사용 설정: 사용 설정하면 규칙 검사에서 '>=' 대신 '>'를 사용합니다.
  • strict max 사용 설정: 사용 설정하면 규칙 검사에서 '<=' 대신 '<'를 사용합니다.

지원되는 커스텀 SQL 규칙 유형

SQL 규칙은 커스텀 로직으로 검증을 확장할 수 있는 유연성을 제공합니다. 이러한 규칙은 다음 유형으로 제공됩니다.

규칙 유형 행 수준 또는 집계 규칙 설명 지원되는 열 유형 규칙별 파라미터