Dataplex Universal Catalog 데이터 품질 태스크를 통해 BigQuery 및 Cloud Storage의 테이블 간에 데이터 품질 검사를 정의하고 실행할 수 있습니다. Dataplex Universal Catalog 데이터 품질 태스크를 사용하면 BigQuery 환경에 일반 데이터 컨트롤을 적용할 수도 있습니다.
Dataplex Universal Catalog 데이터 품질 태스크를 만들어야 하는 경우
Dataplex Universal Catalog 데이터 품질 태스크는 다음에서 도움이 될 수 있습니다.
- 데이터 프로덕션 파이프라인의 일부로 데이터를 검증합니다.
- 기대 수준에 따라 일상적으로 데이터 세트 품질을 모니터링합니다.
- 규제 요건을 충족하는 데이터 품질 보고서를 작성합니다.
이점
- 맞춤설정 가능한 사양. 유연성이 높은 YAML 구문을 사용해서 데이터 품질 규칙을 선언할 수 있습니다.
- 서버리스 구현. Dataplex Universal Catalog는 인프라 설정이 필요하지 않습니다.
- 제로 카피 및 자동 푸시다운. YAML 검사는 SQL로 변환되고 BigQuery로 푸시되므로, 데이터 복사가 수행되지 않습니다.
- 예약 가능한 데이터 품질 검사. Dataplex Universal Catalog의 서버리스 스케줄러를 통해 데이터 품질 검사를 예약하거나 파이프라인 통합을 위한 Cloud Composer와 같은 외부 스케줄러를 통해 Dataplex API를 사용할 수 있습니다.
- 관리된 환경. Dataplex Universal Catalog는 오픈소스 데이터 품질 엔진인 CloudDQ를 사용해서 데이터 품질 검사를 실행합니다. 하지만 Dataplex Universal Catalog는 데이터 품질 검사를 수행하기 위한 효율적인 관리형 환경을 제공합니다.
데이터 품질 태스크 작동 방식
다음 다이어그램은 Dataplex Universal Catalog 데이터 품질 태스크의 작동 방식을 보여줍니다.

- 사용자 입력
- YAML 사양: 사양 구문을 기반으로 데이터 품질 규칙을 정의하는 하나 이상의 YAML 파일 집합입니다. 사용자는 프로젝트의 Cloud Storage 버킷에 YAML 파일을 저장합니다. 사용자가 여러 규칙을 동시에 실행할 수 있으며, 이러한 규칙은 서로 다른 데이터 세트 간의 테이블 또는 Google Cloud프로젝트를 포함하여 여러 다른 BigQuery 테이블에 적용될 수 있습니다. 이 사양은 새 데이터 검증에 대해서만 증분 실행을 지원합니다. YAML 사양을 만들려면 사양 파일 만들기를 참조하세요.