Quay lại bộ đề
Question #325 Topic 1
Your company has data assets across multiple Cloud Storage buckets and BigQuery datasets containing raw and processed data. The requirement is to establish a unified data governance framework that allows for centralized metadata discovery, data quality monitoring, and consistent security policy application across these various data stores without physically moving or duplicating the data. You need to implement a solution to achieve this federated governance. What should you do?
Công ty của bạn có các tài sản dữ liệu nằm trên nhiều bucket Cloud Storage và các tập dữ liệu BigQuery khác nhau chứa cả dữ liệu thô và dữ liệu đã qua xử lý. Yêu cầu đặt ra là thiết lập một khung quản trị dữ liệu thống nhất cho phép khám phá siêu dữ liệu tập trung, giám sát chất lượng dữ liệu và áp dụng chính sách bảo mật nhất quán trên các kho dữ liệu khác nhau này mà không cần di chuyển hoặc sao chép dữ liệu về mặt vật lý. Bạn cần triển khai một giải pháp để đạt được sự quản trị liên kết (federated governance) này. Bạn nên làm gì?
A
1. Export metadata out of Dataplex Universal Catalog by running a metadata export job.2. Implement Dataproc Metastore to manage table schemas and Apache Hive metastore for metadata discovery.3. Manage security using a combination of BigQuery row-level security and Cloud Storage policies.
1. Xuất siêu dữ liệu ra khỏi Dataplex Universal Catalog bằng cách chạy một công việc xuất siêu dữ liệu. 2. Triển khai Dataproc Metastore để quản lý lược đồ bảng và Apache Hive metastore để khám phá siêu dữ liệu. 3. Quản lý bảo mật bằng cách kết hợp bảo mật cấp dòng của BigQuery và các chính sách của Cloud Storage.
B
1. Use Dataplex to organize the BigQuery datasets and Cloud Storage buckets into lakes and zones.2. Use Dataplex for automated metadata discovery, centralized security policy management, data profiling, and data quality tasks.
1. Sử dụng Dataplex để tổ chức các tập dữ liệu BigQuery và các bucket Cloud Storage thành các hồ (lakes) và các vùng (zones). 2. Sử dụng Dataplex để tự động khám phá siêu dữ liệu, quản lý chính sách bảo mật tập trung, phân tích hồ sơ dữ liệu (data profiling) và thực hiện các tác vụ chất lượng dữ liệu.
C
1. Deploy a centralized Cloud SQL database to store metadata extracted from BigQuery and Cloud Storage using custom scripts.2. Integrate the database with Looker Studio for data discovery and visualization.3. Implement a custom policy engine using Cloud Run functions triggered by changes in IAM policies to enforce consistent security across projects.
1. Triển khai một cơ sở dữ liệu Cloud SQL tập trung để lưu trữ siêu dữ liệu được trích xuất từ BigQuery và Cloud Storage bằng các đoạn mã tùy chỉnh. 2. Tích hợp cơ sở dữ liệu với Looker Studio để khám phá và trực quan hóa dữ liệu. 3. Triển khai một công cụ chính sách tùy chỉnh bằng các hàm Cloud Run được kích hoạt bởi các thay đổi trong chính sách IAM để thực thi bảo mật nhất quán trên các dự án.
D
1. Create a Looker Studio dashboard on BigQuery INFORMATION_SCHEMA views to visualize and monitor data quality.2. Manage security using IAM policies at the project level, supplemented by BigQuery authorized views for granular access control.
1. Tạo một bảng điều khiển Looker Studio trên các chế độ xem INFORMATION_SCHEMA của BigQuery để trực quan hóa và giám sát chất lượng dữ liệu. 2. Quản lý bảo mật bằng các chính sách IAM ở cấp độ dự án, bổ sung bằng các chế độ xem được ủy quyền (authorized views) của BigQuery để kiểm soát truy cập chi tiết.
Giải thích & Tài liệu tham khảo
Để thiết lập một khung quản trị dữ liệu thống nhất (unified data governance framework) trên nhiều Cloud Storage buckets và BigQuery datasets mà không cần di chuyển dữ liệu:
- B là đáp án đúng: Dataplex là giải pháp quản trị dữ liệu thông minh và phân tán (data fabric) của Google Cloud. Nó cho phép tổ chức dữ liệu logic thành các hồ (lakes) và các vùng dữ liệu (data zones), tự động thu thập và khám phá siêu dữ liệu (metadata discovery), quản lý bảo mật tập trung (IAM, data masking) cũng như tự động giám sát chất lượng dữ liệu (data quality) mà không cần sao chép hay di chuyển dữ liệu gốc.
- A, C và D sai: Các phương án này yêu cầu tự xây dựng và bảo trì các hệ thống phụ trợ phức tạp (như viết script kéo metadata về Cloud SQL, cài đặt Dataproc Metastore riêng lẻ, tạo báo cáo Looker Studio thủ công), làm tăng đáng kể chi phí thiết lập và vận hành mà không có tính năng tích hợp thống nhất như Dataplex.
(Đáp án được gợi ý bởi AI)