Quay lại bộ đề
Question #131 Topic 1
You are designing a data mesh on Google Cloud with multiple distinct data engineering teams building data products. The typical data curation design pattern consists of landing files in Cloud Storage, transforming raw data in Cloud Storage and BigQuery datasets, and storing the final curated data product in BigQuery datasets. You need to configure Dataplex to ensure that each team can access only the assets needed to build their data products. You also need to ensure that teams can easily share the curated data product. What should you do?
Bạn đang thiết kế một mạng lưới dữ liệu (data mesh) trên Google Cloud với nhiều nhóm kỹ thuật dữ liệu (data engineering) riêng biệt đang xây dựng các sản phẩm dữ liệu. Mô hình thiết kế tinh chế dữ liệu điển hình bao gồm việc đưa các tệp vào Cloud Storage, biến đổi dữ liệu thô trong Cloud Storage và các dataset BigQuery, và lưu trữ sản phẩm dữ liệu đã được tinh chế cuối cùng trong các dataset BigQuery. Bạn cần cấu hình Dataplex để đảm bảo mỗi nhóm chỉ có thể truy cập các tài nguyên (assets) cần thiết để xây dựng sản phẩm dữ liệu của họ. Bạn cũng cần đảm bảo các nhóm có thể dễ dàng chia sẻ sản phẩm dữ liệu đã tinh chế. Bạn nên làm gì?
A
1. Create a single Dataplex virtual lake and create a single zone to contain landing, raw, and curated data.2. Provide each data engineering team access to the virtual lake.
1. Tạo một Dataplex virtual lake duy nhất và tạo một zone duy nhất chứa dữ liệu landing, dữ liệu thô (raw) và dữ liệu tinh chế (curated).
2. Cấp quyền truy cập virtual lake duy nhất này cho mỗi nhóm kỹ thuật dữ liệu.
B
1. Create a single Dataplex virtual lake and create a single zone to contain landing, raw, and curated data.2. Build separate assets for each data product within the zone.3. Assign permissions to the data engineering teams at the zone level.
1. Tạo một Dataplex virtual lake duy nhất và tạo một zone duy nhất chứa dữ liệu landing, dữ liệu thô và dữ liệu tinh chế.
2. Xây dựng các asset riêng biệt cho mỗi sản phẩm dữ liệu bên trong zone đó.
3. Gán quyền cho các nhóm kỹ thuật dữ liệu ở cấp độ zone.
C
1. Create a Dataplex virtual lake for each data product, and create a single zone to contain landing, raw, and curated data.2. Provide the data engineering teams with full access to the virtual lake assigned to their data product.
1. Tạo một Dataplex virtual lake cho mỗi sản phẩm dữ liệu, và tạo một zone duy nhất để chứa dữ liệu landing, dữ liệu thô và dữ liệu tinh chế.
2. Cấp cho các nhóm kỹ thuật dữ liệu quyền truy cập đầy đủ vào virtual lake được chỉ định cho sản phẩm dữ liệu của họ.
D
1. Create a Dataplex virtual lake for each data product, and create multiple zones for landing, raw, and curated data.2. Provide the data engineering teams with full access to the virtual lake assigned to their data product.
1. Tạo một Dataplex virtual lake cho mỗi sản phẩm dữ liệu, và tạo nhiều zone cho dữ liệu landing, dữ liệu thô và dữ liệu tinh chế.
2. Cấp cho các nhóm kỹ thuật dữ liệu quyền truy cập đầy đủ vào virtual lake được chỉ định cho sản phẩm dữ liệu của họ.
Giải thích & Tài liệu tham khảo
Trong mô hình Data Mesh, tính tự trị (autonomy) và phân tách miền dữ liệu (domain separation) là cốt lõi. Dataplex giúp triển khai điều này bằng cách sử dụng các Lake và Zone:
- Virtual Lake cho mỗi sản phẩm dữ liệu: Việc tạo một Dataplex Lake riêng cho mỗi sản phẩm dữ liệu đảm bảo ranh giới quản trị và bảo mật rõ ràng giữa các nhóm độc lập. Mỗi nhóm sẽ toàn quyền quản lý Lake của mình mà không ảnh hưởng hoặc truy cập được vào Lake của nhóm khác.
- Nhiều Zone (Landing, Raw, Curated) trong mỗi Lake: Phân chia thành nhiều vùng (zones) là một thực hành tốt nhất (best practice) của Dataplex để tổ chức dữ liệu theo trạng thái tinh chế. Vùng dữ liệu thô (raw zone) lưu trữ dữ liệu chưa xử lý, trong khi vùng tinh chế (curated zone) lưu trữ dữ liệu đã làm sạch và sẵn sàng cho phân tích. Việc phân vùng này giúp áp dụng các chính sách bảo mật, định nghĩa schema tự động và chính sách quản lý vòng đời dữ liệu một cách tối ưu nhất.
- Gán quyền truy cập: Cấp quyền cho mỗi nhóm kỹ thuật dữ liệu ở cấp độ Lake của họ cho phép họ tự do thao tác trên các assets (Cloud Storage bucket, BigQuery datasets) thuộc sản phẩm dữ liệu đó mà không vi phạm nguyên tắc đặc quyền tối thiểu (least privilege) đối với tài nguyên của nhóm khác.
(Đáp án được gợi ý bởi AI)