Quay lại bộ đề
Question #208 Topic 1
You migrated your on-premises Apache Hadoop Distributed File System (HDFS) data lake to Cloud Storage. The data scientist team needs to process the data by using Apache Spark and SQL. Security policies need to be enforced at the column level. You need a cost-effective solution that can scale into a data mesh. What should you do?
Bạn đã di chuyển hồ dữ liệu từ Hệ thống tệp phân tán Apache Hadoop (HDFS) on-premises của mình sang Cloud Storage. Nhóm khoa học dữ liệu cần xử lý dữ liệu bằng Apache Spark và SQL. Các chính sách bảo mật cần được áp dụng ở cấp độ cột (column level). Bạn cần một giải pháp tối ưu chi phí và có thể mở rộng thành một lưới dữ liệu (data mesh). Bạn nên làm thế nào?
A
1. Deploy a long-living Dataproc cluster with Apache Hive and Ranger enabled.2. Configure Ranger for column level security.3. Process with Dataproc Spark or Hive SQL.
1. Triển khai một cụm Dataproc hoạt động lâu dài có bật Apache Hive và Ranger. 2. Cấu hình Ranger để bảo mật ở cấp độ cột. 3. Xử lý bằng Dataproc Spark hoặc Hive SQL.
B
1. Define a BigLake table.2. Create a taxonomy of policy tags in Data Catalog.3. Add policy tags to columns.4. Process with the Spark-BigQuery connector or BigQuery SQL.
1. Định nghĩa một bảng BigLake. 2. Tạo một phân loại (taxonomy) các thẻ chính sách (policy tags) trong Data Catalog. 3. Gán các thẻ chính sách vào các cột. 4. Xử lý bằng trình kết nối Spark-BigQuery hoặc BigQuery SQL.
C
1. Load the data to BigQuery tables.2. Create a taxonomy of policy tags in Data Catalog.3. Add policy tags to columns.4. Process with the Spark-BigQuery connector or BigQuery SQL.
1. Tải dữ liệu vào các bảng BigQuery. 2. Tạo một phân loại (taxonomy) các thẻ chính sách (policy tags) trong Data Catalog. 3. Gán các thẻ chính sách vào các cột. 4. Xử lý bằng trình kết nối Spark-BigQuery hoặc BigQuery SQL.
D
1. Apply an Identity and Access Management (IAM) policy at the file level in Cloud Storage.2. Define a BigQuery external table for SQL processing.3. Use Dataproc Spark to process the Cloud Storage files.
1. Áp dụng chính sách Quản lý quyền truy cập và nhận dạng (IAM) ở cấp độ tệp trong Cloud Storage. 2. Định nghĩa một bảng ngoài (external table) BigQuery để xử lý SQL. 3. Sử dụng Dataproc Spark để xử lý các tệp trên Cloud Storage.
Giải thích & Tài liệu tham khảo
Yêu cầu đặt ra là thiết lập bảo mật cấp cột (column-level security) cho dữ liệu lưu trên Cloud Storage được truy vấn qua Spark/SQL, đồng thời tối ưu hóa chi phí và hỗ trợ khả năng mở rộng Data Mesh:
- Lựa chọn B đúng:
- BigLake cho phép BigQuery quản lý dữ liệu lưu trữ trên Cloud Storage dưới dạng bảng ngoài có cấu trúc và có thể áp dụng các cơ chế kiểm soát quyền truy cập chi tiết cấp hàng và cột (row/column-level security) của BigQuery.
- Bằng cách sử dụng policy tags từ Data Catalog để gắn nhãn bảo mật cấp cột, bạn đảm bảo dữ liệu nhạy cảm được bảo vệ an toàn.
- Nhóm khoa học dữ liệu có thể dễ dàng truy cập dữ liệu này bằng Spark (qua Spark-BigQuery connector) hoặc bằng SQL mà vẫn tuân thủ chính sách bảo mật mà không cần nạp dữ liệu vật lý vào BigQuery.
- Lựa chọn A sai: Việc tự vận hành một cụm Dataproc chạy lâu dài (long-lived) kết hợp với Apache Hive và Ranger rất tốn kém chi phí hạ tầng và công sức bảo trì.
- Lựa chọn C sai: Nạp toàn bộ dữ liệu hồ (terabytes/petabytes) vào bảng BigQuery gốc sẽ làm tăng đáng kể chi phí lưu trữ dữ liệu.
- Lựa chọn D sai: Chính sách IAM trên Cloud Storage chỉ có thể phân quyền ở cấp độ bucket hoặc đối tượng (file), không thể thực hiện phân quyền sâu xuống cấp cột bên trong tệp dữ liệu.
(Đáp án được gợi ý bởi AI)