Lưu ý: Câu hỏi này bị lỗi hiển thị lựa chọn trong đề thi gốc (câu hỏi về bảo vệ PII của ngân hàng, nhưng các lựa chọn lại thuộc về câu hỏi trường hợp sử dụng Flowlogistic khi dùng BigQuery làm hệ thống phân tích chính và cho phép Hadoop/Spark kế thừa truy cập dữ liệu chung).
Tuy nhiên, dựa trên các lựa chọn hiện tại:
Để lưu trữ dữ liệu chung cho cả BigQuery và các workload Apache Hadoop/Spark cũ trên Google Cloud:
- C (Lưu trữ dữ liệu chung được mã hóa dưới dạng Avro trong Google Cloud Storage) là lựa chọn thích hợp nhất. Việc lưu trữ dữ liệu dưới dạng tệp Avro trên Cloud Storage cho phép cả BigQuery (truy vấn trực tiếp hoặc nạp vào) và Hadoop/Spark trên Cloud Dataproc (sử dụng Cloud Storage connector) có thể cùng truy cập dữ liệu một cách hiệu quả và tiết kiệm chi phí.
- A & B sai: Lưu trữ trong BigQuery không cho phép các workload Hadoop/Spark cũ (chạy bên ngoài hoặc không dùng connector trực tiếp) truy cập dữ liệu chung một cách dễ dàng và hiệu quả bằng Cloud Storage.
- D sai: Lưu trữ trong HDFS của cụm Dataproc khiến dữ liệu bị cô lập trong cụm đó và khó tích hợp với BigQuery, đồng thời tăng chi phí lưu trữ vì không thể tắt cụm Dataproc khi không sử dụng.
(Đáp án được gợi ý bởi AI)