Để xây dựng kho lưu trữ dữ liệu lịch sử chứa nhiều định dạng khác nhau bao gồm cả dữ liệu phi cấu trúc (PDF) và dữ liệu cấu trúc (CSV, Avro) để nhiều công cụ (Dataproc, BigQuery, Compute Engine) truy cập trực tiếp, đồng thời tối đa hóa tính sẵn sàng (availability):
- Multi-regional Cloud Storage bucket là lựa chọn hoàn hảo. Cloud Storage là kho lưu trữ đối tượng thống nhất, hỗ trợ mọi loại định dạng tệp. Cấu hình đa vùng (multi-regional) mang lại mức độ sẵn sàng cao nhất (99.95% SLA) nhờ cơ chế sao lưu địa lý tự động. Các dịch vụ Dataproc (qua GCS connector), BigQuery (qua external tables), và Compute Engine đều có thể đọc dữ liệu trực tiếp từ đây một cách dễ dàng.
- Lựa chọn A sai: Lưu trữ trên HDFS của Dataproc yêu cầu duy trì cụm máy ảo Dataproc chạy liên tục, gây tốn kém chi phí lớn và tính sẵn sàng của HDFS tự quản trị thấp hơn so với Cloud Storage.
- Lựa chọn B sai: BigQuery không thể lưu trữ trực tiếp các định dạng phi cấu trúc như tệp PDF để các công cụ khác truy cập trực tiếp.
- Lựa chọn C sai: Bucket vùng (regional) có tính sẵn sàng (99.9% SLA) thấp hơn so với multi-regional bucket (99.95% SLA).
(Đáp án được gợi ý bởi AI)