Quay lại bộ đề
Question #115 Topic 1
You have a petabyte of analytics data and need to design a storage and processing platform for it. You must be able to perform data warehouse-style analytics on the data in Google Cloud and expose the dataset as files for batch analysis tools in other cloud providers. What should you do?
Bạn có một petabyte dữ liệu phân tích và cần thiết kế một nền tảng lưu trữ và xử lý cho lượng dữ liệu này. Bạn phải có khả năng thực hiện các phân tích kiểu kho dữ liệu (data warehouse-style analytics) trên Google Cloud và chia sẻ tập dữ liệu đó dưới dạng các tệp tin cho các công cụ phân tích hàng loạt ở các nhà cung cấp đám mây khác. Bạn nên làm gì?
A
Store and process the entire dataset in BigQuery.
Lưu trữ và xử lý toàn bộ tập dữ liệu trong BigQuery.
B
Store and process the entire dataset in Bigtable.
Lưu trữ và xử lý toàn bộ tập dữ liệu trong Bigtable.
C
Store the full dataset in BigQuery, and store a compressed copy of the data in a Cloud Storage bucket.
Lưu trữ toàn bộ tập dữ liệu trong BigQuery và lưu trữ một bản sao đã nén của dữ liệu đó trong một bucket Cloud Storage.
D
Store the warm data as files in Cloud Storage, and store the active data in BigQuery. Keep this ratio as 80% warm and 20% active.
Lưu trữ dữ liệu ít hoạt động (warm data) dưới dạng các tệp trong Cloud Storage, và lưu trữ dữ liệu hoạt động (active data) trong BigQuery. Duy trì tỷ lệ này ở mức 80% warm và 20% active.
Giải thích & Tài liệu tham khảo
Để đáp ứng đồng thời cả nhu cầu phân tích kho dữ liệu trên GCP và cung cấp tệp tin cho các nền tảng đám mây khác:
- C. Lưu trữ toàn bộ tập dữ liệu trong BigQuery và lưu trữ một bản sao đã nén của dữ liệu đó trong một bucket Cloud Storage là giải pháp hoàn hảo:
- BigQuery là kho dữ liệu chuẩn ANSI SQL, đáp ứng trọn vẹn yêu cầu phân tích dữ liệu quy mô petabyte.
- Cloud Storage đóng vai trò là kho lưu trữ đối tượng (Object Storage), lưu bản sao nén của dữ liệu dưới dạng tệp tin (như Parquet, Avro, CSV) để các công cụ phân tích hàng loạt của các đám mây khác dễ dàng truy cập trực tiếp.
- A không đúng vì BigQuery không trực tiếp phơi bày dữ liệu dưới dạng tệp cho các đám mây khác truy cập một cách thuận tiện và rẻ tiền.
- B không đúng vì Bigtable là cơ sở dữ liệu NoSQL độ trễ thấp, không được tối ưu cho các truy vấn phân tích kho dữ liệu phức tạp.
- D không đúng vì chỉ lưu trữ 20% dữ liệu hoạt động trong BigQuery sẽ không thể thực hiện phân tích kho dữ liệu trên toàn bộ 100% dữ liệu như yêu cầu đề bài.
(Đáp án được gợi ý bởi AI)