Yêu cầu đề bài là lưu trữ 50 TB dữ liệu chuỗi thời gian (time-series data) tài chính được cập nhật liên tục với tần suất cao (streaming) và cần tích hợp với các tác vụ Apache Hadoop sẵn có.
- Cloud Bigtable (Lựa chọn A): Đây là lựa chọn tối ưu nhất. Bigtable là cơ sở dữ liệu NoSQL được thiết kế chuyên biệt cho việc lưu trữ dữ liệu dạng khóa-giá trị quy mô lớn, có độ trễ cực thấp (dưới 10ms) và băng thông ghi cực cao, rất phù hợp cho dữ liệu time-series. Ngoài ra, Bigtable cung cấp giao diện tương thích hoàn toàn với HBase API, giúp dễ dàng tích hợp và chạy các công việc Apache Hadoop/Spark hiện tại mà không phải viết lại mã nguồn.
Các lựa chọn khác không phù hợp bằng:
- B: BigQuery là kho dữ liệu phân tích dạng cột, không tối ưu cho việc ghi dữ liệu streaming liên tục với độ trễ tính bằng mili-giây như Bigtable.
- C: Cloud Storage phù hợp để lưu trữ tệp lớn dạng batch hơn là làm cơ sở dữ liệu ghi streaming thời gian thực.
- D: Cloud Datastore/Firestore không được thiết kế cho các phân tích dữ liệu lớn bằng Hadoop/Spark và bị giới hạn về quy mô/hiệu năng so với Bigtable đối với dữ liệu time-series tài chính dung lượng lớn.
(Đáp án được gợi ý bởi AI)