Trong mô hình Hadoop truyền thống tại chỗ, dữ liệu được lưu trữ trực tiếp trên đĩa cứng cục bộ (HDFS). Khi chuyển sang Google Cloud, việc duy trì kiến trúc này bằng cách gắn các ổ Persistent Disk dung lượng lớn (50 TB/node) sẽ rất đắt đỏ và lãng phí vì bạn phải trả tiền cho block storage hiệu năng cao ngay cả khi không chạy tính toán.
- A. Đưa dữ liệu vào Google Cloud Storage (GCS): Bằng cách di chuyển toàn bộ dữ liệu từ HDFS sang Cloud Storage và sử dụng Cloud Storage connector, ta thực hiện tách biệt hoàn toàn giữa tính toán (compute) và lưu trữ (storage). GCS có chi phí lưu trữ rẻ hơn rất nhiều so với Persistent Disk, đồng thời cụm Dataproc có thể được tắt hoàn toàn khi không sử dụng mà không làm mất dữ liệu.
- B. Sử dụng Preemptible VMs: Chỉ giúp giảm chi phí tính toán (compute), không giúp giảm chi phí block storage (50 TB đĩa cứng vẫn phải duy trì liên tục).
- D. Chỉ giữ hot data trên Persistent Disk: Vẫn giữ lại một phần Persistent Disk dung lượng lớn gây tốn kém không cần thiết, trong khi GCS hoàn toàn có khả năng đáp ứng cả dữ liệu nóng nhờ băng thông mạng cao của GCP.
(Đáp án được gợi ý bởi AI)