Quay lại bộ đề
Question #97 Topic 1
You are planning to migrate your current on-premises Apache Hadoop deployment to the cloud. You need to ensure that the deployment is as fault-tolerant and cost-effective as possible for long-running batch jobs. You want to use a managed service. What should you do?
Bạn đang lập kế hoạch di chuyển hệ thống Apache Hadoop on-premises hiện tại của mình lên đám mây. Bạn cần đảm bảo rằng hệ thống triển khai có khả năng chịu lỗi (fault-tolerant) tốt và tối ưu hóa chi phí nhất có thể cho các công việc chạy hàng loạt dài hạn (long-running batch jobs). Bạn muốn sử dụng một dịch vụ được quản lý (managed service). Bạn nên làm gì?
A
Deploy a Dataproc cluster. Use a standard persistent disk and 50% preemptible workers. Store data in Cloud Storage, and change references in scripts from hdfs:// to gs://
Triển khai một cụm Dataproc. Sử dụng đĩa cứng tiêu chuẩn (standard persistent disk) và 50% worker phụ thuộc dạng preemptible (độ ưu tiên thấp). Lưu trữ dữ liệu trong Cloud Storage, và thay đổi các tham chiếu trong script từ hdfs:// sang gs://
B
Deploy a Dataproc cluster. Use an SSD persistent disk and 50% preemptible workers. Store data in Cloud Storage, and change references in scripts from hdfs:// to gs://
Triển khai một cụm Dataproc. Sử dụng đĩa cứng SSD persistent disk và 50% worker phụ thuộc dạng preemptible (độ ưu tiên thấp). Lưu trữ dữ liệu trong Cloud Storage, và thay đổi các tham chiếu trong script từ hdfs:// sang gs://
C
Install Hadoop and Spark on a 10-node Compute Engine instance group with standard instances. Install the Cloud Storage connector, and store the data in Cloud Storage. Change references in scripts from hdfs:// to gs://
Cài đặt Hadoop và Spark trên một nhóm thực thể Compute Engine gồm 10 nút sử dụng các thực thể tiêu chuẩn. Cài đặt đầu nối Cloud Storage connector, và lưu trữ dữ liệu trong Cloud Storage. Thay đổi các tham chiếu trong script từ hdfs:// sang gs://
D
Install Hadoop and Spark on a 10-node Compute Engine instance group with preemptible instances. Store data in HDFS. Change references in scripts from hdfs:// to gs://
Cài đặt Hadoop và Spark trên một nhóm thực thể Compute Engine gồm 10 nút sử dụng các thực thể preemptible. Lưu trữ dữ liệu trong HDFS. Thay đổi các tham chiếu trong script từ hdfs:// sang gs://
Giải thích & Tài liệu tham khảo
Khi di chuyển Hadoop lên GCP với yêu cầu dịch vụ được quản lý, chịu lỗi và tối ưu chi phí tối đa cho các công việc batch:
- Tại sao chọn A:
- Dataproc là dịch vụ quản lý Hadoop/Spark tự động của Google Cloud, loại bỏ gánh nặng cấu hình hạ tầng thủ công.
- Thay thế HDFS bằng Cloud Storage (sử dụng đường dẫn
gs://) giúp tách rời tài nguyên tính toán (compute) và lưu trữ (storage). Bạn có thể xóa cụm Dataproc khi không chạy việc để tiết kiệm tiền mà dữ liệu vẫn an toàn trên GCS (tính chịu lỗi tuyệt đối). - Sử dụng Preemptible VMs làm worker phụ trợ (nút lưu động) giúp giảm giá thuê VM lên đến 80%. Tỷ lệ 50% preemptible đảm bảo sự ổn định của cụm (các nút chính vẫn là VM tiêu chuẩn để không bị thu hồi đồng loạt làm hỏng job).
- Chọn Standard persistent disk thay vì SSD vì dữ liệu chính nằm trên GCS, đĩa cục bộ chỉ dùng làm cache/shuffle tạm thời, giúp giảm tối đa chi phí lưu trữ cụm.
- Tại sao các phương án khác sai:
- B: SSD persistent disk đắt đỏ và không cần thiết cho tối ưu hóa chi phí khi dữ liệu thực tế đã nằm trên GCS.
- C & D: Tự cài đặt Hadoop trên Compute Engine không phải là một managed service, làm tăng công sức vận hành hệ thống.
(Đáp án được gợi ý bởi AI)