Quay lại bộ đề
Question #44 Topic 1
Your company is migrating their 30-node Apache Hadoop cluster to the cloud. They want to re-use Hadoop jobs they have already created and minimize the management of the cluster as much as possible. They also want to be able to persist data beyond the life of the cluster. What should you do?
Công ty của bạn đang di chuyển cụm Apache Hadoop gồm 30 nút của họ lên đám mây. Họ muốn tái sử dụng các công việc Hadoop mà họ đã tạo và giảm thiểu việc quản lý cụm càng nhiều càng tốt. Họ cũng muốn có thể lưu trữ dữ liệu lâu dài ngay cả khi cụm bị xóa. Bạn nên làm gì?
A
Create a Google Cloud Dataflow job to process the data.
Tạo một công việc Google Cloud Dataflow để xử lý dữ liệu.
B
Create a Google Cloud Dataproc cluster that uses persistent disks for HDFS.
Tạo một cụm Google Cloud Dataproc sử dụng các đĩa cứng persistent disks cho HDFS.
C
Create a Hadoop cluster on Google Compute Engine that uses persistent disks.
Tạo một cụm Hadoop trên Google Compute Engine sử dụng các đĩa cứng persistent disks.
D
Create a Cloud Dataproc cluster that uses the Google Cloud Storage connector.
Tạo một cụm Cloud Dataproc sử dụng đầu nối Google Cloud Storage (GCS connector).
E
Create a Hadoop cluster on Google Compute Engine that uses Local SSD disks.
Tạo một cụm Hadoop trên Google Compute Engine sử dụng đĩa Local SSD.
Giải thích & Tài liệu tham khảo
Để di chuyển cụm Hadoop hiện tại lên Google Cloud với các yêu cầu: tái sử dụng mã nguồn Hadoop sẵn có, giảm thiểu công sức quản lý hạ tầng, và lưu trữ dữ liệu độc lập với vòng đời của cụm:
- D. Tạo cụm Cloud Dataproc sử dụng Google Cloud Storage connector:
- Tái sử dụng công việc Hadoop: Cloud Dataproc là dịch vụ quản lý Hadoop/Spark được quản lý hoàn toàn trên GCP, cho phép chạy nguyên bản các công việc MapReduce, Spark, Hive mà không cần sửa đổi mã nguồn.
- Giảm thiểu quản lý: Dataproc tự động cấu hình và quản lý cụm máy chủ, giảm đáng kể gánh nặng quản trị so với việc tự xây dựng trên Compute Engine.
- Lưu trữ dữ liệu độc lập: Bằng cách sử dụng Cloud Storage connector, dữ liệu được lưu trữ trực tiếp trên Google Cloud Storage (GCS) thay vì HDFS cục bộ. GCS hoạt động như một hệ thống tệp tương thích với HDFS. Điều này cho phép bạn tắt hoặc xóa cụm Dataproc khi không chạy công việc để tiết kiệm chi phí mà không làm mất dữ liệu.
Các lựa chọn khác không phù hợp:
- A: Cloud Dataflow yêu cầu viết lại toàn bộ mã nguồn Hadoop bằng Apache Beam SDK, vi phạm yêu cầu tái sử dụng mã nguồn Hadoop sẵn có.
- B: Sử dụng persistent disks cho HDFS trên Dataproc vẫn gắn liền dữ liệu với cụm đó, nếu cụm bị xóa, dữ liệu trong HDFS cũng có thể bị mất hoặc việc quản lý phân tách dữ liệu sẽ phức tạp hơn rất nhiều so với dùng trực tiếp GCS.
- C & E: Tự dựng cụm Hadoop trên Compute Engine đòi hỏi rất nhiều công sức cấu hình, quản trị, bảo trì hệ thống và không giảm thiểu quản lý cụm.
(Đáp án được gợi ý bởi AI)