Quay lại bộ đề
Question #103 Topic 1
You want to migrate an on-premises Hadoop system to Cloud Dataproc. Hive is the primary tool in use, and the data format is Optimized Row Columnar (ORC).All ORC files have been successfully copied to a Cloud Storage bucket. You need to replicate some data to the cluster's local Hadoop Distributed File System(HDFS) to maximize performance. What are two ways to start using Hive in Cloud Dataproc? (Choose two.)
Bạn muốn di chuyển một hệ thống Hadoop on-premises sang Cloud Dataproc. Hive là công cụ chính được sử dụng, và định dạng dữ liệu là Optimized Row Columnar (ORC). Tất cả các tệp ORC đã được sao chép thành công vào một bucket Cloud Storage. Bạn cần sao chép một số dữ liệu vào hệ thống tệp phân tán Hadoop (HDFS) cục bộ của cụm để tối đa hóa hiệu suất. Hai cách nào để bắt đầu sử dụng Hive trong Cloud Dataproc là gì? (Chọn hai.)
A
Run the gsutil utility to transfer all ORC files from the Cloud Storage bucket to HDFS. Mount the Hive tables locally.
Chạy tiện ích gsutil để chuyển tất cả các tệp ORC từ bucket Cloud Storage sang HDFS. Gắn (mount) các bảng Hive cục bộ.
B
Run the gsutil utility to transfer all ORC files from the Cloud Storage bucket to any node of the Dataproc cluster. Mount the Hive tables locally.
Chạy tiện ích gsutil để chuyển tất cả các tệp ORC từ bucket Cloud Storage sang bất kỳ nút nào của cụm Dataproc. Gắn (mount) các bảng Hive cục bộ.
C
Run the gsutil utility to transfer all ORC files from the Cloud Storage bucket to the master node of the Dataproc cluster. Then run the Hadoop utility to copy them do HDFS. Mount the Hive tables from HDFS.
Chạy tiện ích gsutil để chuyển tất cả các tệp ORC từ bucket Cloud Storage sang nút chính (master node) của cụm Dataproc. Sau đó chạy tiện ích Hadoop để sao chép chúng vào HDFS. Gắn (mount) các bảng Hive từ HDFS.
D
Leverage Cloud Storage connector for Hadoop to mount the ORC files as external Hive tables. Replicate external Hive tables to the native ones.
Tận dụng Cloud Storage connector cho Hadoop để gắn (mount) các tệp ORC dưới dạng các bảng Hive ngoại vi (external tables). Sao chép các bảng Hive ngoại vi này sang các bảng nội bộ (native tables) trên HDFS.
E
Load the ORC files into BigQuery. Leverage BigQuery connector for Hadoop to mount the BigQuery tables as external Hive tables. Replicate external Hive tables to the native ones.
Tải các tệp ORC vào BigQuery. Tận dụng BigQuery connector cho Hadoop để gắn (mount) các bảng BigQuery dưới dạng các bảng Hive ngoại vi. Sao chép các bảng Hive ngoại vi sang các bảng nội bộ.
Giải thích & Tài liệu tham khảo
Chúng ta cần di chuyển các tệp ORC từ Cloud Storage vào HDFS của cụm Dataproc để Hive sử dụng cục bộ nhằm đạt hiệu năng tối đa.
- Tại sao chọn A & D:
- Cách 1 (Lựa chọn A): Sử dụng công cụ sao chép dữ liệu (như
gsutilhoặchadoop fs -cpthông qua connector) để copy trực tiếp các tệp ORC từ Cloud Storage bucket vào HDFS, sau đó tạo bảng Hive trỏ trực tiếp đến thư mục dữ liệu trên HDFS. - Cách 2 (Lựa chọn D): Sử dụng Cloud Storage connector (được tích hợp sẵn trong Dataproc) để định nghĩa các tệp ORC trên Cloud Storage dưới dạng các bảng Hive ngoại vi (external tables). Sau đó, chạy lệnh trong Hive (e.g.,
CREATE TABLE ... AS SELECT) để sao chép dữ liệu từ các bảng ngoại vi này vào các bảng nội bộ (native tables) trên HDFS. - Tại sao các phương án khác sai:
- B & C: Tải dữ liệu về hệ thống tệp cục bộ của một nút đơn lẻ (như master node) rồi mới copy vào HDFS là bước trung gian không cần thiết, làm lãng phí đĩa đệm của master node và khó mở rộng cho dữ liệu lớn.
- E: Sử dụng BigQuery làm trung gian rồi dùng BigQuery connector cho Hadoop là cách tiếp cận quá phức tạp và tạo độ trễ lớn.
(Đáp án được gợi ý bởi AI)