Quay lại bộ đề
Question #13 Topic 1
You are selecting services to write and transform JSON messages from Cloud Pub/Sub to BigQuery for a data pipeline on Google Cloud. You want to minimize service costs. You also want to monitor and accommodate input data volume that will vary in size with minimal manual intervention. What should you do?
Bạn đang lựa chọn các dịch vụ để ghi và chuyển đổi các tin nhắn JSON từ Cloud Pub/Sub sang BigQuery cho một đường ống dữ liệu trên Google Cloud. Bạn muốn giảm thiểu chi phí dịch vụ. Bạn cũng muốn giám sát và đáp ứng khối lượng dữ liệu đầu vào thay đổi liên tục với sự can thiệp thủ công tối thiểu. Bạn nên làm gì?
A
Use Cloud Dataproc to run your transformations. Monitor CPU utilization for the cluster. Resize the number of worker nodes in your cluster via the command line.
Sử dụng Cloud Dataproc để chạy các chuyển đổi của bạn. Giám sát hiệu suất sử dụng CPU của cụm (cluster). Thay đổi kích thước số lượng worker node trong cụm của bạn thông qua dòng lệnh.
B
Use Cloud Dataproc to run your transformations. Use the diagnose command to generate an operational output archive. Locate the bottleneck and adjust cluster resources.
Sử dụng Cloud Dataproc để chạy các chuyển đổi của bạn. Sử dụng lệnh diagnose để tạo một kho lưu trữ đầu ra hoạt động. Xác định điểm nghẽn và điều chỉnh tài nguyên cụm.
C
Use Cloud Dataflow to run your transformations. Monitor the job system lag with Stackdriver. Use the default autoscaling setting for worker instances.
Sử dụng Cloud Dataflow để chạy các chuyển đổi của bạn. Giám sát độ trễ hệ thống công việc (job system lag) bằng Cloud Monitoring (Stackdriver). Sử dụng thiết lập tự động co giãn (autoscaling) mặc định cho các worker instance.
D
Use Cloud Dataflow to run your transformations. Monitor the total execution time for a sampling of jobs. Configure the job to use non-default Compute Engine machine types when needed.
Sử dụng Cloud Dataflow để chạy các chuyển đổi của bạn. Giám sát tổng thời gian thực thi cho một nhóm mẫu các công việc. Cấu hình công việc để sử dụng các loại máy Compute Engine không mặc định khi cần thiết.
Giải thích & Tài liệu tham khảo
Để xây dựng đường ống dẫn dữ liệu streaming từ Pub/Sub sang BigQuery với chi phí tối ưu và can thiệp thủ công tối thiểu:
- Cloud Dataflow với Autoscaling mặc định (C): Dataflow là dịch vụ phi máy chủ tự động điều chỉnh số lượng máy ảo (worker instances) dựa trên lượng dữ liệu đổ về từ Pub/Sub (autoscaling). Việc theo dõi độ trễ hệ thống (system lag) thông qua Cloud Monitoring là chỉ số tiêu chuẩn để đánh giá hiệu suất xử lý luồng dữ liệu mà không cần cấu hình phức tạp.
- Tại sao không chọn Dataproc (A, B): Dataproc yêu cầu bạn quản lý cơ sở hạ tầng cụm máy ảo Hadoop/Spark, điều chỉnh quy mô thủ công hoặc cấu hình phức tạp hơn, dẫn đến tăng chi phí vận hành và nhân sự.
- Tại sao không chọn D: Việc theo dõi thủ công và cấu hình thay đổi loại máy ảo không mặc định của Dataflow đi ngược lại tiêu chí "tối thiểu can thiệp thủ công".
(Đáp án được gợi ý bởi AI)