Quay lại bộ đề
Question #63 Topic 1
You are deploying 10,000 new Internet of Things devices to collect temperature data in your warehouses globally. You need to process, store and analyze these very large datasets in real time. What should you do?
Bạn đang triển khai 10.000 thiết bị Internet of Things (IoT) mới để thu thập dữ liệu nhiệt độ trong các kho hàng của mình trên toàn cầu. Bạn cần xử lý, lưu trữ và phân tích các tập dữ liệu cực lớn này trong thời gian thực. Bạn nên làm gì?
A
Send the data to Google Cloud Datastore and then export to BigQuery.
Gửi dữ liệu tới Google Cloud Datastore và sau đó xuất sang BigQuery.
B
Send the data to Google Cloud Pub/Sub, stream Cloud Pub/Sub to Google Cloud Dataflow, and store the data in Google BigQuery.
Gửi dữ liệu tới Google Cloud Pub/Sub, truyền trực luồng (stream) từ Cloud Pub/Sub tới Google Cloud Dataflow, và lưu trữ dữ liệu trong Google BigQuery.
C
Send the data to Cloud Storage and then spin up an Apache Hadoop cluster as needed in Google Cloud Dataproc whenever analysis is required.
Gửi dữ liệu tới Cloud Storage và sau đó khởi động một cụm Apache Hadoop khi cần trong Google Cloud Dataproc mỗi khi có yêu cầu phân tích.
D
Export logs in batch to Google Cloud Storage and then spin up a Google Cloud SQL instance, import the data from Cloud Storage, and run an analysis as needed.
Xuất nhật ký (logs) theo lô sang Google Cloud Storage và sau đó khởi động một phiên bản Google Cloud SQL, nhập dữ liệu từ Cloud Storage và chạy phân tích khi cần.
Giải thích & Tài liệu tham khảo
Giải pháp được đề xuất trong lựa chọn B là cách tiếp cận tốt nhất để xử lý, lưu trữ và phân tích dữ liệu IoT lớn, theo thời gian thực trên GCP. Dưới đây là lý do:
- Google Cloud Pub/Sub: Là dịch vụ nhắn tin không đồng bộ, có khả năng mở rộng cao, lý tưởng cho việc thu thập dữ liệu từ hàng ngàn thiết bị IoT với tốc độ cao. Nó đảm bảo các thông điệp được nhận và xử lý một cách đáng tin cậy.
- Google Cloud Dataflow: Là một dịch vụ đầy đủ tính năng, không máy chủ để thực hiện các quy trình xử lý dữ liệu stream và batch. Dữ liệu từ Pub/Sub có thể được Dataflow xử lý theo thời gian thực (stream processing) để làm sạch, chuyển đổi hoặc chuẩn hóa trước khi lưu trữ. Dataflow lý tưởng cho các luồng dữ liệu lớn và phức tạp.
- Google BigQuery: Là kho dữ liệu phân tích không máy chủ, có khả năng mở rộng petabyte, được tối ưu hóa cho các truy vấn dữ liệu lớn và chạy phân tích hiệu quả. Dữ liệu IoT đã được xử lý có thể được lưu trữ trực tiếp vào BigQuery cho phân tích tức thì.
Các lựa chọn khác không tối ưu hoặc không phù hợp:
- A: Gửi dữ liệu đến Google Cloud Datastore và sau đó xuất ra BigQuery. Google Cloud Datastore (hiện là Cloud Firestore ở chế độ Datastore) là cơ sở dữ liệu NoSQL tài liệu, phù hợp với dữ liệu ứng dụng. Mặc dù có khả năng mở rộng, nó không được thiết kế tối ưu cho việc thu thập dòng dữ liệu quy mô lớn (dạng time-series như IoT) và các hoạt động phân tích dữ liệu lớn. Việc xuất dữ liệu sang BigQuery sau đó sẽ tạo thêm độ trễ và phức tạp không cần thiết cho một giải pháp thời gian thực.
- C: Gửi dữ liệu đến Cloud Storage và sau đó khởi động một cụm Apache Hadoop khi cần phân tích trong Google Cloud Dataproc. Mặc dù Cloud Storage là nơi lưu trữ tuyệt vời cho dữ liệu lớn, việc liên tục ghi dữ liệu IoT trực tiếp vào các tệp trong Cloud Storage và sau đó phải khởi động một cụm Dataproc mỗi khi cần phân tích là một quy trình không hiệu quả cho việc xử lý và phân tích thời gian thực. Dataproc phù hợp hơn cho các tác vụ xử lý hàng loạt theo lịch trình hoặc xử lý dữ liệu đã lưu trữ, chứ không phải cho luồng dữ liệu thời gian thực.
- D: Xuất nhật ký theo lô vào Google Cloud Storage và sau đó khởi động một phiên bản Google Cloud SQL, nhập dữ liệu từ Cloud Storage và chạy phân tích khi cần. Cloud SQL là cơ sở dữ liệu quan hệ, phù hợp cho dữ liệu giao dịch và dữ liệu có cấu trúc. Nó không được thiết kế để xử lý dữ liệu IoT theo thời gian thực với khối lượng rất lớn (10.000 thiết bị tạo ra dữ liệu liên tục). Việc nhập dữ liệu theo lô từ Cloud Storage và sau đó chạy phân tích sẽ tạo ra độ trễ đáng kể và không đáp ứng yêu cầu 'thời gian thực'. Ngoài ra, Cloud SQL sẽ nhanh chóng trở thành một điểm nghẽn về hiệu suất và chi phí với quy mô dữ liệu này.
(Đáp án được gợi ý bởi AI)