Quay lại bộ đề
Question #17 Topic 1
You are designing a data processing pipeline. The pipeline must be able to scale automatically as load increases. Messages must be processed at least once and must be ordered within windows of 1 hour. How should you design the solution?
Bạn đang thiết kế một pipeline xử lý dữ liệu. Pipeline phải có khả năng tự động mở rộng (scale) khi tải tăng lên. Các tin nhắn phải được xử lý ít nhất một lần (at least once) và phải được sắp xếp theo thứ tự trong các cửa sổ (windows) thời gian 1 giờ. Bạn nên thiết kế giải pháp này như thế nào?
A
Use Apache Kafka for message ingestion and use Cloud Dataproc for streaming analysis.
Sử dụng Apache Kafka để thu nhận tin nhắn và sử dụng Cloud Dataproc để phân tích dữ liệu truyền phát.
B
Use Apache Kafka for message ingestion and use Cloud Dataflow for streaming analysis.
Sử dụng Apache Kafka để thu nhận tin nhắn và sử dụng Cloud Dataflow để phân tích dữ liệu truyền phát.
C
Use Cloud Pub/Sub for message ingestion and Cloud Dataproc for streaming analysis.
Sử dụng Cloud Pub/Sub để thu nhận tin nhắn và sử dụng Cloud Dataproc để phân tích dữ liệu truyền phát.
D
Use Cloud Pub/Sub for message ingestion and Cloud Dataflow for streaming analysis.
Sử dụng Cloud Pub/Sub để thu nhận tin nhắn và sử dụng Cloud Dataflow để phân tích dữ liệu truyền phát.
Giải thích & Tài liệu tham khảo
Để xây dựng một giải pháp xử lý streaming tự động co giãn, đảm bảo xử lý ít nhất một lần (at-least-once) và duy trì thứ tự tin nhắn theo cửa sổ thời gian:
- D. Sử dụng Cloud Pub/Sub và Cloud Dataflow là kiến trúc tối ưu nhất trên Google Cloud:
- Cloud Pub/Sub cung cấp khả năng thu nhận tin nhắn quy mô lớn, tự động mở rộng, đảm bảo phân phối ít nhất một lần và hỗ trợ duy trì thứ tự tin nhắn thông qua thuộc tính khóa sắp xếp (ordering keys).
- Cloud Dataflow (dựa trên Apache Beam) hỗ trợ tự động co giãn (autoscaling) tài nguyên linh hoạt theo lưu lượng, xử lý dữ liệu streaming với cơ chế cửa sổ (windowing) phức tạp (như cửa sổ 1 giờ) và đảm bảo thứ tự xử lý dữ liệu hiệu quả.
- Các lựa chọn sử dụng Apache Kafka (A, B) yêu cầu bạn phải tự quản lý, vận hành và cấu hình co giãn thủ công, không đáp ứng tốt tiêu chí tự động co giãn gốc đám mây.
- Các lựa chọn sử dụng Cloud Dataproc (A, C) cho phân tích streaming không hỗ trợ tính năng tự động co giãn nhanh chóng và linh hoạt ở mức độ tác vụ tốt như Cloud Dataflow.
(Đáp án được gợi ý bởi AI)