Quay lại bộ đề
Question #169 Topic 1
You have designed an Apache Beam processing pipeline that reads from a Pub/Sub topic. The topic has a message retention duration of one day, and writes to a Cloud Storage bucket. You need to select a bucket location and processing strategy to prevent data loss in case of a regional outage with an RPO of 15 minutes. What should you do?
Bạn đã thiết kế một pipeline xử lý Apache Beam đọc dữ liệu từ một topic Pub/Sub. Topic này có thời gian lưu giữ tin nhắn (message retention duration) là một ngày, và ghi vào một bucket Cloud Storage. Bạn cần chọn vị trí bucket và chiến lược xử lý để ngăn ngừa mất dữ liệu trong trường hợp xảy ra sự cố vùng với RPO là 15 phút. Bạn nên làm gì?
A
1. Use a dual-region Cloud Storage bucket.2. Monitor Dataflow metrics with Cloud Monitoring to determine when an outage occurs.3. Seek the subscription back in time by 15 minutes to recover the acknowledged messages.4. Start the Dataflow job in a secondary region.
1. Sử dụng bucket Cloud Storage song vùng (dual-region).
2. Giám sát các chỉ số Dataflow bằng Cloud Monitoring để xác định thời điểm xảy ra sự cố.
3. Thực hiện seek (tìm kiếm ngược) subscription về trước 15 phút để khôi phục các tin nhắn đã xác nhận (acknowledged messages).
4. Bắt đầu job Dataflow ở một vùng thứ cấp.
B
1. Use a multi-regional Cloud Storage bucket.2. Monitor Dataflow metrics with Cloud Monitoring to determine when an outage occurs.3. Seek the subscription back in time by 60 minutes to recover the acknowledged messages.4. Start the Dataflow job in a secondary region.
1. Sử dụng bucket Cloud Storage đa vùng (multi-regional).
2. Giám sát các chỉ số Dataflow bằng Cloud Monitoring để xác định thời điểm xảy ra sự cố.
3. Thực hiện seek subscription về trước 60 phút để khôi phục các tin nhắn đã xác nhận.
4. Bắt đầu job Dataflow ở một vùng thứ cấp.
C
1. Use a regional Cloud Storage bucket.2. Monitor Dataflow metrics with Cloud Monitoring to determine when an outage occurs.3. Seek the subscription back in time by one day to recover the acknowledged messages.4. Start the Dataflow job in a secondary region and write in a bucket in the same region.
1. Sử dụng bucket Cloud Storage vùng (regional).
2. Giám sát các chỉ số Dataflow bằng Cloud Monitoring để xác định thời điểm xảy ra sự cố.
3. Thực hiện seek subscription về trước một ngày để khôi phục các tin nhắn đã xác nhận.
4. Bắt đầu job Dataflow ở một vùng thứ cấp và ghi vào một bucket trong cùng vùng đó.
D
1. Use a dual-region Cloud Storage bucket with turbo replication enabled.2. Monitor Dataflow metrics with Cloud Monitoring to determine when an outage occurs.3. Seek the subscription back in time by 60 minutes to recover the acknowledged messages.4. Start the Dataflow job in a secondary region.
1. Sử dụng bucket Cloud Storage song vùng (dual-region) có bật tính năng nhân bản tăng tốc (turbo replication).
2. Giám sát các chỉ số Dataflow bằng Cloud Monitoring để xác định thời điểm xảy ra sự cố.
3. Thực hiện seek subscription về trước 60 phút để khôi phục các tin nhắn đã xác nhận.
4. Bắt đầu job Dataflow ở một vùng thứ cấp.
Giải thích & Tài liệu tham khảo
Để xử lý thảm họa cấp vùng với RPO 15 phút cho một pipeline streaming từ Pub/Sub sang Cloud Storage:
- Cloud Storage: Cần sử dụng dual-region bucket có bật turbo replication để đảm bảo dữ liệu ghi vào Cloud Storage được đồng bộ nhanh chóng sang vùng dự phòng trong vòng 15 phút.
- Pub/Sub Seek: Khi xảy ra sự cố vùng và Dataflow bị gián đoạn, một số tin nhắn có thể đã được xử lý nhưng chưa kịp ghi nhận hoặc mất trạng thái. Việc sử dụng tính năng
seekcủa Pub/Sub để quay ngược thời gian đăng ký (subscription) về trước 60 phút giúp đảm bảo không bỏ sót bất kỳ tin nhắn nào trong khoảng thời gian xảy ra sự cố, đồng thời tạo ra một biên an toàn vượt quá mức 15 phút RPO.
- Tại sao chọn D: Đáp ứng đầy đủ cả hai tiêu chí: Dual-region với turbo replication cho bộ lưu trữ đích (RPO 15 phút) và cơ chế quay ngược thời gian Pub/Sub 60 phút để xử lý lại dữ liệu từ điểm an toàn.
- Tại sao A sai: Không nhắc đến việc bật turbo replication, điều này có thể khiến quá trình đồng bộ của GCS không đạt được RPO 15 phút.
- Tại sao B sai: Multi-region không hỗ trợ turbo replication.
- Tại sao C sai: Regional bucket sẽ bị mất toàn bộ dữ liệu trong vùng bị ảnh hưởng nếu vùng đó gặp sự cố.
(Đáp án được gợi ý bởi AI)