Khi cần tự động hóa và quản lý một quy trình xử lý dữ liệu gồm nhiều bước phức tạp, chạy hàng ngày với các phụ thuộc đan xen giữa nhiều dịch vụ như Dataproc và Dataflow:
- Cloud Composer (Lựa chọn B): Đây là dịch vụ được quản lý dựa trên Apache Airflow, chuyên dùng để thiết kế, lập lịch và giám sát các luồng công việc (workflows/DAGs). Nó cung cấp các toán tử (operators) tích hợp sẵn cho Dataproc và Dataflow, cho phép thiết lập quan hệ phụ thuộc phức tạp, cơ chế tự động thử lại khi lỗi (retry) và ghi log tập trung.
Các lựa chọn khác không đáp ứng đầy đủ:
- A, C:
cron trên Linux hoặc Cloud Scheduler là các công cụ kích hoạt theo thời gian đơn giản, không thể tự quản lý mối quan hệ phụ thuộc phức tạp hoặc kiểm tra trạng thái thành công/thất bại của từng bước trong pipeline.
- D: Workflow Templates trên Dataproc chỉ giới hạn trong các tác vụ chạy trên cụm Dataproc, không hỗ trợ quản lý các luồng công việc phức tạp liên kết với Dataflow và các dịch vụ GCP khác.
(Đáp án được gợi ý bởi AI)