Quay lại bộ đề
Question #93 Topic 1
You have an Apache Kafka cluster on-prem with topics containing web application logs. You need to replicate the data to Google Cloud for analysis in BigQuery and Cloud Storage. The preferred replication method is mirroring to avoid deployment of Kafka Connect plugins.What should you do?
Bạn có một cụm Apache Kafka on-premise chứa các topic lưu nhật ký (logs) của ứng dụng web. Bạn cần sao chép (replicate) dữ liệu này sang Google Cloud để phân tích trong BigQuery và Cloud Storage. Phương pháp sao chép được ưu tiên là ánh xạ (mirroring) để tránh việc triển khai các plugin Kafka Connect. Bạn nên làm gì?
A
Deploy a Kafka cluster on GCE VM Instances. Configure your on-prem cluster to mirror your topics to the cluster running in GCE. Use a Dataproc cluster or Dataflow job to read from Kafka and write to GCS.
Triển khai một cụm Kafka trên các thực thể VM Compute Engine (GCE). Cấu hình cụm on-premise của bạn để ánh xạ (mirror) các topic sang cụm đang chạy trên GCE. Sử dụng một cụm Dataproc hoặc công việc Dataflow để đọc từ Kafka và ghi vào GCS.
B
Deploy a Kafka cluster on GCE VM Instances with the Pub/Sub Kafka connector configured as a Sink connector. Use a Dataproc cluster or Dataflow job to read from Kafka and write to GCS.
Triển khai một cụm Kafka trên các thực thể VM GCE với Pub/Sub Kafka connector được cấu hình làm Sink connector. Sử dụng một cụm Dataproc hoặc công việc Dataflow để đọc từ Kafka và ghi vào GCS.
C
Deploy the Pub/Sub Kafka connector to your on-prem Kafka cluster and configure Pub/Sub as a Source connector. Use a Dataflow job to read from Pub/Sub and write to GCS.
Triển khai Pub/Sub Kafka connector cho cụm Kafka on-premise của bạn và cấu hình Pub/Sub làm Source connector. Sử dụng một công việc Dataflow để đọc từ Pub/Sub và ghi vào GCS.
D
Deploy the Pub/Sub Kafka connector to your on-prem Kafka cluster and configure Pub/Sub as a Sink connector. Use a Dataflow job to read from Pub/Sub and write to GCS.
Triển khai Pub/Sub Kafka connector cho cụm Kafka on-premise của bạn và cấu hình Pub/Sub làm Sink connector. Sử dụng một công việc Dataflow để đọc từ Pub/Sub và ghi vào GCS.
Giải thích & Tài liệu tham khảo
Yêu cầu quan trọng của đề bài là thực hiện sao chép dữ liệu (replicate) bằng phương pháp mirroring để tránh triển khai các plugin Kafka Connect trên hệ thống on-premises.
- Giải pháp (Lựa chọn A): Sử dụng công cụ tích hợp sẳn của Kafka là
MirrorMakerđể thiết lập đồng bộ hóa (mirroring) trực tiếp từ cụm Kafka on-premises sang một cụm Kafka khác chạy trên Compute Engine (GCE). Phương thức này không cần sử dụng framework Kafka Connect hay bất kỳ plugin kết nối nào. Sau khi dữ liệu đã sang cụm Kafka trên GCP, ta có thể dùng các công việc Dataflow hoặc Dataproc để đọc và đẩy dữ liệu vào lưu trữ dài hạn. - Tại sao các phương án khác sai: Các lựa chọn B, C, D đều đề cập đến việc cấu hình và triển khai "Pub/Sub Kafka connector" (sử dụng framework Kafka Connect), điều này trái với yêu cầu tránh triển khai các plugin Kafka Connect của đề bài.
(Đáp án được gợi ý bởi AI)