Quay lại bộ đề
Question #153 Topic 1
Your infrastructure team has set up an interconnect link between Google Cloud and the on-premises network. You are designing a high-throughput streaming pipeline to ingest data in streaming from an Apache Kafka cluster hosted on- premises. You want to store the data in BigQuery, with as minimal latency as possible. What should you do?
Nhóm cơ sở hạ tầng của bạn đã thiết lập một liên kết kết nối trực tiếp (Interconnect) giữa Google Cloud và mạng cục bộ (on-premises). Bạn đang thiết kế một đường ống dẫn dữ liệu streaming thông lượng cao để ingest dữ liệu trực tiếp từ một cụm Apache Kafka được lưu trữ cục bộ. Bạn muốn lưu trữ dữ liệu này trong BigQuery với độ trễ thấp nhất có thể. Bạn nên làm gì?
A
Setup a Kafka Connect bridge between Kafka and Pub/Sub. Use a Google-provided Dataflow template to read the data from Pub/Sub, and write the data to BigQuery.
Thiết lập một cầu nối Kafka Connect giữa Kafka và Pub/Sub. Sử dụng một mẫu Dataflow do Google cung cấp để đọc dữ liệu từ Pub/Sub và ghi dữ liệu vào BigQuery.
B
Use a proxy host in the VPC in Google Cloud connecting to Kafka. Write a Dataflow pipeline, read data from the proxy host, and write the data to BigQuery.
Sử dụng một proxy host trong VPC của Google Cloud kết nối tới Kafka. Viết một pipeline Dataflow, đọc dữ liệu từ proxy host và ghi dữ liệu vào BigQuery.
C
Use Dataflow, write a pipeline that reads the data from Kafka, and writes the data to BigQuery.
Sử dụng Dataflow, viết một pipeline đọc dữ liệu trực tiếp từ Kafka và ghi dữ liệu vào BigQuery.
D
Setup a Kafka Connect bridge between Kafka and Pub/Sub. Write a Dataflow pipeline, read the data from Pub/Sub, and write the data to BigQuery.
Thiết lập một cầu nối Kafka Connect giữa Kafka và Pub/Sub. Viết một pipeline Dataflow, đọc dữ liệu từ Pub/Sub và ghi dữ liệu vào BigQuery.
Giải thích & Tài liệu tham khảo
Để thiết kế một pipeline streaming thông lượng cao từ Apache Kafka on-premises vào BigQuery với độ trễ tối thiểu thông qua kết nối Cloud Interconnect, việc đọc trực tiếp là phương pháp tối ưu nhất.
- A, D. Thiết lập cầu nối Kafka Connect từ Kafka sang Pub/Sub: Đưa thêm Pub/Sub vào làm trung gian sẽ làm tăng thêm độ trễ (latency) vì dữ liệu phải trải qua thêm một bước lưu trữ đệm (hop) và serialization/deserialization khác. Đồng thời, nó làm tăng chi phí và độ phức tạp trong vận hành do phải quản lý cả Kafka Connect lẫn Pub/Sub.
- B. Sử dụng proxy host: Việc đặt một proxy host trung gian trong VPC để nhận dữ liệu từ Kafka rồi chuyển cho Dataflow sẽ tạo ra một điểm nghẽn cổ chai (bottleneck) về băng thông và tăng độ phức tạp không cần thiết cho hạ tầng.
- C. Sử dụng Dataflow đọc trực tiếp từ Kafka: Dataflow cung cấp built-in connector (
KafkaIO) cho phép đọc dữ liệu trực tiếp từ Kafka thông qua kết nối mạng nội bộ bảo mật (Interconnect) và trực tiếp stream vào BigQuery bằng Storage Write API. Phương pháp này giảm thiểu số lượng thành phần trung gian, đem lại độ trễ thấp nhất và dễ bảo trì nhất.
(Đáp án được gợi ý bởi AI)