Quay lại bộ đề
Question #306 Topic 1
You want to create a machine learning model using BigQuery ML and create an endpoint for hosting the model using Vertex AI. This will enable the processing of continuous streaming data in near-real time from multiple vendors. The data may contain invalid values. What should you do?
Bạn muốn tạo một mô hình học máy bằng BigQuery ML và tạo một endpoint để lưu trữ (host) mô hình bằng Vertex AI. Điều này sẽ cho phép xử lý dữ liệu truyền phát (streaming) liên tục trong thời gian gần như thực tế từ nhiều nhà cung cấp. Dữ liệu có thể chứa các giá trị không hợp lệ. Bạn nên làm gì?
A
Create a new BigQuery dataset and use streaming inserts to land the data from multiple vendors. Configure your BigQuery ML model to use the "ingestion" dataset as the framing data.
Tạo một dataset BigQuery mới và sử dụng tính năng ghi truyền phát (streaming inserts) để lưu dữ liệu từ nhiều nhà cung cấp. Cấu hình mô hình BigQuery ML của bạn sử dụng dataset "ingestion" này làm dữ liệu khung.
B
Use BigQuery streaming inserts to land the data from multiple vendors where your BigQuery dataset ML model is deployed.
Sử dụng BigQuery streaming inserts để nạp dữ liệu từ nhiều nhà cung cấp trực tiếp vào nơi mà dataset ML model của bạn được triển khai.
C
Create a Pub/Sub topic and send all vendor data to it. Connect a Cloud Function to the topic to process the data and store it in BigQuery.
Tạo một Pub/Sub topic và gửi toàn bộ dữ liệu nhà cung cấp vào đó. Kết nối một Cloud Function với topic để xử lý dữ liệu và lưu trữ vào BigQuery.
D
Create a Pub/Sub topic and send all vendor data to it. Use Dataflow to process and sanitize the Pub/Sub data and stream it to BigQuery.
Tạo một Pub/Sub topic và gửi toàn bộ dữ liệu nhà cung cấp vào đó. Sử dụng Dataflow để xử lý và làm sạch dữ liệu từ Pub/Sub rồi truyền phát (stream) vào BigQuery.
Giải thích & Tài liệu tham khảo
Để xử lý dữ liệu truyền phát (streaming data) liên tục từ nhiều nhà cung cấp có thể chứa các giá trị không hợp lệ (invalid values), kiến trúc chuẩn của Google Cloud là sử dụng Pub/Sub để tiếp nhận dữ liệu ổn định, kết hợp với Dataflow (Apache Beam) để thực hiện quá trình làm sạch, chuẩn hóa (sanitization) dữ liệu trước khi nạp vào BigQuery.
- Lựa chọn D đúng: Dataflow cung cấp khả năng xử lý luồng (stream processing) mạnh mẽ, tự động co giãn, đảm bảo tính toàn vẹn dữ liệu và cho phép lọc bỏ hoặc sửa đổi các bản ghi không hợp lệ một cách hiệu quả trước khi ghi vào BigQuery.
- Lựa chọn A và B sai: Việc ghi trực tiếp vào BigQuery (streaming inserts) mà không qua kiểm tra sẽ dẫn đến việc nạp dữ liệu rác, gây sai lệch cho mô hình học máy.
- Lựa chọn C sai: Cloud Functions không tối ưu cho việc xử lý luồng dữ liệu lớn, liên tục với khối lượng lớn và không có sẵn các cơ chế xử lý lỗi/cửa sổ thời gian như Dataflow.
(Đáp án được gợi ý bởi AI)