Quay lại bộ đề
Question #330 Topic 1
You are building a Dataflow pipeline to ingest customer feedback. Before loading to your data warehouse, you must validate email addresses and enrich unstructured comment strings with a generative AI sentiment classification. Invalid records need to be routed for manual review. How should you implement this pipeline?
Bạn đang xây dựng một đường ống Dataflow để nạp phản hồi của khách hàng. Trước khi nạp vào kho dữ liệu của mình, bạn phải xác thực địa chỉ email và làm phong phú thêm các chuỗi nhận xét phi cấu trúc bằng phân loại cảm xúc từ AI tạo thế (generative AI sentiment classification). Các bản ghi không hợp lệ cần được định tuyến để xem xét thủ công. Bạn nên triển khai đường ống này như thế nào?
A
Configure the data source system to pre-validate data before sending it to Dataflow and use the BigQuery ML.GENERATE_TEXT command to assign a sentiment score.
Cấu hình hệ thống nguồn dữ liệu để xác thực trước dữ liệu trước khi gửi tới Dataflow và sử dụng lệnh BigQuery ML.GENERATE_TEXT để gán điểm số cảm xúc.
B
Use Dataflow to load all data into BigQuery and execute a SQL MERGE statement to flag invalid records and BigQuery ML to assign sentiment scores.
Sử dụng Dataflow để nạp toàn bộ dữ liệu vào BigQuery, sau đó thực thi một câu lệnh SQL MERGE để gắn cờ các bản ghi không hợp lệ và sử dụng BigQuery ML để gán điểm số cảm xúc.
C
After the Dataflow load completes, execute a Cloud Run function to scan for invalid entries and call Vertex AI to assign sentiment scores.
Sau khi quá trình nạp của Dataflow hoàn tất, thực thi một hàm Cloud Run để quét các bản ghi không hợp lệ và gọi Vertex AI để gán điểm số cảm xúc.
D
Apply a ParDo transform in Dataflow to validate each element, use a RunInference transform to assign sentiment scores, and use side outputs to route valid/invalid records.
Áp dụng biến đổi ParDo trong Dataflow để xác thực từng phần tử, sử dụng biến đổi RunInference để gán điểm số cảm xúc và sử dụng đầu ra phụ (side outputs) để định tuyến các bản ghi hợp lệ/không hợp lệ.
Giải thích & Tài liệu tham khảo
Để triển khai một đường ống Dataflow thực hiện cả kiểm tra dữ liệu, gọi mô hình AI suy luận thời gian thực và phân nhánh dữ liệu:
- D là đáp án đúng: Đây là mẫu thiết kế chuẩn (idiomatic design pattern) của Apache Beam/Dataflow:
- Sử dụng ParDo để áp dụng logic kiểm tra (xác thực địa chỉ email) trên từng phần tử.
- Sử dụng biến đổi RunInference (biến đổi chuyên dụng của Apache Beam để chạy suy luận mô hình học máy) để gọi các mô hình sinh AI / Vertex AI nhằm phân loại cảm xúc với độ trễ thấp và tối ưu hóa tài nguyên.
- Sử dụng đầu ra phụ (side outputs) để định tuyến các bản ghi không hợp lệ ra một luồng riêng (ví dụ: ghi ra một bucket lưu trữ để xem xét thủ công) trong khi dữ liệu hợp lệ tiếp tục đi qua luồng chính để nạp vào BigQuery.
- A, B và C sai: Thực hiện các phép kiểm tra hoặc chạy AI sau khi dữ liệu đã được nạp (post-load) hoặc tại nguồn sẽ làm phá vỡ tính liên tục của luồng xử lý thời gian thực, tăng độ trễ và làm phức tạp quá trình xử lý lỗi của hệ thống.
(Đáp án được gợi ý bởi AI)