Quay lại bộ đề
Question #127 Topic 1
You need ads data to serve AI models and historical data for analytics. Longtail and outlier data points need to be identified. You want to cleanse the data in near-real time before running it through AI models. What should you do?
Bạn cần dữ liệu quảng cáo để phục vụ các mô hình AI và dữ liệu lịch sử để phân tích. Cần phải xác định các điểm dữ liệu longtail (đuôi dài) và outlier (điểm dị biệt). Bạn muốn làm sạch dữ liệu trong thời gian cận thực (near-real time) trước khi chạy qua các mô hình AI. Bạn nên làm gì?
A
Use Cloud Storage as a data warehouse, shell scripts for processing, and BigQuery to create views for desired datasets.
Sử dụng Cloud Storage làm kho dữ liệu (data warehouse), sử dụng shell script để xử lý, và sử dụng BigQuery để tạo các view cho các tập dữ liệu mong muốn.
B
Use Dataflow to identify longtail and outlier data points programmatically, with BigQuery as a sink.
Sử dụng Dataflow để xác định các điểm dữ liệu longtail và outlier bằng lập trình, với BigQuery làm đích lưu trữ (sink).
C
Use BigQuery to ingest, prepare, and then analyze the data, and then run queries to create views.
Sử dụng BigQuery để thu nhận, chuẩn bị, và sau đó phân tích dữ liệu, rồi chạy các truy vấn để tạo các view.
D
Use Cloud Composer to identify longtail and outlier data points, and then output a usable dataset to BigQuery.
Sử dụng Cloud Composer để xác định các điểm dữ liệu longtail và outlier, sau đó xuất tập dữ liệu có thể sử dụng sang BigQuery.
Giải thích & Tài liệu tham khảo
Để thực hiện làm sạch dữ liệu và phát hiện bất thường (outliers/longtail) trong thời gian cận thực (near-real time):
- Dataflow: Là lựa chọn tối ưu cho việc xử lý dòng dữ liệu (streaming data processing) thời gian thực. Bằng cách viết mã xử lý (ví dụ: Apache Beam Java/Python SDK), bạn có thể dễ dàng thiết lập logic để lọc, làm sạch và phát hiện các giá trị outlier một cách lập trình trước khi lưu dữ liệu.
- BigQuery làm Sink: Sau khi Dataflow làm sạch dữ liệu, nó sẽ ghi trực tiếp vào BigQuery, tạo ra kho dữ liệu đáng tin cậy để phân tích lịch sử và cung cấp cho mô hình AI.
- Tại sao các lựa chọn khác sai?
- A: Cloud Storage không phải là Data Warehouse; shell script không thể xử lý dữ liệu lớn cận thực thời gian một cách ổn định.
- C: BigQuery không tối ưu cho việc làm sạch và biến đổi dữ liệu phức tạp theo thời gian thực (stream processing) trước khi nạp.
- D: Cloud Composer là công cụ điều phối (orchestrator), không được thiết kế để trực tiếp xử lý dữ liệu dòng lớn ở tầng tính toán.
(Đáp án được gợi ý bởi AI)