Quay lại bộ đề
Question #248 Topic 1
You work for a large real estate firm and are preparing 6 TB of home sales data to be used for machine learning. You will use SQL to transform the data and useBigQuery ML to create a machine learning model. You plan to use the model for predictions against a raw dataset that has not been transformed. How should you set up your workflow in order to prevent skew at prediction time?
Bạn làm việc cho một công ty bất động sản lớn và đang chuẩn bị 6 TB dữ liệu bán nhà để sử dụng cho học máy. Bạn sẽ sử dụng SQL để biến đổi dữ liệu và sử dụng BigQuery ML để tạo mô hình học máy. Bạn có kế hoạch sử dụng mô hình này để dự đoán trên một tập dữ liệu thô chưa được biến đổi. Bạn nên thiết lập quy trình làm việc của mình như thế nào để ngăn chặn hiện tượng lệch dữ liệu (skew) tại thời điểm dự đoán?
A
When creating your model, use BigQuery's TRANSFORM clause to define preprocessing steps. At prediction time, use BigQuery's ML.EVALUATE clause without specifying any transformations on the raw input data.
Khi tạo mô hình, hãy sử dụng mệnh đề TRANSFORM của BigQuery để xác định các bước tiền xử lý. Tại thời điểm dự đoán, sử dụng mệnh đề ML.EVALUATE (hoặc ML.PREDICT) của BigQuery mà không cần chỉ định bất kỳ biến đổi nào trên dữ liệu đầu vào thô.
B
When creating your model, use BigQuery's TRANSFORM clause to define preprocessing steps. Before requesting predictions, use a saved query to transform your raw input data, and then use ML.EVALUATE.
Khi tạo mô hình, hãy sử dụng mệnh đề TRANSFORM của BigQuery để xác định các bước tiền xử lý. Trước khi yêu cầu dự đoán, hãy sử dụng một truy vấn đã lưu để biến đổi dữ liệu đầu vào thô của bạn, sau đó sử dụng ML.EVALUATE.
C
Use a BigQuery view to define your preprocessing logic. When creating your model, use the view as your model training data. At prediction time, use BigQuery's ML.EVALUATE clause without specifying any transformations on the raw input data.
Sử dụng một BigQuery view để xác định logic tiền xử lý của bạn. Khi tạo mô hình, hãy sử dụng view đó làm dữ liệu huấn luyện mô hình của bạn. Tại thời điểm dự đoán, sử dụng mệnh đề ML.EVALUATE của BigQuery mà không cần chỉ định bất kỳ biến đổi nào trên dữ liệu đầu vào thô.
D
Preprocess all data using Dataflow. At prediction time, use BigQuery's ML.EVALUATE clause without specifying any further transformations on the input data.
Tiền xử lý tất cả dữ liệu bằng Dataflow. Tại thời điểm dự đoán, sử dụng mệnh đề ML.EVALUATE của BigQuery mà không cần chỉ định thêm bất kỳ biến đổi nào trên dữ liệu đầu vào.
Giải thích & Tài liệu tham khảo
Để ngăn ngừa lệch dữ liệu huấn luyện-phục vụ (training-serving skew) khi áp dụng các biến đổi tiền xử lý:
- Sử dụng mệnh đề TRANSFORM trong câu lệnh CREATE MODEL của BigQuery ML (Lựa chọn A): Khi bạn định nghĩa các bước tiền xử lý dữ liệu trong mệnh đề
TRANSFORM, BigQuery ML sẽ tự động nhúng các bước này vào mô hình. Tại thời điểm dự đoán (hoặc đánh giá), bạn chỉ cần truyền dữ liệu thô vàoML.PREDICThayML.EVALUATE. Các bước tiền xử lý sẽ được áp dụng tự động và nhất quán, ngăn ngừa hoàn toàn lỗi lệch dữ liệu. - Lựa chọn B: Yêu cầu tiền xử lý thủ công dữ liệu thô trước khi dự đoán, dễ gây sai sót và lệch logic.
- Lựa chọn C: Mô hình huấn luyện từ view sẽ không tự động ghi nhớ các bước biến đổi dữ liệu; khi dự đoán trên dữ liệu thô sẽ thiếu các bước tiền xử lý và dẫn đến lỗi.
- Lựa chọn D: Mặc dù sử dụng Dataflow là một cách tiếp cận, nhưng nó làm tăng độ phức tạp của hệ thống và đòi hỏi phải tự đồng bộ hóa logic biến đổi giữa hai hệ thống khác nhau.
(Đáp án được gợi ý bởi AI)