Quay lại bộ đề
Question #268 Topic 1
You are developing a new deep learning model that predicts a customer's likelihood to buy on your ecommerce site. After running an evaluation of the model against both the original training data and new test data, you find that your model is overfitting the data. You want to improve the accuracy of the model when predicting new data. What should you do?
Bạn đang phát triển một mô hình deep learning mới dự đoán khả năng mua hàng của khách hàng trên trang thương mại điện tử của bạn. Sau khi chạy đánh giá mô hình trên cả dữ liệu huấn luyện ban đầu và dữ liệu kiểm thử mới, bạn thấy mô hình của mình đang bị quá khớp (overfitting). Bạn muốn cải thiện độ chính xác của mô hình khi dự đoán dữ liệu mới. Bạn nên làm gì?
A
Write a shell script that triggers a Cloud Function that performs periodic ETL batch jobs on the new data source.
Viết một shell script để kích hoạt một Cloud Function thực hiện các batch job ETL định kỳ trên nguồn dữ liệu mới.
B
Use a standard Dataflow pipeline to store the raw data in BigQuery, and then transform the format later when the data is used.
Sử dụng một Dataflow pipeline tiêu chuẩn để lưu trữ dữ liệu thô trong BigQuery, sau đó chuyển đổi định dạng sau khi dữ liệu được sử dụng.
C
Use Apache Hive to write a Dataproc job that streams the data into BigQuery in CSV format.
Sử dụng Apache Hive để viết một Dataproc job truyền (stream) dữ liệu vào BigQuery dưới định dạng CSV.
D
Use an Apache Beam custom connector to write a Dataflow pipeline that streams the data into BigQuery in Avro format.
Sử dụng một Apache Beam custom connector để viết một Dataflow pipeline truyền dữ liệu vào BigQuery dưới định dạng Avro.
Giải thích & Tài liệu tham khảo
> [!NOTE]
> Lưu ý: Câu hỏi này bị lỗi hiển thị lựa chọn trong đề thi gốc. Câu hỏi tiếng Anh hỏi về cách xử lý overfitting của mô hình deep learning, nhưng các lựa chọn trong tệp JSON này lại thuộc về một câu hỏi khác về việc kết nối và stream nguồn dữ liệu định dạng độc quyền (proprietary format) của hãng hàng không vũ trụ vào BigQuery.
Dựa trên các lựa chọn hiện tại trong tệp JSON:
- Lựa chọn D (Use an Apache Beam custom connector to write a Dataflow pipeline that streams the data into BigQuery in Avro format) là phương án tối ưu nhất để giải quyết bài toán stream dữ liệu định dạng độc quyền vào BigQuery:
- Apache Beam custom connector: Giúp xử lý các định dạng dữ liệu độc quyền không được hỗ trợ sẵn.
- Dataflow pipeline: Hỗ trợ truyền dữ liệu thời gian thực (streaming) với khả năng mở rộng tự động.
- Avro format: Định dạng dữ liệu nhị phân hiệu năng cao, giúp nạp dữ liệu vào BigQuery nhanh chóng và tiêu tốn ít tài nguyên nhất.
- Tại sao các lựa chọn khác sai:
- A & B: Không đáp ứng được yêu cầu xử lý thời gian thực (streaming) hiệu quả hoặc không tối ưu về mặt tài nguyên khi cần biến đổi dữ liệu độc quyền trước khi lưu trữ.
- C: Apache Hive trên Dataproc là giải pháp tốn nhiều tài nguyên hạ tầng tự quản lý hơn so với dịch vụ serverless Dataflow.
(Đáp án được gợi ý bởi AI)