Quay lại bộ đề
Question #142 Topic 1
You have a variety of files in Cloud Storage that your data science team wants to use in their models. Currently, users do not have a method to explore, cleanse, and validate the data in Cloud Storage. You are looking for a low code solution that can be used by your data science team to quickly cleanse and explore data within Cloud Storage. What should you do?
Bạn có nhiều tệp khác nhau trong Cloud Storage mà đội ngũ khoa học dữ liệu của bạn muốn sử dụng cho các mô hình của họ. Hiện tại, người dùng không có phương pháp nào để khám phá, làm sạch và xác thực dữ liệu trong Cloud Storage. Bạn đang tìm kiếm một giải pháp ít viết mã (low-code) có thể được sử dụng bởi đội ngũ khoa học dữ liệu để nhanh chóng làm sạch và khám phá dữ liệu bên trong Cloud Storage. Bạn nên làm gì?
A
Provide the data science team access to Dataflow to create a pipeline to prepare and validate the raw data and load data into BigQuery for data exploration.
Cung cấp cho đội ngũ khoa học dữ liệu quyền truy cập vào Dataflow để tạo một đường dẫn chuẩn bị và xác thực dữ liệu thô và tải dữ liệu vào BigQuery để khám phá dữ liệu.
B
Create an external table in BigQuery and use SQL to transform the data as necessary. Provide the data science team access to the external tables to explore the raw data.
Tạo một bảng bên ngoài (external table) trong BigQuery và sử dụng SQL để biến đổi dữ liệu khi cần thiết. Cung cấp cho đội ngũ khoa học dữ liệu quyền truy cập vào các bảng bên ngoài để khám phá dữ liệu thô.
C
Load the data into BigQuery and use SQL to transform the data as necessary. Provide the data science team access to staging tables to explore the raw data.
Tải dữ liệu vào BigQuery và sử dụng SQL để biến đổi dữ liệu khi cần thiết. Cung cấp cho đội ngũ khoa học dữ liệu quyền truy cập vào các bảng tạm thời (staging tables) để khám phá dữ liệu thô.
D
Provide the data science team access to Dataprep to prepare, validate, and explore the data within Cloud Storage.
Cung cấp cho đội ngũ khoa học dữ liệu quyền truy cập vào Dataprep để chuẩn bị, xác thực và khám phá dữ liệu trong Cloud Storage.
Giải thích & Tài liệu tham khảo
Yêu cầu đặt ra là một giải pháp trực quan, ít viết mã (low-code) để khám phá, làm sạch và xác thực dữ liệu trực tiếp từ Cloud Storage.
- D là đúng: Cloud Dataprep (được vận hành bởi Trifacta) là một dịch vụ chuẩn bị dữ liệu trực quan no-code/low-code. Nó được thiết kế riêng cho các nhà phân tích và khoa học dữ liệu để nhanh chóng khám phá cấu trúc dữ liệu, làm sạch (cleanse) và xác thực (validate) dữ liệu trên Cloud Storage thông qua giao diện đồ họa kéo thả, đề xuất tự động mà không cần viết mã nguồn phức tạp.
- A là sai: Dataflow dựa trên Apache Beam SDK và yêu cầu kỹ năng lập trình cao (Java/Python/Go) để viết các pipeline xử lý dữ liệu. Đây là giải pháp viết mã nhiều (high-code).
- B và C là sai: Việc tạo bảng và viết các câu lệnh SQL dài để chuyển đổi dữ liệu không mang lại trải nghiệm khám phá dữ liệu trực quan nhanh chóng và không được xem là giải pháp low-code tối ưu nhất cho việc làm sạch dữ liệu tương tác.
(Đáp án được gợi ý bởi AI)