Quay lại bộ đề
Question #36 Topic 1
You receive data files in CSV format monthly from a third party. You need to cleanse this data, but every third month the schema of the files changes. Your requirements for implementing these transformations include:✑ Executing the transformations on a schedule✑ Enabling non-developer analysts to modify transformations✑ Providing a graphical tool for designing transformationsWhat should you do?
Bạn nhận được các tệp dữ liệu định dạng CSV hàng tháng từ một bên thứ ba. Bạn cần làm sạch dữ liệu này, nhưng cứ mỗi ba tháng, lược đồ (schema) của các tệp lại thay đổi. Yêu cầu của bạn đối với việc triển khai các chuyển đổi này bao gồm:
✑ Thực hiện các chuyển đổi theo lịch trình
✑ Cho phép các nhà phân tích không phải là lập trình viên (non-developer analysts) sửa đổi các chuyển đổi
✑ Cung cấp một công cụ trực quan (graphical tool) để thiết kế các chuyển đổi
Bạn nên làm gì?
A
Use Dataprep by Trifacta to build and maintain the transformation recipes, and execute them on a scheduled basis
Sử dụng Dataprep bởi Trifacta để xây dựng và duy trì các công thức chuyển đổi (transformation recipes), và thực thi chúng theo lịch trình đã đặt trước
B
Load each month's CSV data into BigQuery, and write a SQL query to transform the data to a standard schema. Merge the transformed tables together with a SQL query
Nạp dữ liệu CSV hàng tháng vào BigQuery, và viết một truy vấn SQL để chuyển đổi dữ liệu sang một lược đồ chuẩn. Gộp các bảng đã được chuyển đổi lại với nhau bằng một truy vấn SQL
C
Help the analysts write a Dataflow pipeline in Python to perform the transformation. The Python code should be stored in a revision control system and modified as the incoming data's schema changes
Giúp các nhà phân tích viết một đường ống Dataflow bằng Python để thực hiện chuyển đổi. Mã Python nên được lưu trữ trong hệ thống quản lý phiên bản và sửa đổi khi lược đồ dữ liệu đầu vào thay đổi
D
Use Apache Spark on Dataproc to infer the schema of the CSV file before creating a Dataframe. Then implement the transformations in Spark SQL before writing the data out to Cloud Storage and loading into BigQuery
Sử dụng Apache Spark trên Dataproc để suy luận lược đồ của tệp CSV trước khi tạo Dataframe. Sau đó, triển khai các chuyển đổi trong Spark SQL trước khi ghi dữ liệu ra Cloud Storage và nạp vào BigQuery
Giải thích & Tài liệu tham khảo
Để đáp ứng đồng thời cả ba yêu cầu: thực thi theo lịch trình, cho phép nhà phân tích (không biết lập trình) chỉnh sửa và có giao diện thiết kế trực quan, dịch vụ phù hợp nhất trên Google Cloud là Cloud Dataprep.
- A. Sử dụng Dataprep bởi Trifacta: Cloud Dataprep cung cấp một giao diện đồ họa trực quan (graphical tool) cho phép người dùng khám phá, làm sạch và chuẩn bị dữ liệu mà không cần viết mã nguồn (phù hợp với các nhà phân tích phi lập trình viên). Nó cho phép tạo các "công thức" (recipes) biến đổi dữ liệu, dễ dàng cập nhật khi lược đồ thay đổi và hỗ trợ lập lịch chạy tự động.
Các lựa chọn khác không phù hợp:
- B: Yêu cầu viết và sửa đổi các câu lệnh SQL phức tạp hàng tháng khi schema thay đổi, gây khó khăn cho các nhà phân tích không chuyên sâu về kỹ thuật.
- C & D: Yêu cầu kiến thức lập trình chuyên sâu (Python, Spark, Apache Beam) để chỉnh sửa và duy trì mã nguồn, không phù hợp cho các nhà phân tích phi lập trình viên.
(Đáp án được gợi ý bởi AI)