Quay lại bộ đề
Question #18 Topic 1
You are designing storage for very large text files for a data pipeline on Google Cloud. You want to support ANSI SQL queries. You also want to support compression and parallel load from the input locations using Google recommended practices. What should you do?
Bạn đang thiết kế lưu trữ cho các tệp văn bản rất lớn cho một pipeline dữ liệu trên Google Cloud. Bạn muốn hỗ trợ các truy vấn ANSI SQL. Bạn cũng muốn hỗ trợ nén và tải song song từ các vị trí đầu vào theo các thực hành được khuyến nghị của Google. Bạn nên làm gì?
A
Transform text files to compressed Avro using Cloud Dataflow. Use BigQuery for storage and query.
Chuyển đổi các tệp văn bản thành định dạng Avro nén bằng cách sử dụng Cloud Dataflow. Sử dụng BigQuery để lưu trữ và truy vấn.
B
Transform text files to compressed Avro using Cloud Dataflow. Use Cloud Storage and BigQuery permanent linked tables for query.
Chuyển đổi các tệp văn bản thành định dạng Avro nén bằng cách sử dụng Cloud Dataflow. Sử dụng Cloud Storage và các bảng liên kết vĩnh viễn (external tables) của BigQuery để truy vấn.
C
Compress text files to gzip using the Grid Computing Tools. Use BigQuery for storage and query.
Nén các tệp văn bản thành định dạng gzip bằng Grid Computing Tools. Sử dụng BigQuery để lưu trữ và truy vấn.
D
Compress text files to gzip using the Grid Computing Tools. Use Cloud Storage, and then import into Cloud Bigtable for query.
Nén các tệp văn bản thành định dạng gzip bằng Grid Computing Tools. Sử dụng Cloud Storage, sau đó nhập vào Cloud Bigtable để truy vấn.
Giải thích & Tài liệu tham khảo
Để đáp ứng yêu cầu lưu trữ tệp văn bản rất lớn, hỗ trợ truy vấn ANSI SQL, nén dữ liệu và tải song song (parallel load):
- B. Chuyển đổi thành định dạng Avro nén sử dụng Cloud Dataflow, lưu trữ trên Cloud Storage và truy vấn qua bảng liên kết BigQuery:
- Avro là định dạng nhị phân, hướng hàng, hỗ trợ chia nhỏ tệp (splittable) ngay cả khi bị nén. Điều này cho phép BigQuery tải và đọc dữ liệu song song hiệu quả.
- Sử dụng Cloud Storage giúp tối ưu hóa chi phí lưu trữ cho các tệp rất lớn, kết hợp với bảng liên kết vĩnh viễn (external tables) của BigQuery để chạy các truy vấn ANSI SQL trực tiếp mà không cần nạp toàn bộ vào bộ lưu trữ BigQuery.
- A sai vì việc nạp và lưu trữ trực tiếp toàn bộ dữ liệu khổng lồ vào BigQuery có thể tốn kém hơn nhiều so với lưu trữ trên Cloud Storage cho dữ liệu dạng tệp tĩnh ít truy cập thường xuyên.
- C & D dùng định dạng nén gzip (không thể chia nhỏ - non-splittable), do đó không hỗ trợ đọc song song tốt, vi phạm thực hành khuyến nghị. Hơn nữa, Cloud Bigtable không hỗ trợ truy vấn ANSI SQL trực tiếp.
(Đáp án được gợi ý bởi AI)