Quay lại bộ đề
Question #50 Topic 1
You are designing storage for 20 TB of text files as part of deploying a data pipeline on Google Cloud. Your input data is in CSV format. You want to minimize the cost of querying aggregate values for multiple users who will query the data in Cloud Storage with multiple engines. Which storage service and schema design should you use?
Bạn đang thiết kế lưu trữ cho 20 TB file văn bản như một phần của việc triển khai data pipeline trên Google Cloud. Dữ liệu đầu vào của bạn ở định dạng CSV. Bạn muốn giảm thiểu chi phí truy vấn các giá trị tổng hợp (aggregate values) cho nhiều người dùng sẽ truy vấn dữ liệu trong Cloud Storage bằng nhiều công cụ khác nhau. Bạn nên sử dụng dịch vụ lưu trữ và thiết kế schema nào?
A
Use Cloud Bigtable for storage. Install the HBase shell on a Compute Engine instance to query the Cloud Bigtable data.
Sử dụng Cloud Bigtable để lưu trữ. Cài đặt HBase shell trên một thực thể Compute Engine để truy vấn dữ liệu Cloud Bigtable.
B
Use Cloud Bigtable for storage. Link as permanent tables in BigQuery for query.
Sử dụng Cloud Bigtable để lưu trữ. Liên kết dưới dạng các bảng vĩnh viễn trong BigQuery để truy vấn.
C
Use Cloud Storage for storage. Link as permanent tables in BigQuery for query.
Sử dụng Cloud Storage để lưu trữ. Liên kết dưới dạng các bảng vĩnh viễn trong BigQuery để truy vấn.
D
Use Cloud Storage for storage. Link as temporary tables in BigQuery for query.
Sử dụng Cloud Storage để lưu trữ. Liên kết dưới dạng các bảng tạm thời trong BigQuery để truy vấn.
Giải thích & Tài liệu tham khảo
Yêu cầu đặt ra là lưu trữ 20 TB file CSV với chi phí thấp nhất và cho phép nhiều người dùng sử dụng nhiều công cụ khác nhau để truy vấn dữ liệu này.
- C. Sử dụng Cloud Storage và liên kết bảng vĩnh viễn trong BigQuery:
- Cloud Storage là nơi lưu trữ dữ liệu dạng file (CSV) rẻ nhất trong các tùy chọn.
- Việc tạo bảng liên kết vĩnh viễn (permanent external table) trong BigQuery giúp lưu trữ định nghĩa schema của bảng trong siêu dữ liệu (metadata) của BigQuery. Người dùng có thể truy vấn trực tiếp dữ liệu thô trên Cloud Storage bằng SQL thông qua BigQuery mà không cần nạp dữ liệu vào BigQuery, đồng thời các công cụ khác vẫn có thể truy cập file CSV trực tiếp từ Cloud Storage.
- A và B. Sử dụng Cloud Bigtable: Bigtable có chi phí lưu trữ và vận hành cụm cao hơn rất nhiều so với Cloud Storage và không phù hợp để lưu trữ file CSV thô để phân tích dạng bảng.
- D. Bảng tạm thời (temporary table): Bảng tạm thời chỉ tồn tại trong phiên làm việc của một truy vấn cụ thể, không cho phép nhiều người dùng khác nhau chia sẻ chung một định nghĩa schema một cách thuận tiện.
(Đáp án được gợi ý bởi AI)