Quay lại bộ đề
Question #78 Topic 1
Your company is loading comma-separated values (CSV) files into Google BigQuery. The data is fully imported successfully; however, the imported data is not matching byte-to-byte to the source file. What is the most likely cause of this problem?
Công ty của bạn đang tải các tệp giá trị phân tách bằng dấu phẩy (CSV) vào Google BigQuery. Dữ liệu được nhập hoàn toàn thành công; tuy nhiên, dữ liệu được nhập không khớp từng byte (byte-to-byte) với tệp nguồn. Nguyên nhân có khả năng nhất của vấn đề này là gì?
A
The CSV data loaded in BigQuery is not flagged as CSV.
Dữ liệu CSV được tải vào BigQuery không được đánh dấu là CSV.
B
The CSV data has invalid rows that were skipped on import.
Dữ liệu CSV có các hàng không hợp lệ và đã bị bỏ qua khi nhập.
C
The CSV data loaded in BigQuery is not using BigQuery's default encoding.
Dữ liệu CSV được tải vào BigQuery không sử dụng mã hóa mặc định của BigQuery.
D
The CSV data has not gone through an ETL phase before loading into BigQuery.
Dữ liệu CSV chưa trải qua giai đoạn ETL trước khi tải vào BigQuery.
Giải thích & Tài liệu tham khảo
Khi tải dữ liệu CSV vào BigQuery, nếu quá trình tải thành công nhưng dữ liệu không khớp từng byte với tệp nguồn, nguyên nhân phổ biến nhất là có một số hàng bị lỗi hoặc không hợp lệ đã bị bỏ qua.
- B là đáp án đúng: BigQuery cho phép bạn cấu hình thuộc tính
maxBadRecords. Nếu tham số này lớn hơn 0, BigQuery sẽ bỏ qua các hàng không hợp lệ (ví dụ: số lượng cột không khớp, định dạng sai) và tiếp tục nhập các hàng hợp lệ. Do đó, job tải dữ liệu vẫn báo thành công, nhưng dữ liệu trong BigQuery sẽ thiếu các hàng bị lỗi đó, dẫn đến sự khác biệt byte-to-byte so với tệp nguồn. - A không đúng: Nếu không khai báo định dạng là CSV, BigQuery có thể không phân tích cú pháp được dữ liệu hoặc job sẽ thất bại ngay lập tức.
- C không đúng: Mặc định BigQuery sử dụng mã hóa UTF-8. Nếu tệp nguồn dùng mã hóa khác mà không khai báo, dữ liệu có thể bị lỗi hiển thị nhưng không giải thích việc nhập thành công mà lệch số lượng dữ liệu/byte.
- D không đúng: Việc dữ liệu chưa qua ETL không tự động gây ra lỗi lệch byte nếu toàn bộ tệp nguồn được nhập nguyên bản mà không có lỗi cấu trúc hàng.
(Đáp án được gợi ý bởi AI)