Quay lại bộ đề
Question #49 Topic 1
Which of the following methods scales poorly with large data sets?
Phương pháp phân cụm nào sau đây có khả năng mở rộng kém (scales poorly) khi đối mặt với các tập dữ liệu lớn?
A
Fuzzy
Phân cụm mờ (Fuzzy clustering)
B
Density-based
Phân cụm dựa trên mật độ (Density-based clustering)
C
Hierarchical
Phân cụm phân cấp (Hierarchical clustering)
Giải thích & Tài liệu tham khảo
Phân cụm phân cấp (Hierarchical clustering) là thuật toán mở rộng kém nhất với dữ liệu lớn:
- Phân cụm phân cấp (Hierarchical clustering): Thường có độ phức tạp thời gian là $O(N^3)$ hoặc ít nhất là $O(N^2)$ và độ phức tạp không gian là $O(N^2)$ (do cần tính toán và lưu trữ ma trận khoảng cách giữa tất cả các cặp điểm dữ liệu). Khi số lượng điểm dữ liệu $N$ lớn, thuật toán này sẽ tiêu tốn cực kỳ nhiều tài nguyên bộ nhớ và thời gian tính toán.
- Phân cụm mờ (Fuzzy clustering): Dù có độ phức tạp nhất định nhưng có thể được tối ưu hóa tốt hơn nhiều so với phân cấp.
- Phân cụm dựa trên mật độ (Density-based clustering): Ví dụ như DBSCAN có thể đạt hiệu năng tốt hơn đáng kể (độ phức tạp khoảng $O(N \log N)$) khi kết hợp với các cấu trúc cây chỉ mục không gian (như R-tree, KD-tree).
(Đáp án được gợi ý bởi AI)