Quay lại bộ đề
Question #122 Topic 1
You work for a bank. You have a labelled dataset that contains information on already granted loan application and whether these applications have been defaulted. You have been asked to train a model to predict default rates for credit applicants.What should you do?
Bạn làm việc cho một ngân hàng. Bạn có một bộ dữ liệu đã được dán nhãn chứa thông tin về các hồ sơ xin vay vốn đã được duyệt và liệu các hồ sơ này có bị vỡ nợ hay không. Bạn được yêu cầu huấn luyện một mô hình để dự đoán tỷ lệ vỡ nợ cho các khách hàng xin cấp tín dụng. Bạn nên làm gì?
A
Increase the size of the dataset by collecting additional data.
Tăng kích thước của bộ dữ liệu bằng cách thu thập thêm dữ liệu.
B
Train a linear regression to predict a credit default risk score.
Huấn luyện một mô hình hồi quy tuyến tính để dự đoán điểm số rủi ro vỡ nợ tín dụng.
C
Remove the bias from the data and collect applications that have been declined loans.
Loại bỏ định kiến khỏi dữ liệu và thu thập cả các hồ sơ xin vay đã bị từ chối.
D
Match loan applicants with their social profiles to enable feature engineering.
Khớp các ứng viên xin vay với hồ sơ mạng xã hội của họ để hỗ trợ thiết kế đặc trưng (feature engineering).
Giải thích & Tài liệu tham khảo
Mục tiêu là dự đoán tỷ lệ vỡ nợ (default rates) hoặc điểm số rủi ro (risk score) cho các hồ sơ đăng ký vay mới dựa trên dữ liệu lịch sử đã giải ngân.
- A. Tăng kích thước bộ dữ liệu bằng cách thu thập dữ liệu bổ sung: Mặc dù việc có nhiều dữ liệu hơn luôn hữu ích, nhưng điều này không giải quyết trực tiếp cách thiết lập mô hình dự đoán tỷ lệ vỡ nợ và không chỉ ra thuật toán cụ thể nào cần áp dụng.
- B. Huấn luyện hồi quy tuyến tính để dự đoán điểm số rủi ro vỡ nợ tín dụng: Đây là phương pháp phổ biến và trực tiếp nhất trong ngành tài chính. Mô hình hồi quy tuyến tính (hoặc hồi quy logistic để dự đoán xác suất) có thể được sử dụng để tính điểm số rủi ro (risk score) cho mỗi khách hàng dựa trên các biến đầu vào, giúp đưa ra quyết định duyệt hay từ chối hồ sơ.
- C. Loại bỏ định kiến khỏi dữ liệu và thu thập cả các hồ sơ đã bị từ chối: Trên lý thuyết, hồ sơ bị từ chối giúp giảm bớt thiên lệch lựa chọn (selection bias). Tuy nhiên, các hồ sơ bị từ chối này không bao giờ được giải ngân, do đó chúng không có nhãn thực tế về việc liệu họ có "vỡ nợ" hay không. Việc sử dụng chúng trong mô hình học có giám sát là cực kỳ phức tạp và không khả thi một cách đơn giản (yêu cầu kỹ thuật Reject Inference phức tạp).
- D. Ghép nối ứng viên với hồ sơ mạng xã hội: Điều này vi phạm nghiêm trọng quyền riêng tư dữ liệu của khách hàng cũng như các quy định nghiêm ngặt về bảo mật thông tin trong ngành ngân hàng.
(Đáp án được gợi ý bởi AI)