Nội dung

Model Bias và Estimator Bias: Cạm bẫy nhầm lẫn trong Cross-Validation

Phân biệt độ chệch của mô hình học máy và độ chệch của ước lượng sai số

Khi học về phân rã Bias – VarianceCross-Validation, nhiều người bối rối trước phát biểu: “5-fold CV có bias cao hơn LOOCV”.

“Cùng một mô hình, tại sao chia dữ liệu lại làm thay đổi độ chệch?”

Sự nhầm lẫn xuất phát từ việc đánh đồng hai khái niệm:


1. Model Bias (Độ chệch của mô hình)

Đây là năng lực nội tại của dạng hàm bạn chọn:

  • Dùng Hồi quy tuyến tính để khớp một quy luật cong, thì dù có nạp 100% hay 1 tỷ dữ liệu, đường thẳng vẫn không thể khớp hoàn hảo đường cong.
  • Sự sai lệch này sinh ra từ giả định cấu trúc cố hữu của mô hình. Cách bạn chia dữ liệu kiểm định không làm thay đổi Model Bias.

2. Estimator Bias (Độ chệch của ước lượng sai số)

Đây không phải độ chệch của hàm mô hình, mà là độ chệch trong thước đo ước lượng sai số ngoài mẫu:

  • Trong 5-fold CV, mỗi lần lặp ta chỉ cho mô hình học trên $80%$ dữ liệu. Lượng dữ liệu thu hẹp khiến mô hình dự đoán kém đi một chút.
  • Hậu quả là sai số kiểm định mà 5-fold CV báo cáo bị thổi phồng bi quan (pessimistic bias) so với sai số thực tế khi bạn huấn luyện mô hình trên $100%$ dữ liệu sau này.
  • Ngược lại, LOOCV dùng tới $n - 1$ mẫu ($\approx 100%$), nên Estimator Bias của nó gần như bằng 0.

💡 Tóm lại một câu:
Model Bias: “Mô hình của bạn lệch bao nhiêu so với chân lý thực tế?”
Estimator Bias: “Công cụ đo (CV) ước lượng sai số lệch bao nhiêu so với sai số thực tế ngoài đời?”