# Model Bias và Estimator Bias: Cạm bẫy nhầm lẫn trong Cross-Validation


Khi học về [phân rã Bias – Variance]({{< ref "bias-variance-tradeoff.md" >}}) và [Cross-Validation]({{< ref "loocv-vs-k-fold-cv.md" >}}), nhiều người bối rối trước phát biểu: *"5-fold CV có bias cao hơn LOOCV"*.

*"Cùng một mô hình, tại sao chia dữ liệu lại làm thay đổi độ chệch?"*

Sự nhầm lẫn xuất phát từ việc đánh đồng hai khái niệm:

---

### 1. Model Bias (Độ chệch của mô hình)

Đây là **năng lực nội tại** của dạng hàm bạn chọn:

- Dùng [Hồi quy tuyến tính]({{< ref "linear-regression.md" >}}) để khớp một quy luật cong, thì dù có nạp 100% hay 1 tỷ dữ liệu, đường thẳng vẫn không thể khớp hoàn hảo đường cong.
- Sự sai lệch này sinh ra từ **giả định cấu trúc cố hữu** của mô hình. Cách bạn chia dữ liệu kiểm định không làm thay đổi Model Bias.

---

### 2. Estimator Bias (Độ chệch của ước lượng sai số)

Đây **không phải** độ chệch của hàm mô hình, mà là độ chệch trong **thước đo ước lượng sai số ngoài mẫu**:

- Trong 5-fold CV, mỗi lần lặp ta chỉ cho mô hình học trên $80\%$ dữ liệu. Lượng dữ liệu thu hẹp khiến mô hình dự đoán kém đi một chút.
- Hậu quả là sai số kiểm định mà 5-fold CV báo cáo bị **thổi phồng bi quan** (pessimistic bias) so với sai số thực tế khi bạn huấn luyện mô hình trên $100\%$ dữ liệu sau này.
- Ngược lại, [LOOCV]({{< ref "loocv-vs-k-fold-cv.md" >}}) dùng tới $n - 1$ mẫu ($\approx 100\%$), nên Estimator Bias của nó gần như bằng 0.

---

> 💡 **Tóm lại một câu:**  
> **Model Bias:** *"Mô hình của bạn lệch bao nhiêu so với chân lý thực tế?"*  
> **Estimator Bias:** *"Công cụ đo (CV) ước lượng sai số lệch bao nhiêu so với sai số thực tế ngoài đời?"*

