# LOOCV và K-Fold Cross-Validation: Đánh đổi Bias và Chi phí tính toán


Câu hỏi trắc nghiệm kinh điển về phương pháp tái lấy mẫu:

> **Câu hỏi:** Trong các phát biểu sau, phát biểu nào **ĐÚNG**?  
> - **I.** Validation set approach là trường hợp đặc biệt của $k$-fold CV.  
> - **II.** LOOCV có độ chệch (bias) thấp hơn $k$-fold CV khi $k < n$.  
> - **III.** $k$-fold CV tốn ít chi phí tính toán hơn LOOCV khi $k < n$.  
>
> $\implies$ Đáp án chính xác là **(C) Chỉ II và III đúng**.

---

### Giải thích bản chất từng phát biểu

**1. Phát biểu I: ❌ SAI**  
Chính **LOOCV** mới là trường hợp đặc biệt của $k$-fold CV (khi $k = n$). Phương pháp tập kiểm định (*Validation Set*) chỉ chia dữ liệu **một lần duy nhất**, không có cơ chế xoay vòng hay lấy trung bình các fold.

**2. Phát biểu II: ✅ ĐÚNG (Về Bias)**  
LOOCV huấn luyện trên $n - 1$ quan sát (gần như toàn bộ dữ liệu), nên ít bị hao hụt cỡ mẫu. Trong khi đó, $k$-fold CV với $k < n$ (ví dụ $k=5$) chỉ dùng $80\%$ dữ liệu để train, khiến mô hình yếu hơn và làm tăng nhẹ [độ chệch (bias)]({{< ref "bias-variance-tradeoff.md" >}}).

**3. Phát biểu III: ✅ ĐÚNG (Về Chi phí tính toán)**  
Khi $k < n$, $k$-fold CV chỉ phải huấn luyện mô hình $k$ lần (thường $k = 5$ hoặc $10$). Ngược lại, LOOCV buộc phải khớp lại mô hình đúng $n$ lần. Với dữ liệu lớn ($n$ hàng nghìn mẫu), LOOCV tốn chi phí rất lớn.

---

> 💡 **Bản chất về Phương sai (Variance):**  
> Dù LOOCV có bias thấp hơn, nó lại có **phương sai cao hơn** $k$-fold CV. Lý do: $n$ mô hình trong LOOCV dùng chung $n-2$ điểm dữ liệu nên tương quan cực cao ($\rho \approx 1$). Lấy trung bình các đại lượng tương quan cao sẽ biến thiên mạnh giữa các mẫu. Vì vậy, $k = 5$ hoặc $10$ là "điểm ngọt" tối ưu giữa bias, variance và tốc độ tính toán.

