Nội dung

LOOCV và K-Fold Cross-Validation: Đánh đổi Bias và Chi phí tính toán

Giải mã câu hỏi kinh điển về các phương pháp tái lấy mẫu

Câu hỏi trắc nghiệm kinh điển về phương pháp tái lấy mẫu:

Câu hỏi: Trong các phát biểu sau, phát biểu nào ĐÚNG?

  • I. Validation set approach là trường hợp đặc biệt của $k$-fold CV.
  • II. LOOCV có độ chệch (bias) thấp hơn $k$-fold CV khi $k < n$.
  • III. $k$-fold CV tốn ít chi phí tính toán hơn LOOCV khi $k < n$.

$\implies$ Đáp án chính xác là (C) Chỉ II và III đúng.


Giải thích bản chất từng phát biểu

1. Phát biểu I: ❌ SAI
Chính LOOCV mới là trường hợp đặc biệt của $k$-fold CV (khi $k = n$). Phương pháp tập kiểm định (Validation Set) chỉ chia dữ liệu một lần duy nhất, không có cơ chế xoay vòng hay lấy trung bình các fold.

2. Phát biểu II: ✅ ĐÚNG (Về Bias)
LOOCV huấn luyện trên $n - 1$ quan sát (gần như toàn bộ dữ liệu), nên ít bị hao hụt cỡ mẫu. Trong khi đó, $k$-fold CV với $k < n$ (ví dụ $k=5$) chỉ dùng $80%$ dữ liệu để train, khiến mô hình yếu hơn và làm tăng nhẹ độ chệch (bias).

3. Phát biểu III: ✅ ĐÚNG (Về Chi phí tính toán)
Khi $k < n$, $k$-fold CV chỉ phải huấn luyện mô hình $k$ lần (thường $k = 5$ hoặc $10$). Ngược lại, LOOCV buộc phải khớp lại mô hình đúng $n$ lần. Với dữ liệu lớn ($n$ hàng nghìn mẫu), LOOCV tốn chi phí rất lớn.


💡 Bản chất về Phương sai (Variance):
Dù LOOCV có bias thấp hơn, nó lại có phương sai cao hơn $k$-fold CV. Lý do: $n$ mô hình trong LOOCV dùng chung $n-2$ điểm dữ liệu nên tương quan cực cao ($\rho \approx 1$). Lấy trung bình các đại lượng tương quan cao sẽ biến thiên mạnh giữa các mẫu. Vì vậy, $k = 5$ hoặc $10$ là “điểm ngọt” tối ưu giữa bias, variance và tốc độ tính toán.