Kiểm định Kolmogorov-Smirnov (K-S Test)
So sánh phân phối thực nghiệm và phân phối lý thuyết
Trong thống kê, chúng ta thường xuyên phải trả lời câu hỏi: Mẫu dữ liệu này có tuân theo một phân phối cụ thể nào đó (như Chuẩn, Mũ, Uniform) hay không? Hoặc: Hai mẫu dữ liệu độc lập có xuất phát từ cùng một quần thể hay không?
Kiểm định Kolmogorov-Smirnov (K-S test) là một trong những công cụ phi tham số (non-parametric) phổ biến nhất để giải quyết bài toán mức độ phù hợp (goodness-of-fit) này.
Trực giác và Thống kê kiểm định
Ý tưởng cốt lõi của kiểm định K-S rất trực quan: Nó so sánh hàm phân phối tích lũy thực nghiệm (ECDF) của dữ liệu mẫu với hàm phân phối tích lũy lý thuyết (CDF).
$$ D_n = \sup_x |F_n(x) - F(x)| $$Trong đó:
- $F_n(x)$ là ECDF của mẫu (tỷ lệ các quan sát có giá trị $\leq x$).
- $F(x)$ là CDF lý thuyết.
Trong phiên bản kiểm định 2 mẫu (2-sample K-S test), $D_n$ là khoảng cách lớn nhất giữa hai đường ECDF của hai mẫu.
- Giả thuyết không ($H_0$): Mẫu tuân theo phân phối lý thuyết $F(x)$ (hoặc hai mẫu cùng chung một phân phối).
- Giả thuyết thay thế ($H_1$): Mẫu không tuân theo phân phối lý thuyết đó.
Nếu khoảng cách $D_n$ đủ lớn (vượt qua giá trị tới hạn phụ thuộc vào cỡ mẫu $n$ và mức ý nghĩa $\alpha$), ta bác bỏ $H_0$.
Ưu điểm và Hạn chế
Ưu điểm:
- Tính tổng quát: Khác với kiểm định Shapiro-Wilk chỉ dành riêng cho phân phối chuẩn, K-S test có thể áp dụng để kiểm tra bất kỳ phân phối liên tục nào.
- Tính phi tham số: Phân phối của thống kê $D_n$ (dưới $H_0$) không phụ thuộc vào phân phối lý thuyết $F(x)$ được kiểm định, miễn là $F(x)$ liên tục.
Hạn chế:
- Sức mạnh kiểm định (Power): Chính vì tính tổng quát của nó, K-S test thường có sức mạnh kiểm định thấp hơn các kiểm định chuyên biệt. Ví dụ, nếu bạn muốn kiểm tra phân phối Chuẩn, Shapiro-Wilk hoặc Anderson-Darling nhạy bén hơn nhiều so với K-S test.
- Độ nhạy ở phần đuôi: Khoảng cách lớn nhất thường xảy ra ở phần giữa của phân phối, nơi phương sai của ECDF lớn nhất. Do đó, K-S test kém nhạy cảm với những sai lệch nằm ở phần đuôi của phân phối (phần cực trị).
- Tham số phải biết trước: Trong phiên bản gốc, K-S test đòi hỏi các tham số của phân phối lý thuyết (ví dụ $\mu, \sigma$) phải được biết trước, chứ không phải được ước lượng từ chính mẫu đang xét. Nếu bạn dùng mẫu để ước lượng $\mu, \sigma$ rồi mới chạy K-S test, phân phối của thống kê kiểm định sẽ thay đổi (lúc này cần dùng tới kiểm định xấp xỉ Lilliefors).
Tóm lại, K-S test là một công cụ đa năng và trực quan để kiểm tra phân phối, nhưng không nên được xem là bằng chứng tuyệt đối cho việc dữ liệu tuân theo một phân phối cụ thể. Khái niệm “không bác bỏ được $H_0$” chỉ đơn giản là sai lệch chưa đủ lớn để bị phát hiện.