# Khoảng tin cậy (Confidence Interval): Sự thật về mức 95%


Khi đọc các nghiên cứu khoa học, ta thường xuyên bắt gặp cụm từ: *"Khoảng tin cậy 95% (95% CI) của biến số X là [A, B]"*. 
Đa số mọi người (thậm chí cả một số nhà nghiên cứu) sẽ diễn giải điều này rằng: *"Có 95% xác suất để giá trị thực sự nằm trong khoảng [A, B]"*. 

**Đó là một sự hiểu lầm căn bản!**

Trong thống kê cổ điển (Frequentist), giá trị trung bình thực sự của quần thể (True Population Mean) là một hằng số cố định. Nó đã nằm ở đó rồi, không hề nhúc nhích hay di chuyển ngẫu nhiên. Nó hoặc là nằm trong khoảng [A, B], hoặc là không. Xác suất lúc này chỉ có thể là 100% hoặc 0%, không có khái niệm 95%.

Vậy con số 95% thực chất mang ý nghĩa gì? 

Nó mô tả **độ tin cậy của bản thân phương pháp đo lường**. Nghĩa là: Nếu ta lặp đi lặp lại quy trình lấy mẫu này vô hạn lần, mỗi lần tính ra một khoảng [A, B] mới, thì sẽ có khoảng 95% số khoảng đó thành công trong việc "bắt" được giá trị thực sự.

Hãy tự mình kiểm chứng điều này qua widget mô phỏng dưới đây.

<div class="interactive-pane">
    <div id="ci-widget" style="margin: 1rem auto; max-width: 900px;"></div>
    <script src="/js/ci-interactive.js?v=1"></script>
    <p align="center" style="font-size:0.85rem; color:#aaa; margin-top:10px;"><i><b>Mô phỏng Khoảng tin cậy 95%:</b> Đường nét đứt màu trắng ở giữa là Giá trị trung bình thực sự của quần thể. Mỗi đường gạch ngang là một Khoảng tin cậy được sinh ra từ một mẫu mới. Nếu đoạn thẳng bao phủ đường nét đứt, nó có màu xanh. Nếu nó "trượt" (không bao phủ), nó sẽ có màu đỏ.<br><br>Hình ảnh trực quan này được phỏng theo hình ảnh trực quan tuyệt vời của Kristoffer Magnusson về khoảng tin cậy.</i></p>
</div>

---

## 1. Cơ chế tính toán

Mô phỏng trên lấy mẫu từ một quần thể có trung bình lý thuyết $\mu = 100$. Nhờ vào sức mạnh của **[Định lý Giới hạn Trung tâm (CLT)]({{< ref "/posts/math/stats/central-limit-theorem.md" >}})**, ta biết rằng trung bình của các mẫu này sẽ phân bố theo hình quả chuông chuẩn. Đối với mỗi mẫu (gồm $N$ cá thể), chúng ta tính:
- Trung bình mẫu $\bar{X}$.
- Độ lệch chuẩn mẫu $s$.
- Sai số chuẩn $SE = \frac{s}{\sqrt{N}}$.

Khoảng tin cậy 95% được xác định bởi:
$$ \text{CI} = \left[ \bar{X} - t_{\alpha/2} \cdot SE, \quad \bar{X} + t_{\alpha/2} \cdot SE \right] $$

Trong đó $t_{\alpha/2}$ là giá trị tới hạn từ phân phối Student t (hoặc phân phối chuẩn Z nếu $N$ đủ lớn). 

## 2. Bài học rút ra

Khi bạn nhấn nút rút 100 mẫu, hãy để ý:
1. Sẽ luôn có một vài đường kẻ màu đỏ. Đó là những lần lấy mẫu "kém may mắn" khi mẫu chứa quá nhiều giá trị lệch hẳn về một phía.
2. Dù bạn rút 1,000 hay 10,000 mẫu, tỷ lệ phủ (Coverage) tổng thể sẽ luôn hội tụ về một con số xấp xỉ **95%**.
3. Cỡ mẫu $N$ càng lớn, các đoạn thẳng (Khoảng tin cậy) càng co ngắn lại, biểu thị sự chính xác cao hơn, nhưng tỷ lệ bắt trúng giá trị thực của chúng vẫn là 95%.

Vì vậy, lần tới khi bạn tạo ra một khoảng tin cậy 95%, hãy nhớ rằng: **Mức độ 95% không thuộc về khoảng [A, B] cụ thể bạn vừa tính ra, mà thuộc về hệ thống phương pháp đã sinh ra nó.**

