Hồi quy Logistic (Logistic Regression): Khi đường thẳng không còn phù hợp

Trong bài viết trước về Hồi quy tuyến tính, chúng ta dùng một đường thẳng để dự đoán một giá trị liên tục (như giá nhà). Nhưng điều gì sẽ xảy ra nếu chúng ta muốn dự đoán một biến phân loại? Ví dụ: Dựa vào số giờ ôn thi, liệu học sinh có Đậu (1) hay Rớt (0)?

Nếu chúng ta cố gắng dùng một đường thẳng (Hồi quy tuyến tính) cho bài toán này, kết quả sẽ rất kỳ cục. Đường thẳng có thể trả về các giá trị như $1.5$ (hơn cả mức Đậu) hoặc $-0.3$ (dưới cả mức Rớt). Điều này không có ý nghĩa toán học khi ta muốn một xác suất nằm trong khoảng $[0, 1]$.

1. Giải pháp: Hàm Sigmoid

Để bẻ cong đường thẳng sao cho nó luôn nằm trong khoảng từ 0 đến 1, hồi quy Logistic sử dụng một hàm toán học gọi là Hàm Sigmoid:

$$ P(Y=1) = \frac{1}{1 + e^{-(wx + b)}} $$

Trong đó:

  • Đại lượng $wx + b$ chính là một đường thẳng! Chúng ta lấy đường thẳng này và đưa vào hàm Sigmoid.
  • $w$ (trọng số - weight): Quyết định độ dốc của đường cong (chuyển trạng thái từ 0 sang 1 nhanh hay chậm).
  • $b$ (điểm neo - bias): Quyết định vị trí mà đường cong cắt mức xác suất $0.5$ (ngưỡng quyết định).

Hàm Sigmoid ép mọi giá trị từ $-\infty$ đến $+\infty$ về sát trong khoảng $(0, 1)$, biến một bài toán đường thẳng thành một bài toán ước lượng xác suất rất tự nhiên.

2. Mô phỏng Tương tác

Dưới đây là một tập dữ liệu phân loại 1 chiều: Trục X là “Số giờ học”, các điểm màu cam (0) là “Rớt” và màu xanh (1) là “Đậu”.

Hãy thử điều chỉnh $w$ và $b$ để xem đường cong Sigmoid di chuyển như thế nào. Nhiệm vụ của bạn là bẻ cong và dịch chuyển đường Sigmoid sao cho nó bám sát nhất vào sự phân chia của dữ liệu: những điểm màu cam nên nằm ở vùng có xác suất thấp (gần 0), và những điểm màu xanh nên nằm ở vùng xác suất cao (gần 1).

Hàm mục tiêu Log-Loss (Càng nhỏ càng tốt): 0.00
Trọng số ($w$):
0.5
Bias ($b$):
-5.0

Biểu đồ 1: Đường cong Sigmoid uốn lượn để phân tách dữ liệu 0 và 1. Trục Y biểu thị Xác suất Đậu $P(Y=1)$.

Khác với Hồi quy tuyến tính sử dụng tổng bình phương sai số (SSE), Hồi quy Logistic tối ưu hóa một đại lượng gọi là Log-Loss (Cross-Entropy). Hàm Log-Loss phạt rất nặng những dự đoán sai lầm một cách tự tin (ví dụ: dự đoán xác suất đậu là 99% nhưng thực tế lại rớt). Bằng cách giảm thiểu Log-Loss, mô hình học được một đường ranh giới quyết định (decision boundary) chính xác nhất.