Nội dung

Tại Sao 'Thông Tin' Lại Dùng Logarit?

Probability multiplies, information adds: Cây cầu biến thế giới nhân thành không gian cộng

Vì log gần như là hàm tự nhiên nhất khi ta muốn một đại lượng gọi là “information”.

1. Trực giác cốt lõi: Xác suất nhân, thông tin cộng

Nếu hai sự kiện độc lập xảy ra với xác suất $p$ và $q$, thì xác suất để cả hai cùng xảy ra là $pq$.

Nhưng ta muốn lượng thông tin thu được phải cộng dồn:

$$ I(pq) = I(p) + I(q). $$

Hàm liên tục thỏa mãn tính chất này có dạng:

$$ I(p) = -\log p. $$

Đó là lý do Shannon information dùng:

$$ -\log p(x). $$

Nó biến xác suất nhân thành thông tin cộng.

Ví dụ, hai quan sát độc lập:

$$ p(x_1, x_2) = p(x_1) p(x_2), $$

nhưng:

$$ -\log p(x_1, x_2) = -\log p(x_1) - \log p(x_2). $$

2. Thước đo thang đo tương đối (Relative Scale)

Và log còn có một ý nghĩa rất đẹp: nó đo thang đo tương đối (relative scale).

Tỉ số xác suất trở thành một hiệu:

$$ \log\frac{p_1}{p_2} = \log p_1 - \log p_2. $$

3. Không chỉ là trực giác: Bản chất cấu trúc toán học

Sẽ là đúng một phần nếu cho rằng con người thích phép cộng hơn phép nhân, nhưng sự lựa chọn hàm log không chỉ vì trực giác của con người.

Cốt lõi sâu hơn là: tính độc lập (independence) trong xác suất có cấu trúc nhân (multiplicative), còn khi ta muốn đo một “lượng” (amount) tích lũy qua nhiều quan sát, cấu trúc tự nhiên hơn phải là tính cộng (additive).

Log làm chính xác việc này:

$$ pq \mapsto \log p + \log q. $$

Điều đó mang lại vài lợi ích toán học rất thực tế và cốt yếu, không chỉ là “dễ nghĩ”:

  • Thông tin tích lũy: Thông tin từ các quan sát độc lập có thể cộng dồn lại với nhau.
  • Tối ưu hóa khả thi: Tích của hàm hợp lý (likelihood) biến thành tổng của log-likelihood, giúp việc lấy đạo hàm và tối ưu hóa cực trị trở nên thuận lợi hơn rất nhiều.
  • Tính chất đại lượng mở rộng (extensive property): Các đại lượng nền tảng như entropy, phân kỳ KL, thông tin Fisher đều sở hữu tính cộng rất đẹp đẽ.
  • Thống kê tiệm cận (asymptotic statistics): Các quy luật tiệm cận trở nên tuyến tính và tường minh hơn theo kích thước mẫu $n$.

Nên có thể nói:

Log không phải được chọn vì con người thích cộng hơn nhân; nó được chọn vì nó biến cấu trúc nhân của xác suất thành cấu trúc cộng phù hợp với cách information tích lũy.

Trực giác của con người chỉ đơn giản là “ăn khớp” với cấu trúc toán học khách quan đó mà thôi.

4. Cây cầu nối xác suất và thông tin

Nên trong lý thuyết thông tin, thống kê, hàm hợp lý (likelihood), phân kỳ KL (KL divergence), thông tin Fisher…, log cứ liên tục xuất hiện vì nó biến thế giới xác suất vốn mang tính nhân (multiplicative) thành một không gian mang tính cộng (additive), nơi information có thể được cộng, so sánh và vi phân rất tự nhiên.

Có thể nhớ một câu đúc kết:

$$ \boxed{\text{Probability multiplies; information adds. Log is the bridge.}} $$