# Tại Sao 'Thông Tin' Lại Dùng Logarit?


Vì log gần như là hàm tự nhiên nhất khi ta muốn một đại lượng gọi là **“information”**.

## 1. Trực giác cốt lõi: Xác suất nhân, thông tin cộng

Nếu hai sự kiện độc lập xảy ra với xác suất $p$ và $q$, thì xác suất để cả hai cùng xảy ra là $pq$. 

Nhưng ta muốn lượng thông tin thu được phải **cộng dồn**:

$$
I(pq) = I(p) + I(q).
$$

Hàm liên tục thỏa mãn tính chất này có dạng:

$$
I(p) = -\log p.
$$

Đó là lý do [Shannon information]({{< ref "entropy.md" >}}) dùng:

$$
-\log p(x).
$$

Nó biến **xác suất nhân** thành **thông tin cộng**.

Ví dụ, hai quan sát độc lập:

$$
p(x_1, x_2) = p(x_1) p(x_2),
$$

nhưng:

$$
-\log p(x_1, x_2) = -\log p(x_1) - \log p(x_2).
$$

## 2. Thước đo thang đo tương đối (Relative Scale)

Và log còn có một ý nghĩa rất đẹp: nó đo **thang đo tương đối (*relative scale*)**. 

Tỉ số xác suất trở thành một hiệu:

$$
\log\frac{p_1}{p_2} = \log p_1 - \log p_2.
$$

## 3. Không chỉ là trực giác: Bản chất cấu trúc toán học

Sẽ là đúng một phần nếu cho rằng con người thích phép cộng hơn phép nhân, nhưng sự lựa chọn hàm log **không chỉ vì trực giác của con người**.

Cốt lõi sâu hơn là: **tính độc lập (*independence*) trong xác suất có cấu trúc nhân (*multiplicative*)**, còn khi ta muốn đo một “lượng” (*amount*) tích lũy qua nhiều quan sát, cấu trúc tự nhiên hơn phải là **tính cộng (*additive*)**.

Log làm chính xác việc này:

$$
pq \mapsto \log p + \log q.
$$

Điều đó mang lại vài lợi ích toán học rất thực tế và cốt yếu, không chỉ là “dễ nghĩ”:

* **Thông tin tích lũy**: Thông tin từ các quan sát độc lập có thể cộng dồn lại với nhau.
* **Tối ưu hóa khả thi**: Tích của hàm hợp lý (likelihood) biến thành tổng của log-likelihood, giúp việc lấy đạo hàm và tối ưu hóa cực trị trở nên thuận lợi hơn rất nhiều.
* **Tính chất đại lượng mở rộng (*extensive property*)**: Các đại lượng nền tảng như entropy, phân kỳ KL, thông tin Fisher đều sở hữu tính cộng rất đẹp đẽ.
* **Thống kê tiệm cận (*asymptotic statistics*)**: Các quy luật tiệm cận trở nên tuyến tính và tường minh hơn theo kích thước mẫu $n$.

Nên có thể nói:

> **Log không phải được chọn vì con người thích cộng hơn nhân; nó được chọn vì nó biến cấu trúc nhân của xác suất thành cấu trúc cộng phù hợp với cách information tích lũy.**

Trực giác của con người chỉ đơn giản là “ăn khớp” với cấu trúc toán học khách quan đó mà thôi.

## 4. Cây cầu nối xác suất và thông tin

Nên trong [lý thuyết thông tin]({{< ref "entropy.md" >}}), thống kê, hàm hợp lý (*likelihood*), phân kỳ KL (*KL divergence*), [thông tin Fisher]({{< ref "fisher-information.md" >}})…, log cứ liên tục xuất hiện vì nó biến thế giới xác suất vốn **mang tính nhân (multiplicative)** thành một không gian **mang tính cộng (additive)**, nơi information có thể được cộng, so sánh và vi phân rất tự nhiên.

Có thể nhớ một câu đúc kết:

$$
\boxed{\text{Probability multiplies; information adds. Log is the bridge.}}
$$


