https://iili.io/2AK2cHG.png

Du Mã

Bất đẳng thức Jensen: Trực giác hình học từ hàm lồi đến kỳ vọng xác suất

Trong toán học và xác suất, phép lấy trung bình (hay kỳ vọng toán học $\mathbb{E}$) là một toán tử tuyến tính mẫu mực. Nếu ta có một hàm tuyến tính $f(x) = ax + b$, việc áp dụng hàm trước rồi lấy trung bình hay lấy trung bình trước rồi áp dụng hàm luôn cho cùng một kết quả:

$$ f(\mathbb{E}[X]) = \mathbb{E}[f(X)]. $$

Tuy nhiên, thế giới tự nhiên và các mô hình thống kê hiếm khi tuyến tính. Khi $f$ là một hàm phi tuyến (như $x^2, e^x, \ln x$), câu hỏi căn bản xuất hiện: $f(\mathbb{E}[X])$ và $\mathbb{E}[f(X)]$, đại lượng nào lớn hơn?

Chỉ số Gini (Gini Impurity): Đo độ hỗn tạp từ một trò chơi xác suất

Khi thuật toán cây phân loại CART (Classification and Regression Trees) đứng trước một tập dữ liệu, nhiệm vụ cốt lõi của nó là tìm ra một câu hỏi dạng $x_j \le s$ để tách các quan sát thành hai nhánh sao cho dữ liệu ở mỗi nhánh trở nên “ngăn nắp” hơn nút ban đầu.

Để máy tính tự động chọn được đặc trưng $x_j$ và ngưỡng chia $s$ tối ưu, ta cần một con số cụ thể trả lời câu hỏi: Nút này đang thuần khiết hay đang hỗn loạn, xáo trộn?

Random Forest: Khi nhiều cây quyết định cùng bỏ phiếu

Một cây quyết định (Decision Tree) có cách suy luận dễ theo dõi: đặt một câu hỏi về dữ liệu, chia các quan sát thành hai nhóm, rồi lặp lại. Tuy nhiên, cây có thể khá nhạy với dữ liệu huấn luyện. Chỉ vài quan sát thay đổi cũng có thể làm phép chia gần gốc đổi chỗ, kéo theo một cấu trúc cây khác.

Rừng ngẫu nhiên (Random Forest) xử lý điểm yếu ấy bằng một ý tưởng đơn giản: tạo nhiều cây hơi khác nhau rồi gộp dự đoán của chúng. Mỗi cây được huấn luyện trên một mẫu bootstrap, đồng thời chỉ được xét một tập con ngẫu nhiên của các đặc trưng tại mỗi nút. Với bài toán phân loại, các cây bỏ phiếu; với bài toán hồi quy, ta lấy trung bình các dự đoán.

Cây quyết định (Decision Tree): Một câu hỏi chia đôi dữ liệu

Một cây quyết định học bằng cách đặt liên tiếp những câu hỏi đơn giản. Chẳng hạn, với một hồ sơ tín dụng, cây có thể hỏi “tỷ lệ nợ có vượt 40% không?”, rồi ở mỗi nhánh lại hỏi thêm về thu nhập hoặc lịch sử trả nợ. Đi hết một đường từ gốc tới lá, ta nhận được một dự đoán.

Sự đơn giản này dễ tạo cảm giác rằng cây chỉ là một sơ đồ if–else được viết bằng tay. Điểm khác biệt nằm ở chỗ dữ liệu quyết định câu hỏi nào được đặt, đặt ở đâu và khi nào dừng lại. Bài viết sẽ đi từ một phép chia duy nhất tới toàn bộ cây, sau đó chỉ ra vì sao một cây đơn thường được dùng làm viên gạch cơ sở cho Random Forest.

Modern Portfolio Theory: Nghệ thuật kết hợp rủi ro

Năm 1952, Harry Markowitz xuất bản một bài báo thay đổi hoàn toàn cách thế giới tài chính vận hành, đem về cho ông giải Nobel Kinh tế năm 1990. Lý thuyết đó mang tên Modern Portfolio Theory (MPT) - Lý thuyết Danh mục Đầu tư Hiện đại.

Trước MPT, người ta đầu tư đơn giản bằng cách chọn ra những cổ phiếu có lợi nhuận kỳ vọng cao nhất. Markowitz chỉ ra một sự thật cơ bản nhưng thường bị phớt lờ: “Don’t put all your eggs in one basket” (Đừng bỏ tất cả trứng vào một rổ). Nhưng rổ nào, và bao nhiêu trứng mỗi rổ?

Ma trận Hiệp phương sai & Tương quan: Thấu kính nhìn vào rủi ro tài chính

Trong tài chính, định lý Modern Portfolio Theory (Lý thuyết Danh mục Đầu tư Hiện đại) của Harry Markowitz nói rằng: Đừng chỉ nhìn vào rủi ro của từng tài sản đơn lẻ, hãy nhìn vào cách chúng “nhảy múa” cùng nhau.

Giả sử bạn đang xem xét tỷ suất sinh lời hàng ngày của hai tài sản:

  • Tài sản X (Ví dụ: Trái phiếu Chính phủ): An toàn, biến động thấp.
  • Tài sản Y (Ví dụ: Cổ phiếu Bất động sản): Rủi ro cao, biến động cực mạnh.

Để đo lường rủi ro (sự phân tán), chúng ta dùng Phương sai (Variance) cho từng tài sản. Nhưng để biết chúng đi cùng nhau hay ngược nhau (để đa dạng hoá danh mục), chúng ta cần đến Hiệp phương sai (Covariance)Tương quan (Correlation).

Đang tải thêm bài viết...