So sánh ba thước đo độ hỗn tạp: Gini, Entropy và Sai số phân loại
Khi huấn luyện một cây quyết định phân loại (Decision Tree), mục tiêu cuối cùng của chúng ta là tối thiểu hoá tỷ lệ dự đoán sai trên tập dữ liệu. Vậy tại sao cả hai thuật toán kinh điển — CART (Breiman et al., 1984) và C4.5 (Quinlan, 1986) — đều không dùng trực tiếp Sai số phân loại (Misclassification Error) để tìm điểm phân nhánh, mà lại sử dụng Độ hỗn tạp Gini và Shannon Entropy?
