| 구분 | CHAID 계열 | Quinlan 계열 (ID3 / C4.5 / C5.0) | CART 계열 |
| Regression (회귀) | F 통계량, p-value | – | 분산 감소량 (Variance Reduction) |
| Classification (분류) | χ² 통계량, p-value | 엔트로피(Entropy), 정보이득비(Gain Ratio) | 지니지수(Gini Index) |


| 클래스 | 비율 p_i | (p_i^2) |
| A | 0.5 | 0.25 |
| B | 0.5 | 0.25 |
| 합계 | (1 - (0.25 + 0.25) = 0.5) |

| 클래스 | 비율 (p_i) | (-p_i * log_2(p_i)) |
| A | 0.5 | 0.5 |
| B | 0.5 | 0.5 |
| 합계 | 1.0 |

| 구분 | CHAID 계열 | Quinlan 계열 (ID3/C4.5/C5.0) | CART 계열 |
| 핵심철학 | 통계적 유의성(p-value) | 정보이득(Information Gain) | 예측오차 감소(impurity reduction) |
| 주요 분할 기준 | χ², F, p-value | Entropy, Gain Ratio | Gini, Variance |
| 데이터 유형 | 주로 범주형 | 범주형 + 연속형 | 범주형 + 연속형 |
| 분할 방식 | 다중 분할 (multiway) | 다중 분할 (multiway) | 이진 분할 (binary) |
| 가지치기 방식 | 유의수준 기준 | 오차기반 가지치기 | Cost-complexity pruning |
| 대표 구현 | SPSS CHAID, R
CHAID
|
Weka J48, R
C50
|
sklearn
DecisionTreeClassifier
, R
rpart
|
| 분야 성격 | 해석·통계 중심 | 고전 데이터마이닝 | 머신러닝 실무 중심 |
| Information Theory (0) | 2024.12.08 |
|---|---|
| PCA (0) | 2024.10.12 |