
4
장
데이터 표현과 특성 공학
285
In [19]:
from sklearn.compose import make_column_transformer
ct = make_column_transformer(
(['age', 'hours-per-week'], StandardScaler()),
(['workclass', 'education', 'gender', 'occupation'], OneHotEncoder(sparse=False)))
ColumnTransformer
의 한 가지 단점은
0
.
20
버전에서 아직 변환된 출력 열에 대응하는 입
력 열을 찾지 못한다는 것입니다.
11
4.4
구간 분할, 이산화 그리고 선형 모델, 트리 모델
데이터를 가장 잘 표현하는 방법은 데이터가 가진 의미뿐 아니라 어떤 모델을 사용하는지에 따
라 다릅니다. 아주 폭넓게 사용하는 두 알고리즘인 선형 모델과 트리 기반 모델 (결정 트리, 그
레이디언트 부스팅 트리, 랜덤 포레스트 등 )은 특성의 표현 방식으로 인해 미치는 영향이 매우
다릅니다.
2
장에서 사용한
wave
데이터셋을 다시 보겠습니다. 이 데이터에는 입력 특성이 하나
뿐입니다. 이 데이터셋을 이용해 선형 회귀 모델과 결정 트리 회귀를 비교해보겠습니다 (그림
4
-
1
).
12
In [20]:
from sklearn.linear_model