
4
장
데이터 표현과 특성 공학
303
데이터셋과 모델의 조합에 최적인 변환 방법을 찾기란 예술에 가까운 일입니다. 이 예에서는
모든 특성이 같은 속성을 가지고 있습니다. 하지만 실제로 이런 경우는 드물며, 일부 특성만
변환하거나 특성마다 모두 다르게 변환하기도 합니다. 앞서 언급한 대로 이런 변환은 트리 기
반 모델에서는 불필요하지만 선형 모델에서는 필수입니다. 가끔 회귀에서 타깃 변수
y
를 변환
하는 것이 좋을 때도 있습니다. 카운트 (예컨대 주문 횟수 )를 예측하는 경우가 전형적인 예로
log
(
y
+
1
)를 사용해 변환하면 도움이 됩니다.
23
이전 예에서 보았듯이 구간 분할, 다항식, 상호작용은 데이터가 주어진 상황에서 모델의 성능
에 큰 영향을 줄 수 있습니다. 특별히 선형 모델이나 나이브 베이즈 모델 같은 덜 복잡한 모델
일 경우입니다. 반면에 트리 기반 모델은 스스로 중요한 상호작용을 찾아낼 수 있고 대부분의
경우 데이터를 명시적으로 변환하지 않아도 됩니다.
SVM
, 최근접 이웃, 신경망 같은 모델은
이따금 구간 분할, 상호작용, 다항식으로 이득을 볼 수 있지만, 선형 모델보다는 영향이 그렇게
뚜렷하지 않습니다.
4.7
특성 자동 선택
새로운 특성을 만드는 방법이 많으므로 데이터의 차원이 원본 특성의 수 이상으로 증가하기 쉽
습니다. 그러나 특성이 추가되면 ...