
4
장
데이터 표현과 특성 공학
271
지금까지 우리는 데이터가
2
차원 실수형 배열로 각 열이 데이터 포인트를 설명하는
연속형 특성
continuous
feature
이라고 가정했습니다. 하지만 많은 애플리케이션에서 이렇게 데이터가 수집되지
는 않습니다. 일반적인 특성의 전형적인 형태는
범주형 특성
categorical
feature
입니다. 또는
이산형 특
성
discrete
feature
이라고도 하는 이런 특성은 보통 숫자 값이 아닙니다. 범주형 특성과 연속적인 특
성 사이의 차이는 분류와 회귀의 차이와 비슷하지만, 출력이 아닌 입력에 대한 것이란 점이 다
릅니다. 앞서 본 연속형 특성의 예로는 픽셀 밝기와 붓꽃 측정값이 있습니다. 범주형 특성의 예
로는 제품의 브랜드, 색상, 판매분류 (책, 옷, 하드웨어 ) 등이 있습니다. 이런 특성들은 모두 상
품을 묘사하는 속성이지만 연속된 값으로 나타나지 않습니다. 한 제품은 옷에 속하거나 책에
속합니다. 책과 옷 사이에는 중간값이 없고 이 카테고리들 사이에는 순서가 없습니다(책이 옷
보다 크거나 작지 않고, 하드웨어는 책과 옷 사이에 있지 않습니다 ).
하지만 데이터가 어떤 형태의 특성으로 구성되어 있는가보다 데이터를 어떻게 표현하는가가
머신러닝 모델의 성능에 주는 영향이 더 큽니다.
2
장과
3
장에서 데이터의 스케일이 중요하다 ...