
359
9
테이블 데이터 모델링 깊게 알아보기
테이블 데이터 모델링은
CSV
나 스프레드시트와 같은 테이블 형식의 데이터를 다룹니다. 이렇
게 만든 모델의 목적은 여러 열의 값으로 특정 한 열의 값을 예측하는 것입니다.
9
장은 딥러닝
과 더불어 랜덤 포레스트
random
forest
같은 더 일반적인 머신러닝 기법도 함께 다룹니다. 딥러닝
이 만능인 듯하지만, 상황에 따라서는 전통적인 머신러닝 기법이 더 나은 결과를 보이기도 하
기 때문이죠.
그 과정에서 데이터 정리 및 전처리 방식과 모델의 학습 결과를 해석하는 방법도 같이 다룹니
다. 하지만 우선은 임베딩을 사용해 수치형 데이터만 수용하는 모델에 범주형 값을 주입하는
방식부터 살펴봅니다.
9.1
테이블 데이터에는 ‘나이’ 같은 수치형 데이터와 ‘성별’처럼 문자열 값을 포함하는 열들이 있습
니다. 수치형 데이터는 모델에 직접 주입될 수 있지만 (일부 선택적인 전처리 과정이 있을 수
있음 ), 그 외의 데이터는 숫자 형태로 변환되어야만 하죠. 이렇게 변환이 필요한 값들은 각기
다른 범주를 따르므로, 이런 변수를 흔히 범주형 변수
categorical
variable
라고 합니다. 그리고 태생
이 수치형이라 변환이 필요 없는 데이터를 연속형 변수
continuous
variable
라고 합니다.
...