27
1
장
소개
지도 학습과 비지도 학습 모두 컴퓨터가 인식할 수 있는 형태로 입력 데이터를 준비하는 것이
중요합니다. 데이터를 엑셀 테이블처럼 생각하면 편리할 때가 많습니다. 우리가 판별해야 할
개개의 데이터 (개개의 이메일, 고객, 거래 )는 행이고 데이터를 구성하는 각 속성 (고객의 나이,
거래 가격, 지역 )은 열입니다. 고객이라면 나이, 성별, 계정 생성일, 온라인 쇼핑몰에서의 구매
빈도 등으로 표현할 수 있습니다. 흑백 이미지로 된 종양 데이터라면 크기나 모양, 색상의 진하
기 등이 속성이 될 것입니다.
머신러닝에서는 하나의 개체 혹은 행을
샘플
sample
또는
데이터 포인트
data
point
라고 부릅니다. 그리
고 샘플의 속성, 즉 열을
특성
feature
이라고 합니다.
나중에 이 책에서 좋은 입력 데이터를 만들어내는
특성 추출
feature
extraction
혹은
특성 공학
feature
engineering
이라는 주제를 자세히 다뤄보겠습니다. 유념해둬야 할 것은 어떤 머신러닝 알고리즘도
아무런 정보가 없는 데이터로는 그 어떤 것도 예측할 수 없다는 사실입니다. 예를 들어 환자에
대해 알고 있는 특성이 오직 성씨뿐이라면 어떤 알고리즘도 그 환자의 성별을 예측할 수는 없
을 것입니다. 성씨 데이터에는 성별에 관한 정보가 없기 때문입니다. 만약 환자의 이름을 특성
으로 추가한다면 아마 이름을 토대로 환자의 성별을 알아낼 수도 있을 것입니다.
1.1.2
문제와 데이터 이해하기
머신러닝 프로세스에서 가장 중요한 과정은 사용할 데이터를 ...