
from Scratch
175
11.6
특성 추출 및 선택
앞에서 언급했듯이 데이터를 설명할 때 데이터의 특성을 나타내는 모델의 변수
가 부족하다면 언더피팅이 발생할 것이다. 하지만 변수가 너무 많다면 오버피팅
이 발생할 것이다. 그렇다면 데이터의 특성이라는 것은 무엇이며 어디서 오는
것일까?
데이터의
특성(
feature
)이란 모델의 모든 입력 변수를 의미한다.
가장 간단한 경우에는 이러한 특성이 주어진다. 예를 들어 사람의 경력으로
연봉을 예측하고 싶다면 경력은 특성이 된다. 물론
11
.
3
절 ‘오버피팅과 언더피
팅’에서 봤듯이, 성능이 더 좋은 모델이 만들어진다면 경력을 제곱한 값이나 세
제곱한 값을 변수로 사용할 수도 있다.
데이터가 더욱 복잡해질수록 신기한 일이 일어난다. 예를 들어 이메일이 스팸
메일인지 아닌지를 예측해 주는 필터를 만들고 있다고 해보자.
대부분의 모델은 수많은 글자로 구성된 이메일 원본을 어떻게 처리해야 할지
모를 것이다. 필터를 만들기 위해서는 예컨대 다음과 같이 특징을 추출해야 할
것이다.
· 이메일에 ‘비아그라’라는 단어가 포함되어 있는가?
· 문자 ‘
d
’가 몇 번 나왔는가?
· 보낸 사람의 이메일 도메인은 무엇인가?
첫 번째 특징은 ‘예’ 혹은 ‘아니요’로 답할 수 있으며, 주로
1
과
0
을 사용해서 답을 ...