
73
4장 모델개발
양상
modality
2
을 해당 양상의 평균값으로 대체하는 기법으로, 이 기법을 활용하여 모델의 특성
attribute
을 특성의 평균값으로 대체하고 유사 범위 내의 데이터를 활용할 수 있도록 할 수 있다.
대신 일부 정보는 손실된다.
궁극적으로 대다수 머신러닝 알고리즘은 숫자로 이루어진 행렬을 입력받아야 하고, 각 행은 하
나의 표본을 의미하며, 모든 표본은 동일한 표본 집합에서 추출한다. 입력값이 행렬 형태가 아
닌 경우, 데이터 과학자는 이를 변환하기 위한 방법을 사용할 수도 있다.
가장 일반적인 방법은 원-핫 인코딩
one
-
hot
encoding
이다. 예를 들어, 세 종류의 값(예: 라즈베리,
블루베리, 스트로베리)을
3
개의 특성으로 나누어 각 특성이 두 가지 값인
yes
혹은
no
를 가지
도록 할 수 있다(예: 라즈베리인가-
yes
/
no
, 블루베리인가-
yes
/
no
, 스트로베리인가-
yes
/
no
).
텍스트나 이미지 입력의 경우에는 더 복잡한 엔지니어링을 필요로 한다. 최근 딥러닝으로 인해
이 분야에 혁신이 일어나, 이미지와 텍스트를 머신러닝 알고리즘에서 활용 가능한 숫자로 이루
어진 행렬로 변환할 수 있는 모델들이 개발되었다. 이런 행렬을 임베딩
embedding
이라 부른다. 임
베딩은 학습되지 않은 영역에서도 활용 가능하기 때문에, 데이터 과학자들은 ...