
71
4장 모델개발
요한 컴퓨팅 파워가 너무나 컸다.
컴퓨팅 파워가 충분해진 덕택에 머신러닝 모델 개발에 드는 비용이 낮아져 많은 기업이 다양한
분야에서 머신러닝 모델을 활용할 수 있게 되었다. 물론 데이터에 드는 비용도 줄어들기는 했지
만, 데이터 비용은 머신러닝 모델의 저변 확대에 있어 첫 번째 요인이라 할 수 없다. 극히 일부
알고리즘만 빅데이터를 활용하고 있다. 여전히 대다수 모델은 많은 데이터를 필요로 하지 않아,
모든 학습 데이터를 메모리에 모두 적재한 채로도 작동 가능하다.
4.2
데이터 탐색
데이터 과학자나 분석가가 모델을 학습시키기 위한 데이터 소스를 검토할 때, 우선 데이터 형태
를 확인해야 한다. 아무리 좋은 알고리즘을 사용하는 모델이라 해도 모델의 성능은 학습 데이터
에 달려 있다. 이 단계에서 나타나는 많은 이슈로 인해 전체 데이터 혹은 데이터의 일부를 쓸 수
없게 될 수 있다. 예를 들어, 데이터의 불완전성, 부정확성, 불일치 등이 이슈가 될 수 있다.
다음은 데이터 탐색 과정의 예다.
●
데이터를어떻게수집했는지,어떤가정을포함하는지를문서화함
●
데이터통계에대한요약확인하기:각열은어떤영역에속하는가?값이누락된행이있는가?
명백한실수가있는가?정상적이지않은특잇값이있는가?특잇값이전혀없는가?
●