5
장
모델 평가와 성능 향상
357
한 대리 평가 방식을 종종 사용합니다. 예를 들면 보행자와 보행자가 아닌 이미지를 분류하는
테스트를 수행해서 정확도를 측정할 수 있습니다. 이는 대체 방식이므로 평가가 가능하고 원래
비즈니스 목적에 가장 가까운 지표를 찾아야 합니다. 이 근사 지표는 모델을 평가할 때나 선택
할 때마다 사용해야 합니다. 평가의 결과는 하나의 숫자가 아닐 수 있지만, 선택한 모델의 예상
비즈니스 임팩트를 나타내야 합니다. 예를 들어 어떤 알고리즘을 적용하면 고객 수는
10
% 늘
지만 고객당 매출은
15
% 줄어들 수 있습니다.
이번 절에서는 이진 분류의 특별한 사례에 대한 평가 지표를 먼저 이야기하고, 그다음으로 다
중 분류를, 마지막으로 회귀에 대해 설명하겠습니다.
5.3.2
이진 분류의 평가 지표
이진 분류는 실전에서 가장 널리 사용하고 개념도 쉬운 머신러닝 알고리즘입니다. 하지만 이
간단한 작업을 평가하는 데에도 주의할 점이 많습니다. 여러 평가 지표를 들여다보기 전에, 정
확도를 잘못 측정하는 경우에 대해 살펴보겠습니다. 이진 분류에는 양성 클래스와 음성 클래스
가 있으며 양성 클래스가 우리의 관심 클래스입니다.
에러의 종류
잘못 분류한 샘플의 수가 원하는 정보의 전부는 아니므로, 정확도만으로 예측 성능을 측정하기
에는 부족할 때가 종종 있습니다. 자동화 테스트로 암을 조기 발견하는 애플리케이션을 가정해
보겠습니다. 테스트가 음성이면 건강하다는 뜻입니다. 반대로 양성이면 추가 검사를 받아야 합
니다. 여기서 양성 테스트