
5
장
모델 평가와 성능 향상
323
지금까지 지도 학습과 비지도 학습 이론을 다루면서 다양한 머신러닝 알고리즘을 살펴봤습니
다. 이제 모델 평가와 매개변수 선택에 대해 더 자세히 배워보도록 하겠습니다.
(
3
장에서 보았듯이 ) 비지도 학습 모델을 평가하고 선택하는 일은 매우 정성적인 작업이므로
여기서는 지도 학습인 회귀와 분류에 집중할 것입니다.
우리는 지도 학습 모델을 평가하기 위해
train
_
test
_
split
함수를 사용하여 데이터셋을 훈련 세
트와 테스트 세트로 나눴습니다. 그리고 모델을 만들기 위해 훈련 세트에
fit
메서드를 적용했
고, 모델을 평가하기 위해 테스트 세트에
score
메서드를 사용했습니다. 분류에서
score
메서
드는 정확히 분류된 샘플의 비율을 계산하는 역할을 합니다. 다음은 이 과정을 담은 예제입니다.
In [3]:
from sklearn.datasets import make_blobs
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split
# 인위적인 데이터셋을 만듭니다.
X, y = make_blobs(random_state=0)
# 데이터와 타깃 레이블을 훈련 세트와 테스트 세트로 나눕니다.
X_train, ...