
406
파이썬 라이브러리를 활용한 머신러닝(번역개정판)
6.5
전처리와 모델의 매개변수를 위한 그리드 서치
파이프라인을 사용하면 머신러닝 워크플로에 필요한 모든 처리 단계를 하나의
scikit
-
learn
추정기로 캡슐화할 수 있습니다. 또 다른 장점으로, 회귀와 분류 같은 지도 학습의 출력을 이용
해서 전처리 매개변수를 조정할 수 있습니다. 이전 장에서
boston
데이터셋에서 다항식 특성
을 선택해 리지 회귀에 적용했습니다. 이번에는 파이프라인을 사용해서 만들어보겠습니다. 이
파이프라인은 데이터 스케일 조정, 다항식 특성 선택, 리지 회귀의 세 단계로 구성됩니다.
In [29]:
from sklearn.datasets import load_boston
boston = load_boston()
X_train, X_test, y_train, y_test = train_test_split(boston.data, boston.target,
random_state=0)
from sklearn.preprocessing import PolynomialFeatures
pipe = make_pipeline(
StandardScaler(),
PolynomialFeatures(),
Ridge())
다항식 차수가 얼마나 되어야 할지, 또는 다항식이나 교차항이 필요한지 어떻게 ...