
from Scratch
219
추정대로
0
이 아니라는 것을 시사한다. 하지만 박사 학위 취득 여부에 대응되
는 계수는 ‘유의하게’
0
과 다르지 않으며 우리가 계산한 값이 무의미할 가능성이
높다.
만약 ‘적어도
β
j
중 하나는
0
이 아니다’ 혹은 ‘
β
1
은
β
2
이고
β
3
은
β
4
이다’ 같이 보
다 구체적인 가설검정이 필요하다면
F
검정(
F
-
test
)을 사용할 수 있다. 하지만
F
검정은 이 책의 범위를 벗어나기 때문에 다루지 않도록 하겠다.
15.8
Regularization
실제로 데이터를 분석할 때는 변수가 굉장히 많은 데이터에 회귀 분석 모델을
적용해야 하는 경우가 자주 발생한다. 하지만 변수가 너무 많다면 다양한 문제
가 발생할 수 있다. 첫 번째로 변수가 많아질수록 모델이 학습 데이터에 오버피
팅하기 쉬워진다. 두 번째로
0
이 아닌 계수가 많아질수록 모델을 해석하기 어
려워진다. 만약 어떠한 현상을 설명하는 것이 목표라면 수백 개의 변수로 모델
을 만드는 것보다는 세 개 정도의 변수로 작은 모델을 만드는 것이 더 나을 수
있다.
Regularization
2
은
beta
가 커지면 커질수록 해당 모델에게 페널티를 주는 방법
이다. 그리고 오류와 페널티를 동시에 최소화하는 최적의 모델을 만들 수 있다.
페널티를 더욱 강조할수록 값이 큰 계수에 ...