
140
데이터 과학을 위한 통계
그림
3-8
이마니시-카리 연구 데이터의 도수 히스토그램
수사관들은 기댓값(
31
.
5
. 정확히 균일한 분포에서 각 숫자가 뽑힐 때)과의 차이를 계산하고,
카이제곱검정을 사용해(재표본추출 절차를 사용해도 똑같았을 것이다) 실제 분포가 정상적
인 랜덤 변이의 범위를 훨씬 넘는다는 것을 보였다.
3.9.4
데이터 과학과의 관련성
카이제곱검정이나 피셔의 정확검정은 데이터 과학과의 직접적인 연관성을 찾기가 참 어렵다.
A
-
B
나
A
-
B
-
C
나 상관없이 대부분 실험에서의 목표는 단순히 통계적 유의성을 조사하는 것
이 아니라 최적의 처리 방법을 찾는 것이다. 이를 위해서는 멀티암드 밴딧 방법(
3
.
10
절 참고)
이 더 정확한 해결책이라고 할 수 있다.
데이터 과학에서 카이제곱검정, 특히 피셔의 정확검정을 활용하는 대표적인 예로, 웹 실험에
적합한 표본크기를 판별하는 일을 들 수 있다. 이러한 실험은 종종 클릭률이 매우 낮기 때문에
수천 번의 실험에도 불구하고 집계 비율이 너무 낮아 실험을 통해 확실한 결론을 내리기 어렵
다. 이러한 경우 피셔의 정확검정, 카이제곱검정, 그리고 기타 검정은 검정력이나 표본크기를
계산하는 데 유용할 수 있다 (
3
.
11
절 참고 ).