460
파이썬 라이브러리를 활용한 머신러닝(번역개정판)
•
부정거래 예측이 실제로 작동하는지 어떻게 측정할까?
•
알고리즘을 평가하기에 알맞은 데이터를 가지고 있는가?
•
성공적으로 구축했다면 이 솔루션이 비즈니스에 어떤 영향을 주는가?
5
장에서 보았듯이 이익 증가율이나 손실 감소율 같은 비즈니스 척도를 직접 이용해 알고리즘
성능을 재는 게 가장 좋습니다. 하지만 이런 방식을 사용하기 어려울 때가 많습니다. 간단하게
“완벽한 모델이란 무엇인가?”라는 질문의 답을 찾으면 됩니다. 모든 부정 거래를 완벽하게 감
지했을 때 회사가 한 달에
100
달러를 아낄 수 있다면 알고리즘을 개발하려는 시도조차 할 필
요가 없습니다. 반면에 모델이 한 달에 수만 달러를 아낄 수 있다면 이 문제는 들여다볼 가치가
있습니다.
해결해야 할 문제를 정의했고 솔루션이 프로젝트에 미칠 영향과 성공을 평가할 올바른 방법을
알고 있다고 가정하겠습니다. 다음 단계는 데이터를 모으고 작동하는 프로토타입을 만드는 일
입니다. 이 책에서 여러분이 선택할 수 있는 많은 모델을 다루었고 어떻게 평가하고 튜닝하는
지 설명했습니다. 하지만 모델을 적용할 때 기억해야 할 것은 모델이 커다란 데이터 과학 워크
플로의 일부라는 것입니다. 모델 구축은 새로운 데이터를 모으고, 정제하고, 만들고, 평가하는
순환 사이클의 한 부분입니다. 모델이 만든 오류를 분석하면 빠진 데이터나 추가로 수집할 데
이터, 더 효과적인 모델을 위해 어떻게 작업을 재구성할지에 대한 정보를 많이 얻을 수 있습니
다. 더 많은 ...