417
9
테이블 데이터 모델링 깊게 알아보기
이런 임베딩은 다른 모델이나 작업에 대해 반드시 별도로 학습될 필요는 없습니다. 일단 특정
작업으로 일련의 임베딩을 학습시킨 다음 중앙 저장소에 보관만 해두면, 이후 여러 모델이 원
하는 대로 참조하여 재사용할 수 있습니다. 대기업 실무자들에게 확인한 결과, 이미 많은 곳에
서 실제로 이런 방식을 사용합니다.
9.9
테이블 데이터 모델링의 접근법으로 결정 트리 앙상블과 신경망을 살펴보았습니다. 또한 랜덤
포레스트, 그레이디언트 부스팅 머신이라는 결정 트리 앙상블 기법도 알아보았죠. 각 기법은
그 자체로 효과적이지만, 상황에 따른 타협도 필요합니다.
●
는 하이퍼파라미터 선택에 크게 민감하지 않고 데이터 전처리 작업이 거의 필요하지 않아
서 학습이 가장 쉬운 모델입니다. 학습 속도가 빠르며, 충분한 트리로 구성한다면 과적합이 일어나지도
않죠. 그러나 미래 시기의 예측과 같이 외삽이 필요한 상황에는 정확도가 떨어질 수 있습니다.
●
은 이론상 랜덤 포레스트만큼 빠른 학습 속도를 자랑합니다. 하지만 실제로는
수많은 하이퍼파라미터의 조합을 시도해야만 합니다. 과적합될 소지가 있지만, 적절한 하이퍼파라미터
조합을 발견한다면 랜덤 포레스트보다 정확도가 조금 더 높은 경향이 있습니다.
●
은 훈련에 가장 오랜 시간이 걸리며, 정규화와 같은 추가 전처리를 해야 합니다. 그리고 정규화는
추론 시에도 사용해야 하죠. 매우 뛰어난 결과를 도출하고 외삽 ...