468
파이썬 라이브러리를 활용한 머신러닝(번역개정판)
터 덩어리는 버리고 다음 덩어리를 읽습니다.
scikit
-
learn
의 일부 모델에서 외부 메모리 학습
기능을 구현해두었고 온라인 사용자 가이드 (
https
://
goo
.
gl
/
lQmL1X
)에서 자세한 내용을
볼 수 있습니다. 외부 메모리 학습에서는 컴퓨터 한 대에서 모든 데이터를 처리해야 하므로 큰
데이터셋을 처리하려면 시간이 오래 걸립니다. 또 모든 머신러닝 알고리즘이 이 방식을 지원하
는 것도 아닙니다.
대규모 처리를 위한 다른 전략은 클러스터를 구성하는 여러 컴퓨터로 데이터를 분산해서 각 컴
퓨터가 해당하는 데이터를 처리하는 것입니다. 일부 모델에서 처리 속도가 빨라지며 처리할 수
있는 데이터 크기는 클러스터 크기에 의해 제한됩니다. 하지만 이러한 연산 방식은 비교적 복
잡한 인프라를 요구합니다. 현재 가장 인기 있는 분산 컴퓨팅 플랫폼 중 하나는 하둡
hadoop
위에
구축된 스파크입니다. 스파크는
MLlib
패키지에 일부 머신러닝 기능을 포함하고 있습니다. 데
이터가 이미 하둡 파일시스템에 저장되어 있거나 데이터 전처리를 위해 스파크를 쓰고 있다면
가장 손쉬운 방법입니다. 이런 인프라가 준비되어 있지 않을 경우 스파크 클러스터를 구축하고
통합하려면 많은 노력이 필요합니다. 앞서 이야기한
vw
패키지가 분산 기능을 조금 지원하므
로 이런 경우 더 나은 대안이 될 수 있습니다.
8.5.7
실력 기르기
인생의 많은 것들이 그렇듯이 이 책에서 다룬 주제에 대해 전문가가 되려면 연습밖에 ...