
330
2
fastai 애플리케이션 계층 이해하기
열이 필요하지도 않습니다. 그렇지만 여전히
SF
, 액션, 영화 개봉 시기 등의 의미를 표현할 방
법이 있어야 하며, 적어도 사용자가 영화를 고른 이유와 연결고리가 있어야 합니다. 이런 정보
는 명시적으로 존재하지 않지만, 잠재 요소가 이를 잠재적으로 표현하죠.
이 장에서는 영화 추천 문제를 다룹니다. 우선 협업 필터링 모델에 적합한 데이터를 가져오며
시작해보죠.
8.1
넷플릭스의 영화 시청 기록 데이터셋을 얻을 수는 없지만, 무비렌즈
MovieLens
(
https
://
oreil
.
ly
/
gP3Q5
)라는 훌륭한 데이터셋을 활용할 수 있습니다. 이 데이터셋은 영화 평점 정보 (영화
ID
, 사용자
ID
, 영화 평점의 조합)를 수천만 개 제공합니다. 우리는 그중 일부인
10
만 개만 사
용합니다. 나중에 모든 데이터(
2
,
500
만 개)를 사용해서도 시도해보길 바랍니다. 훌륭한 학습
용 프로젝트가 될 것입니다.
공통으로 사용하는
fastai
의
untar
_
data
함수로 데이터셋을 얻습니다.
from fastai.collab import *
from fastai.tabular.all import *
path = untar_data(URLs.ML_100k)
README
파일에 따르면 기본 테이블은
u
.
data
파일에 있습니다. ...