
Data Science
388
는 항상 단어 수 세기라는 것이다.
25.1
예시: 단어 수 세기
데이텀에는 이제 수백만 사용자가 있다! 여러분의 고용 안정성에는 희소식이지
만, 덕분에 데이터를 분석하는 일이 좀 더 어려워졌다.
콘텐츠 팀의 부사장은 사용자들이 어떤 주제에 관한 내용을 업로드하는지 궁
금해 한다. 첫 번째 시도로 사용자들이 올리는 게시물에 등장하는 단어들의 수
를 세서, 빈도 수가 가장 높은 단어들을 찾아 그에게 제시해 보자.
사용자들이 몇백 명뿐일 때는 이 작업이 간단했다.
from typing import List
from collections import Counter
def tokenize(document: str) -> List[str]:
"""
공백
문자를
기준으로
나눈다
."""
return document.split()
def word
_
count
_
old(documents: List[str]):
"""
맵리듀스를
사용하지
않고
단어
수
세기
"""
return Counter(word
for document in documents
for word in tokenize(document))
하지만 사용자의 수가 백만 명 단위로 늘어나다 보니 글, 또는 문서(
documents
)
의 양이 너무 많아서 컴퓨터 한 대로는 부족할 정도가 되었다. ...