
166
■
8
章 ケーススタディ:
NASA
メタデータのマイニング
図8-5
選ばれた一部のキーワードを持つデータセットに含まれる単語の中でtf-idfが高いもの
tf-idf
を使ったため、個々のキーワードに対応する説明フィールドで最も重要な
単語を探し出すことができました。たとえば、「
SEISMOLOGY
」(地震学)をキー
ワードとするデータセットでは「
earthquake
」、「
risk
」、「
hazard
」(危険)、「
HUMAN
HEALTH
」(人間の健康)をキーワードとするデータセットでは「
wellbeing
」(健康)、
「
vulnerability
」(脆弱性)、「
children
」といった単語が含まれています。英単語ではな
い文字の組み合わせは、頭字語(たとえば、
Office of Management and Budget:
アメ
リカ合衆国行政管理予算局を表す
OMB
など)やそのトピックで重要な意味を持つ年
などの数値です。
tf-idf
統計量は、目的通りの単語、
すなわち文書のコレクションの
一部となっている文書にとって重要な単語を探し出したのです。
8.4
トピックモデリング
統計指標として
tf-idf
を計算したので、
NASA
メタデータ説明フィールドの内容が
どのようなものかについてすでにある程度のイメージはできていますが、
NASA
説
明フィールドとは何なのかという問いに別の方法でアプローチしてみましょう。第
6
章で説明したトピックモデリングを使えば、個々の文書(説明フィールド)をト
ピックの混合 ...