
249
11
章
pandas
を使ったデータ探索
9
章では、
6
章で
Wikipedia
からスクレイピングしたノーベル賞データセットをクリーニングし
ました。この章ではクリーニングした新しいデータセットの探索を始めます。そして興味深いパ
ターン、ストーリー、興味深い可視化の基礎となるすべての要素を探しましょう。
まず、先入観を持たずに、クリーニングしたデータをよく観察して、どのように可視化にすれば
よいか大まかな構想を考えてみます。例
11-1
に、カテゴリ、時間、地理データを持つノーベル賞
データセットを示します。
例
11-1
クリーニング済みのノーベル賞データセット
[{
'category': u'Physiology or Medicine',
'date_of_birth': u'8 October 1927',
'date_of_death': u'24 March 2002',
'gender': 'male',
'link': u'http://en.wikipedia.org/wiki/C%C3%A9sar_Milstein',
'name': u'C\xe9sar Milstein',
'country': u'Argentina',
'place_of_birth': u'Bah\xeda Blanca , Argentina',
'place_of_death': u'Cambridge , England',
'year': 1984
},
...
}]
例
11-1
のデータは、調査してみたくなるような ...