
218
9 章 pandas によるデータのクリーニング
❶ 女性教育の現状改革のために、
Malala
の感動的なストーリー(
http://ja.wikipedia.org/wiki/
マララ・
ユスフザイ
)についてもっと読むことを推奨する。
これで日付フィールドが操作可能な形式になりました。完成した
clean_data
関数を見てみま
しょう。この関数は、本章でのクリーニングの手順をまとめています。
9.5
完成した
clean_data
関数
スクレイピングした
Wikipedia
データセットのような手動で編集したデータでは、おそらく
1
回ですべてのエラーを探し出すことはできないでしょう。そのため、データ探索段階ではわずかな
エラーしか見つけられないとします。とはいえ、このノーベル賞データセットは十分に使い物にな
るように見えます。データは十分にクリーンになり、本章の目的は達成したと言えるでしょう。例
9-4
は、今回のクリーニング手順を示しています。
例
9-4
ノーベル賞データセットのクリーニングに使ったすべての関数
def clean_data(df):
df = df.replace('', np.nan)
df_born_in = df[df.born_in.notnull()] #
❶
df = df[df.born_in.isnull()]
df = df.drop('born_in', axis=1)
df.drop(df[df.year == 1809].index, inplace=True) ...