
212
9 章 pandas によるデータのクリーニング
dtype: int64
❶
df
インデックスのシャッフルしたバージョンを作成し、そのインデックスで
df
のインデックスを
再構成する。
❷ 名前と年が同じすべての重複行を削除する。
❸ 整数位置インデックスでソートする。
データ変換が成功していれば、有効な重複(
2
回受賞した人たち)だけが残っているでしょう。
残った重複の一覧を表示して調べてみましょう。
In : df[df.duplicated('name') |
df.duplicated('name', keep='last')]\ #
❶
.sort_values(by='name')\
[['name', 'country', 'year', 'category']]
Out:
name country year category
548 Frederick Sanger United Kingdom 1958 Chemistry
580 Frederick Sanger United Kingdom 1980 Chemistry
292 John Bardeen United States 1956 Physics
326 John Bardeen United States 1972 Physics
285 Linus C. Pauling United States 1954 Chemistry
309 Linus C. Pauling United States 1962 Peace