
205
9.4 データのクリーニング
df[df.name.str.contains('\*')]['name'] #
❶
Out:
1 Ivo Andric *
2 Vladimir Prelog *
...
1041 John Warcup Cornforth *
1046 Elizabeth H. Blackburn *
Name: name, Length: 142, dtype: object #
❷
❶
str
の
contains
メソッドを
name
列に使用する。アスタリスクは正規表現の文字列なのでエスケー
プする必要がある(
'\*'
)。そして、ノーベル賞
DataFrame
にブールマスクを適用するとその結果の
名前が列挙される。
❷
1,052
行中の
142
行が
*
を含む名前を持つ。
名前を整えるために、アスタリスクを空の文字列に置き換え、その結果の名前から空白を取り除
きましょう。
df.name = df.name.str.replace('*', '') #
❶
#
名前から空白を取り除く
df.name = df.name.str.strip()
❶ 名前フィールドのすべてのアスタリスクを削除し、その結果を
DataFrame
に返す。
確認すると、名前がきれいになっていることがわかります。
df[df.name.str.contains('\*')]
Out:
Empty DataFrame
pandas
の
Series
は多くの文字列処理関数を備えています。文字列列の検索や変更が可能です。
このような文字列処理関数のリスト一覧は ...