
10
1 章 探索的データ解析
したがって、
nan
の計算はちゃんとしていますし、
pandas
のほとんどの関数は
nan
を適切に処理します。欠損値はまた別の問題になります。
CleanFemPreg
の最終行では、ポンドとオンスを合わせて、ポンドでの単一量にし
た新カラム
totalwgt_lb
を作っています。
重要な注意:
DataFrame
に新たなカラムを追加するには、次のような辞書構文を
使わなければなりません。
# CORRECT
df['totalwgt_lb'] = df.birthwgt_lb + df.birthwgt_oz / 16.0
次のようなドット表記を使ってはいけません。
# WRONG!
df.totalwgt_lb = df.birthwgt_lb + df.birthwgt_oz / 16.0
ドット表記だと、
DataFrame
オブジェクトに属性を追加しますが、この属性は、
新たなカラムとしては扱われません。
1.7
検証
データが、あるソフトウェア環境から、別のソフトウェア環境にインポートされる
とき、エラーが紛れ込むことがあります。新たなデータセットに慣れてきたときにも
データを不正確に解釈したり、誤解してしまう危険性があります。データを確認・検
証することで、あとの処理にかかる時間やエラーをなくすことができます。
データ検証の
1
つの方法は、基本統計量を計算して、公表されている結果と突き合
わせることです。例えば、
NSFG
コードブックには、各変数を要約した表があります。
次の表は、妊娠の結果を符号化した ...