
75
75
5.9 用語集
ルがある。各々は、解析分布から生成された乱数列を含む。
さらに、ファイルからデータを読み込んで
CDF
をさまざまに変換してプロットす
るスクリプト
test_models.py
がある。実行は次のようにする。
$ python test_models.py mystery0.dat
こういったプロットから、各ファイルがどの分布から生成されたか推論できるはず
だ。困ってしまうようなら、ファイルを生成したコードが含まれている
mystery.py
を見なさい。
演習問題
5-6
富と収入の分布は、対数正規とパレート分布を使ってモデル化されることがある。
どちらがより良いか調べるために、データを見てみよう。
人口動態調査(
Current Population Survey
、
CPS
)は、米国労働統計局と国勢調
査局とが協働して収入と関連する変数を調査しているものである。
2013
年にまと
められたデータは
http://www.census.gov/hhes/www/cpstables/032013/hhinc/
toc.htm
から得られる。
hinc06.xls
にダウンロードしてあるが、これは、家計収入
についての
Excel
のスプレッドシートで、本書のリポジトリにある
CSV
ファイル
hinc06.csv
に変換してある。このファイルを読み込んでデータを変換する
hinc2.py
もある。
このデータセットから収入の分布を抽出しなさい。本章の解析分布でデータの良い
モデルになるものがあるだろうか。この問題の解は
hinc_soln.py ...