
159
159
11.5 予測
ルのすべてで、予測能力のあることがすでにわかっている
agepreg
を含みます。
説明変数の各々について、変動性を調べました、そうしないと、回帰の結果は信頼
できないからです。各モデルについて観察回数も調べました。多数の
nan
を含む変数
は、予測の候補には向きません。
これらの変数のほとんどについて、クリーニングはしていません。変数のいくつか
は、線形回帰ではあまりうまく働かないような符号化がされていました。結果的に、
適切にクリーニングしたなら、有用だったかもしれない変数を見逃したかもしれませ
ん。それでも、よい候補は見つかるでしょう。
11.5
予測
次のステップは、結果を整列して、
R
2
の最高値をもたらすような変数を選ぶこと
です。
t.sort(reverse=True)
for mse, name in t[:30]:
print(name, mse)
リストの最初の変数は
totalwgt_lb
で、
birthwgt_lb
が続きました。出生時体重を
予測するのに出生時体重を使うわけにはいきません。
同様に、
prglngth
は有用な予測能力を持ちますが、この賭けでは、
prglngth
(お
よび関連変数)は未知だと仮定します。
有用な予測変数の最初は、
babysex
で、新生児が男か女かを示します。
NSFG
デー
タセットでは、男のほうが
0.3
ポンド重いです。したがって、新生児の性別がわかっ
たと仮定すると、それを予測に使えます。
次は、
race
で、回答者が白人、黒人、あるいはその他かを示します。説明変数として、 ...