
13
1.4 正規化
Genes in data_table: 20500
Genes in gene_info: 20503
遺伝子長データには、実験で実際に計数されたものより多くの遺伝子が含まれていました。フィ
ルタをかけて関係ある遺伝子だけを抜き出し、リード数データと同じ順番に並べてみましょう。
ここで、
pandas
のインデックス付けが役立つのです。
2
つのデータソースから遺伝子名の交点
(
intersection
)が得られるので、それを使って両方のデータセットにインデックスを付け、同じ遺
伝子が同じ順番に並ぶようにします。
# Subset gene info to match the count data
リード数データの遺伝子と一致する遺伝子の情報を抜き出す。
matched_index = pd.Index.intersection(data_table.index, gene_info.index)
次に、遺伝子名の交点を使ってリード数データにインデックスを付けます。
# 2D ndarray containing expression counts for each gene in each individual
各標本の各遺伝子の発現リード数が格納された
2
次元の
ndarray
counts = np.asarray(data_table.loc[matched_index], dtype=int)
gene_names = np.array(matched_index)
# Check ...