
数据与抽样分布
|
45
些相关记录,需要几万亿个数据点(随机抽样并不会提供什么帮助),参见
2.7
节。
2.1.4
样本均值与总体均值
我们使用符号
表示来自于总体的一个样本的均值,用
μ
表示总体均值。为什么要进行
这种区分呢?因为样本的相关信息是可以观测的,而大型总体的相关信息通常是根据小样
本推断出来的。统计学家一般通过符号表示对二者进行区分。
本节要点
•
即使在大数据时代,随机抽样仍然是数据科学家重要的工具。
•
当测量或观测因为不具有总体代表性而产生系统性误差时,就会出现偏差。
•
数据质量通常比数据数量更重要,而随机抽样可以减小偏差,提高数据质量。但如
果不进行随机抽样,这些操作的成本会非常高。
2.1.5
扩展阅读
•
在
Nigel G. Fielding
、
Raymond M. Lee
和
Grant Blank
编辑的
The SAGE Handbook of Online
Research Method
s
第
2
版中,
Ronald Fricker
撰写了“
Sampling Methods for Online Surveys
”
一章,对抽样过程进行了介绍,还概述了随机抽样的修正方法,这些方法通常用于需要
考虑成本或可行性的情况。
•
在
Capital Century
网站上,可以找到关于《文学文摘》民意调查失败的故事。
2.2
选择偏差
尤吉
•
贝拉说过:“如果你不知道在寻找什么,那就尽力去找,最后总会找到的。”
选择偏差指以一种能导致误导性或暂时性结论的方式,有选择性地去选取数据(可能是有
意识的,也可能是无意识的) ...