
44
|
第
2
章
其次,需要确定抽样过程。它可以是“随机选出
100
名客户”。如果涉及从数据流(如实
时的客户交易或网站访问者)中进行抽样,那么就必须考虑到时间因素(例如,工作日上
午
10
点的访问者可能与周末晚上
10
点的访问者有很大差异)
。
在
分层抽样
中,总体被分为多个
层
,随机抽样是在每个层中进行的。政治性民意调查可能
想了解美国白人、非裔美国人和拉美裔美国人的选举倾向。对总体的简单随机抽样会导致
样本中非裔和拉美裔美国人的数量过少,所以在分层抽样中要赋予这些层更高的权重,以
得到大小相等的样本。
2.1.3
数量和质量
:
什么时候数量更重要
令人惊讶的是,在大数据时代,有时候数据量反而越小越好。在随机抽样上花费一些时间
和精力,不仅能减小偏差,还可以让我们集中精力进行数据探索和提高数据质量。例如,
缺失的数据和离群值可能包含非常有用的信息,在数百万条记录中追踪缺失值或估计离
群点需要花费的成本几乎是不可接受的,但在包含几千条记录的样本中,这些操作是可行
的。如果数据过多,那么绘图和人工检查也会十分困难。
那么,什么时候才需要海量数据呢?
体现大数据价值的一个经典情形是数据不仅规模巨大而且还很稀疏。我们看一下
Google
收
到的搜索查询请求,其中的列是名词,行是搜索查询,单元格的值是
0
或
1
,依查询中是否
包含该名词而定。目的是为一个特定查询确定最优的搜索目标。英语中的单词超过
15
万
个,
Google
每年处理的查询也超过
1
万亿次。这造就了一个巨大的矩阵,其中绝大多数元素是
0
。
这是一个真实的大数据问题——只有积累了海量数据,才能为多数查询返回有效的搜索结 ...