
62
|
第
2
章
相应的
Python
代码如下:
nflx = sp500_px.NFLX
nflx = np.diff(np.log(nflx[nflx>0]))
fig, ax = plt.subplots(figsize=(4, 4))
stats.probplot(nflx, plot=ax)
与图
2-11
不同,在图
2-12
中,当数据点的值比较小时,它们远远低于对角线,而当数据
点的值比较大时,又远远高于对角线。这说明数据不是正态分布的,这意味着我们比数据
正态分布时更容易观测到极端值。图
2-12
展示了另一种常见现象
:在数据距均值一个标准
差之内时,它们是接近于对角线的。图基称这种现象为数据是“中部正态的”,但有更长
的尾部(见
[T
ukey-1987]
)。
有大量统计学文献研究了如何对观测数据拟合统计分布。要注意,不要过度
使用以数据为中心的方法,这种方法一半是科学,一半是艺术。数据是变化
的,但表面上看通常是一致的,分布的形状和类型也不止一种。一般来说,
必须同时使用领域知识和统计学知识来确定哪种类型的分布适合对具体情况
建模。例如,如果数据是关于一台服务器在多个连续的
5
秒时段中的互联网
流量水平的,那我们就应该知道,要对这种“每时段事件”进行建模,最好
的分布就是泊松分布(参见
2.12.1
节
)。
本节要点
•
多数数据不是正态分布的。
•
正态分布假设可能导致对极端事件估计不足(“黑天鹅”)。
扩展阅读
• Nassim Nicholas Taleb
所著的
The Black Swan
第
2
版。
• K. Krishnamoorthy ...