
移到政府工作
|
147
回頭來看,我在 OpenTable 的兩個面向是突出的。首先,如前所述,我們僅想知道關於
資料的有限問題。我們也很少量的實施歸納研究,雖然我們知道那是資料探勘的核心。
第二,現在看來有些笨拙,就是我們對於儲存空間有極大的考量。磁碟空間的成本在我
們決定採購硬體時佔了絕大部份。此外,也常會討論要保留什麼資料以及要保留多久。
使用的資料結構以及當資料量成長後它的表現會如何也是個考量。單一機器實體會很快
的成長為叢集。保存資料的成本,不論好或壞,都是高的。因為我們必須要作這些決
定,所以通常我們僅會保留好的以及已知的資料,而不是盡可能的保留多的資料然後希
望挖掘出其他有用的資訊。
從這邊開始就是壞資料的轉捩點,以及為何這種性質的文字已變成必要的。儘管壞資料
總是已經存在一段頗長的時間了,經典的技術能夠輕易的管理它,並且符合這些標準技
術的需求。此外,因為每個東西能夠保留的有限,這些選擇反而會限制品質的種類而導
致更單純的資料集合。
當我在 OpenTable 的工作結束後,許多在資料世界中的轉捩點同時到來。第一,我們開
始看到硬體價格的暴跌,以及組裝電腦的概念開始出現。此外,雲端運算瞬間變成整體
遊戲的支配者。最後一點,幾年後,我們開始看見有一些聰明的人,將會開始領導真正
巨量資料的機會。
2
當你將這些概念與 Hadoop 和 NoSQL 資料庫家族這類的結構混合在
一起,你會發現你擁有捕捉驚人資料量的能力,其中大部份可能是「壞的」。
這當然是投機的,但我能夠想到許多事情,若現今的工具在我們建立公司時就存在,那 ...