
148
|
第十一章:別讓「完美」成為「好」的敵人:壞資料真的壞嗎?
髒資料是什麼?它有數個定義。第一,就單純是不正確的資料。
X
的值應該要等於 1,
但在你的結構中它等於 2。這就是壞的。這可能是在企業或是處理技術中要將資料放入
資料管線內時,包含了任意數量的壞功能,在一個交易系統中,從輸入感測器到 ETL
(萃取(extract)、轉置(transform)與載入(load))工作都有可能發生。第二,資料
本身的值是正確的,但是相關的元資料不正確,或在許多狀況中,元資料根本不存在。
這代表你擁有值,但你無法準確的知道它代表什麼。第三,將資料用在更廣泛的集合或
是系統中可能會有問題。當你嘗試使用資料處理工具來從資料中抓取出資訊,但又不遵
守程序、演算法的規則或假設就有可能會發生。
從這些,我們看到「髒資料」實際上是個模糊的詞。它擁有能夠影響整個企業或是影響
嘗試在 R 中跑回歸的資料科學家的意義。然而,清理與修復資料的重要性必須要被所有
參與的人瞭解,而跨組織的套用規範則能夠減輕可能會發生的潛在傷害。
政府資料是非常真實的
知道「正確」管理與準備資料方法的概念後,將這些技巧套用在政府行政資料上則是
不切實際的。許多政府擁有的資料集合—如 911 或 311 的電話記錄、犯罪記錄或是許可
證—本質上就不是乾淨的,因為它們代表了都市生態系中的日常生活的資料。
當我進入政府服務時,我擁有關於資料應該要如何被使用的非常高貴的構想。身為一個
電腦科學家,我認為我們能夠在遭遇到任何問題時,將它分解成變數組,套用一個方法