
203
第十七章
資料可追蹤性
Reid Draper
你的軟體藉由結合文化與音樂資料,持續的提供令人印象深刻的音樂推薦。客戶很高
興。然而,事情不可能總是完美的。有時 Beyoncé 的專輯會被寫為 Beyonce。而 Béla
Fleck 的獨奏專輯會顯示為 Béla Fleck and the Flecktones。更糟的是,
ボリス
的傳記會
被顯示成 ???。這些事情是哪裡錯了?是其中一個顧客提供你錯誤編碼的字元資料嗎?
還是其中一個網路爬蟲有錯誤?也許是名字解析程式碼錯誤的結合了獨奏演奏家跟他的
樂團?
我們要如何解決這個問題?我們要能夠跟著每次的轉變,追蹤回它的源頭。這能夠被具
體化為
資料出處
。在本章中,我們會探討追蹤我們的資料來源的方法、放棄壞資料的技
巧以及採用這些方法的商業價值。
為什麼?
擁有追蹤回資料源頭的能力是很重要的,主要有幾個理由。它幫助我們能夠放棄或是重
新處理壞資料,而相反的,它也讓我們能夠知道好的資料來源或是處理技巧是哪些。此
外,本地的隱私法能夠命令如可審查性、資料轉移限制以及更多的事情。舉例來說,加
州的「Shine the Light Law」就規定,當居民有所請求時,企業必須要揭露跟第三方組
織所分享的個人資訊。歐洲的「Data Protection Directive」甚至對企業蒐集居民的資料
提供了更嚴格的規範。
205