
88
|
第六章:在矛盾的線上評論中偵測謊言以及混亂的狀況
Weotta
Weotta
1
是我的公司,我們以使用者實際關心的方式,來生產應用程式和 API 給人們瀏
覽本地資料,所以我們會回答如下的問題:附近有適合小朋友的餐廳嗎?最近的瑜珈中
心在哪?本周有什麼演唱會嗎?
要做到這件事,我們要分析、聚集並且組織本地的資料,然後依照我們用來回答問題的
方式分類它們。這個分類的程序讓我們能夠知道,有什麼餐廳是漂亮的,哪些酒吧很特
別或是第一次約會應該要去哪裡。線上的商業評論是其中一個我們用來決定分類的輸入
資訊。評論能夠告訴我們評論者是持正面或是負面的意見,也能告訴我們他們所關心的
事情,如服務品質、氣氛以及價值。當我們聚集這些評論時,我們能夠知道該地點受歡
迎的事物以及為什麼人們喜歡或是討厭它。除了評論,我們也使用許多其他的資訊,但
是若搭配適當的自然語言處理應用程式
2
,評論則是很豐富的重要資訊。
取得評論
要取得評論,可以的話我們會使用 API,但多數的評論都必須要使用傳統從網頁上抽取
資料的方式取得。若你能夠使用像 CityGrid
3
的 API 來取得你所需的資料,那麼一切就很
簡單了,因為雖然從網頁上抽取資料不一定很困難,但它通常會非常令人挫折。網站的
HTML 常會未經通知就變更,而只有最簡單或是最厲害的網頁資料抽取程式不會受到影
響。但大多數的網頁資料抽取程式就算遇到最小的 HTML 變更都有可能無法運作,強制
你要持續的監控並且維護程式。這是網路探勘資料的黑暗祕密:最終的結果可能是很好
且無瑕的資料,但整個程序比較像是雜工要做的事情,每件雜事都是獨一無二的並且無 ...