這算是Machine Learning的科普書,O’Relly是把這本分到Web 2.0系統中的一本,看完才知道原來有這麼多應用都是用Machine Learning做出來的。
最喜歡的部份就是,書中講完某個演算法後,就會真的寫出一個跟據那個演算法的應用,然後配合現實中的資料。例如,他講到推荐排飛機行程,就真的可以連到某個訂機票網頁用他們的API去查;講到搜尋,就真的跟你講怎麼把網頁抓回來,分析單字,存到SQL資料庫,然後用PageRank演算法排序(唯一的問題是英文單字可以用空白或非a-z切出來,中文就沒有講要怎麼切)。看了這本書才知道,原來以前Yahoo!的網頁排名是死的,而Google的網頁排名是應用Machine Learning的觀念去動態排的。Facebook交友分析,過濾垃圾信,Amazon的推薦相關商品也都有講,相當有趣。
而且Machine Learning這種東西,正確資料量大的話越綀越準。Gmail的垃圾信過濾很準,是因為他有一堆人類使用者在幫他訓綀他的演算法!這也是本書Collective Intelligence的由來,而且可以把這些統計資料套用回全部人上。所以就算別的公司也想出一個很棒的演算法,沒有像GMail有那麼多免費「工程師」幫他訓綀的話,也是贏不了的!
還有書裡面講到supported vector machine的時候,作者就說可以去抓一個叫做libsvm的library,竟然是上學期去旁聽數值分析的老師寫的!沒想到這套這麼有名啊…
沒有留言:
張貼留言