比來大數據成了顯學,乃至可以說是神學,一門讓多半人都感覺很神的科學。
理論上,只要可以或許把握而且整合網際網路上的利用足跡,大數據確切可以很神。不外現實上,若是一味強調大數據無所不克不及,那就是大騙劇了。
大數據可以多麼神?網路上有如許一個故事段子,特別很是貼切:
或人打德律風去訂披薩,德律風接通還沒說話,客服人員就知道來電的人是誰,並且還知道家住哪裡、手電機話幾號、家裡德律風幾號,本來這些資料都已被整合了。
客戶想訂海鮮披薩,客服人員提示根據醫療記載,最好不要吃海鮮,還說參考曩昔查閱的資料,勸訂健康披薩,而且自動憑據定戶家裡人數建議披薩巨細,順帶提示老母親剛動過手術不宜吃太多。
客戶要刷卡,客服人員連刷卡記載跟銀行可用額度都知道,並且提醒客戶方才刷了共用單車,定位顯示人就在四周,無妨自己來取。最後順帶憑據客戶的戀人資料,溫馨提示等等去約會時,應當帶什麼物品。
故事會太誇大嗎?不會。理論上都做獲得。不過現實上卻紛歧定,因為要看利用者平常糊口的上網水平,和各家網站數據的整合水平。
簡單說,假如有人幾乎都不上彀,大數據就找不太到他的資料。當各家網站的數據沒法真正整合,披薩客服人員只會知道客戶曩昔的訂餐記載,當然不會知道醫療、金融、交通等其他紀錄。
有一個跟大數據相幹的概念,最近也受到良多正視,特別選舉快到了更是如斯,這就是網路上的社群聆聽(social listening),以及相幹的網路聲量分析。
社群凝聽以及網路聲量,就是追蹤及分析網路上對某些人物或是主題的會商情形,包羅正、負評價的次數,和最常伴隨出現的文字(構成文字雲)。
初次看到網路聲量分析的人,必然會覺得大數據很神,居然可以發掘出網路上是怎麼接洽某些人物或是主題。
道理說起來也不複雜,首要就是透過Hadoop或Spark這些既有的程式框架,成長出機械進修的程式,到網路上索引和跟踪相幹數據。
網路聲量闡明有三大要害:一是程式發展能力,二是納入分析的網址及社群網站,和追蹤的詞彙數目,三是語意闡發的能力。
如果程式不優、網站及辭彙數目不多、語意闡明不佳,那麼就算跑出有模有樣的大數據剖析圖表,卻完全沒有參考價值,並且還會誤導,基本就是大騙劇。
就算大數據分析的程式優、網站及辭彙數目多、語意闡明佳,照舊要謹慎,因為這反應的是積極參與接洽的網友的定見,未必是全部網友的心態,個中更沒有包孕不太上彀的群體。對大數據過度解讀,一樣會釀成大騙劇。
大數據確切很神,在網路時期人人要懂才能善用,也避免大數據釀成大騙劇。
●作者:賴祥蔚/台灣藝術大學廣播電視學系傳授、中華流傳經管學會理事長
●本文為作者評論定見,不代表《NOWnews本日新聞》立場
●《本日概念》開拓分歧的視野
●《本日廣場》迎接來稿或介入接洽,文章迎接寄至public@nownews.com