版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
分析:如何才能實(shí)現(xiàn)大數(shù)據(jù)的深發(fā)展?
圍墻里的大數(shù)據(jù)注定成為死數(shù)據(jù)。大數(shù)據(jù)需要開(kāi)放式創(chuàng)新,從數(shù)據(jù)的開(kāi)放、共享和交易,到價(jià)值提取能力的開(kāi)放,再到基礎(chǔ)處理和分析平臺(tái)的開(kāi)放,讓數(shù)據(jù)如同血液在數(shù)據(jù)社會(huì)的軀體中長(zhǎng)流,滋潤(rùn)數(shù)據(jù)經(jīng)濟(jì),讓更多的長(zhǎng)尾企業(yè)和數(shù)據(jù)思維創(chuàng)新者產(chǎn)生多姿多彩的化學(xué)作用,才能創(chuàng)造大數(shù)據(jù)的黃金時(shí)代。我的大數(shù)據(jù)研究軌跡我做了4-5年的移動(dòng)架構(gòu)和Java虛擬機(jī),4-5年的眾核架構(gòu)和并行編程系統(tǒng),最近4-5年也在追時(shí)髦,先是投入物聯(lián)網(wǎng),最近幾年一直在做大數(shù)據(jù)。我們團(tuán)隊(duì)的大數(shù)據(jù)研究軌跡如下圖所示:2010-2012年,主要關(guān)注數(shù)據(jù)和機(jī)器的關(guān)系:水平擴(kuò)展、容錯(cuò)、一致性、軟硬件協(xié)同設(shè)計(jì),同時(shí)厘清各種計(jì)算模式,從批處理(MapReduce)到流處理、BigSQL/adhocquery、圖計(jì)算、機(jī)器學(xué)習(xí)等等。事實(shí)上,我們的團(tuán)隊(duì)只是英特爾大數(shù)據(jù)研發(fā)力量的一部分,上海的團(tuán)隊(duì)是英特爾Hadoop發(fā)行版的主力軍,現(xiàn)在英特爾成了Cloudera的最大股東,自己不做發(fā)行版了,但是平臺(tái)優(yōu)化、開(kāi)源支持和垂直領(lǐng)域的解決方案仍然是英特爾大數(shù)據(jù)研發(fā)的重心。從2013年開(kāi)始關(guān)注數(shù)據(jù)與人的關(guān)系:對(duì)于數(shù)據(jù)科學(xué)家怎么做好分布式機(jī)器學(xué)習(xí)、特征工程與非監(jiān)督學(xué)習(xí),對(duì)于領(lǐng)域?qū)<襾?lái)說(shuō)怎么做好交互式分析工具,對(duì)于終端用戶怎么做好交互式可視化工具。英特爾研究院在美國(guó)卡內(nèi)基梅隆大學(xué)支持的科研中心做了GraphLab、StaleSynchronousParallelism,在MIT的科研中心做了交互式可視化和SciDB上的大數(shù)據(jù)分析,而中國(guó)主要做了SparkSQL和MLlib(機(jī)器學(xué)習(xí)庫(kù)),現(xiàn)在也涉及到深度學(xué)習(xí)算法和基礎(chǔ)設(shè)施。2014年重點(diǎn)分析數(shù)據(jù)和數(shù)據(jù)的關(guān)系:我們?cè)瓉?lái)的工作重心是開(kāi)源,后來(lái)發(fā)現(xiàn)開(kāi)源只是開(kāi)放式創(chuàng)新的一個(gè)部分,做大數(shù)據(jù)的開(kāi)放式創(chuàng)新還要做數(shù)據(jù)的開(kāi)放、大數(shù)據(jù)基礎(chǔ)設(shè)施的開(kāi)放以及價(jià)值提取能力的開(kāi)放。數(shù)據(jù)的暗黑之海與外部效應(yīng)下面是一張非常有意思的圖,黃色部分是化石級(jí)的,即沒(méi)有聯(lián)網(wǎng)、沒(méi)有數(shù)字化的數(shù)據(jù),而絕大多數(shù)的數(shù)據(jù)是在這片海里面。只有海平面的這些數(shù)據(jù)(有人把它稱作SurfaceWeb)才是真正大家能訪問(wèn)到的數(shù)據(jù),爬蟲(chóng)能爬到、搜索引擎能檢索到的數(shù)據(jù),而絕大多數(shù)的數(shù)據(jù)是在暗黑之海里面(相應(yīng)地叫做DarkWeb),據(jù)說(shuō)這一部分占數(shù)據(jù)總量的85%以上,它們?cè)谝恍┕聧u里面,在一些企業(yè)、政府里面躺在地板上睡大覺(jué)。數(shù)據(jù)之于數(shù)據(jù)社會(huì),就如同水之于城市或者血液之于身體一樣。城市因?yàn)楹恿鞫Q生也受其滋養(yǎng),血液一旦停滯身體也就危在旦夕。所以,對(duì)于號(hào)稱數(shù)據(jù)化生存的社會(huì)來(lái)說(shuō),我們一定要讓數(shù)據(jù)流動(dòng)起來(lái),不然這個(gè)社會(huì)將會(huì)喪失諸多重要功能。所以,我們希望數(shù)據(jù)能夠像“金風(fēng)玉露一相逢”那樣產(chǎn)生化學(xué)作用。馬化騰先生提出了一個(gè)internet+的概念,英特爾也有一個(gè)大數(shù)據(jù)X,相當(dāng)于大數(shù)據(jù)乘以各行各業(yè)。如下圖所示,乘法效應(yīng)之外,數(shù)據(jù)有個(gè)非常奇妙的效應(yīng)叫做外部效應(yīng)(externality),比如這個(gè)數(shù)據(jù)對(duì)我沒(méi)用但對(duì)TA很有用,所謂我之毒藥彼之蜜糖。比如,金融數(shù)據(jù)和電商數(shù)據(jù)碰撞在一起,就產(chǎn)生了像小微貸款那樣的互聯(lián)網(wǎng)金融;電信數(shù)據(jù)和政府?dāng)?shù)據(jù)相遇,可以產(chǎn)生人口統(tǒng)計(jì)學(xué)方面的價(jià)值,幫助城市規(guī)劃人們居住、工作、娛樂(lè)的場(chǎng)所;金融數(shù)據(jù)和醫(yī)學(xué)數(shù)據(jù)在一起,麥肯錫列舉了很多應(yīng)用,比如可以發(fā)現(xiàn)騙保;物流數(shù)據(jù)和電商數(shù)據(jù)湊在一塊,可以了解各個(gè)經(jīng)濟(jì)子領(lǐng)域的運(yùn)行情況;物流數(shù)據(jù)和金融數(shù)據(jù)產(chǎn)生供應(yīng)鏈金融,而金融數(shù)據(jù)和農(nóng)業(yè)數(shù)據(jù)也能發(fā)生一些化學(xué)作用。比如Googleanalytics出來(lái)的幾個(gè)人,利用美國(guó)開(kāi)放氣象數(shù)據(jù),在每一塊農(nóng)田上建立微氣象模型,可以預(yù)測(cè)災(zāi)害,幫助農(nóng)民保險(xiǎn)和理賠。所以,要走數(shù)據(jù)開(kāi)放之路,讓不同領(lǐng)域的數(shù)據(jù)真正流動(dòng)起來(lái)、融合起來(lái),才能釋放大數(shù)據(jù)的價(jià)值。三個(gè)關(guān)于開(kāi)放的概念1、數(shù)據(jù)開(kāi)放首先是狹義的數(shù)據(jù)開(kāi)放。數(shù)據(jù)開(kāi)放的主體是政府和科研機(jī)構(gòu),把非涉密的政府?dāng)?shù)據(jù)及科研數(shù)據(jù)開(kāi)放出來(lái)?,F(xiàn)在也有一些企業(yè)愿意開(kāi)放數(shù)據(jù),像Netflix和一些電信運(yùn)營(yíng)商,來(lái)幫助他們的數(shù)據(jù)價(jià)值化,建構(gòu)生態(tài)系統(tǒng)。但是數(shù)據(jù)開(kāi)放不等于信息公開(kāi)。首先,數(shù)據(jù)不等于信息,信息是從數(shù)據(jù)里面提煉出來(lái)的東西。我們希望,首先要開(kāi)放原始的數(shù)據(jù)(rawdata),其次,它是一種主動(dòng)和免費(fèi)的開(kāi)放,我們現(xiàn)在經(jīng)常聽(tīng)說(shuō)要申請(qǐng)信息公開(kāi),那是被動(dòng)的開(kāi)放。TimBernersLee提出了數(shù)據(jù)開(kāi)放的五星標(biāo)準(zhǔn),以保證數(shù)據(jù)質(zhì)量:一星是開(kāi)放授權(quán)的格式,比如說(shuō)PDF;其次是結(jié)構(gòu)化,把數(shù)據(jù)從文件變成了像excel這樣的表;三星是開(kāi)放格式,如CSV;四星是能夠通過(guò)URI找到每一個(gè)數(shù)據(jù)項(xiàng);五星代表能夠和其它數(shù)據(jù)鏈接,形成一個(gè)開(kāi)放的數(shù)據(jù)圖譜?,F(xiàn)在主流的數(shù)據(jù)開(kāi)放門戶,像data.dov或.uk,都是基于開(kāi)源軟件。英特爾在MIT的大數(shù)據(jù)科研中心也做了一種形態(tài),叫Datahub:吉祥物很有趣,一半是大象,代表數(shù)據(jù)庫(kù)技術(shù),一半是章魚(yú),取自github的吉祥物章魚(yú)貓。它提供更多的功能比如易管理性,提供結(jié)構(gòu)化數(shù)據(jù)服務(wù)和訪問(wèn)控制,對(duì)數(shù)據(jù)共享進(jìn)行管理,同時(shí)可以在原地做可視化和分析。廣義的數(shù)據(jù)開(kāi)放還有數(shù)據(jù)的共享及交易,比如點(diǎn)對(duì)點(diǎn)進(jìn)行數(shù)據(jù)共享或在多邊平臺(tái)上做數(shù)據(jù)交易。馬克思說(shuō)生產(chǎn)資料所有制是經(jīng)濟(jì)的基礎(chǔ),但是現(xiàn)在大家可以發(fā)現(xiàn),生產(chǎn)資料的租賃制變成了一種主流(參考《LeanStartup》),在數(shù)據(jù)的場(chǎng)景下,我不一定擁有數(shù)據(jù),甚至不用整個(gè)數(shù)據(jù)集,但可以租賃。租賃的過(guò)程中要保證數(shù)據(jù)的權(quán)利。首先,我可以做到數(shù)據(jù)給你用,但不可以給你看見(jiàn)。姚期智老先生82年提出“millionaires’dilemma(百萬(wàn)富翁的窘境)”,兩個(gè)百萬(wàn)富翁比富誰(shuí)都不愿意說(shuō)出自己有多少錢,這就是典型的“可用但不可見(jiàn)”場(chǎng)景。在實(shí)際生活中的例子很多,比如美國(guó)國(guó)土安全部有恐怖分子名單(數(shù)據(jù)1),航空公司有乘客飛行記錄(數(shù)據(jù)2),國(guó)土安全部向航空公司要乘客飛行記錄,航空公司不給,因?yàn)樯婕半[私,他反過(guò)來(lái)向國(guó)土安全部要恐怖分子名單,也不行,因?yàn)槭菄?guó)家機(jī)密。雙方都有發(fā)現(xiàn)恐怖分子的意愿,但都不愿給出數(shù)據(jù),有沒(méi)有辦法讓數(shù)據(jù)1和數(shù)據(jù)2放一起掃一下,但又保障數(shù)據(jù)安全呢?其次,在數(shù)據(jù)使用過(guò)程中要有審計(jì),萬(wàn)一那個(gè)掃描程序偷偷把數(shù)據(jù)藏起來(lái)送回去怎么辦?再者,需要數(shù)據(jù)定價(jià)機(jī)制,雙方數(shù)據(jù)的價(jià)值一定不對(duì)等,產(chǎn)生的洞察對(duì)各方的用途也不一樣,因此要有個(gè)定價(jià)機(jī)制,比大鍋飯式的數(shù)據(jù)共享更有激勵(lì)性。從點(diǎn)對(duì)點(diǎn)的共享,走到多邊的數(shù)據(jù)交易,從一對(duì)多的數(shù)據(jù)服務(wù)到多對(duì)多的數(shù)據(jù)市場(chǎng),再到數(shù)據(jù)交易所。如果說(shuō)現(xiàn)在的數(shù)據(jù)市場(chǎng)更多是對(duì)數(shù)據(jù)集進(jìn)行買賣的話,那么數(shù)據(jù)交易所就是一個(gè)基于市場(chǎng)進(jìn)行價(jià)值發(fā)現(xiàn)和定價(jià)的,像股票交易所那樣的、小批量、高頻率的數(shù)據(jù)交易。我們支持了不少研究來(lái)實(shí)現(xiàn)剛才所說(shuō)的這些功能,比如說(shuō)可用而不可見(jiàn)。案例一是通過(guò)加密數(shù)據(jù)庫(kù)CryptDB/Monomi實(shí)現(xiàn),在數(shù)據(jù)擁有方甲方這邊的數(shù)據(jù)庫(kù)是完全加密的,這事實(shí)上也防止了現(xiàn)在出現(xiàn)的很多數(shù)據(jù)泄露問(wèn)題,大家已經(jīng)聽(tīng)到,比如說(shuō)某互聯(lián)網(wǎng)服務(wù)提供商的員工偷偷把數(shù)據(jù)拿出來(lái)賣,你的數(shù)據(jù)一旦加密了他拿出來(lái)也沒(méi)用。其次,這個(gè)加密數(shù)據(jù)庫(kù)可以運(yùn)行乙方的普通SQL程序,因?yàn)樗捎昧送瑧B(tài)加密技術(shù)和洋蔥加密法,SQL的一些語(yǔ)義在密文上也可以執(zhí)行。針對(duì)“百萬(wàn)富翁的窘境”,我們做了另一種可用但不可見(jiàn)的技術(shù),叫做數(shù)據(jù)咖啡館。大家知道咖啡館是讓人和人進(jìn)行思想碰撞的地方,這個(gè)數(shù)據(jù)咖啡館就是讓數(shù)據(jù)和數(shù)據(jù)能夠碰撞而產(chǎn)生新的價(jià)值。比如兩個(gè)電商,一個(gè)是賣衣服的,一個(gè)是賣化妝品的,他們對(duì)于客戶的洞察都是相對(duì)有限的,如果兩邊的數(shù)據(jù)放在一起做一次分析,那么就能夠獲得全面的用戶畫像。再如,癌癥是一類長(zhǎng)尾病癥,有太多的基因突變,每個(gè)研究機(jī)構(gòu)的基因組樣本都相對(duì)有限,這在某種程度上解釋了為什么過(guò)去50年癌癥的治愈率僅僅提升了8%。那么,多個(gè)研究機(jī)構(gòu)的數(shù)據(jù)在咖啡館碰一碰,也能夠加速癌癥的研究。在咖啡館的底層是多方安全計(jì)算的技術(shù),基于英特爾和伯克利的一個(gè)聯(lián)合研究。在上面是安全、可信的Spark,基于“datalineage”的使用審計(jì),根據(jù)各方數(shù)據(jù)對(duì)結(jié)果的貢獻(xiàn)進(jìn)行定價(jià)。2、大數(shù)據(jù)基礎(chǔ)設(shè)施的開(kāi)放現(xiàn)在有的是有大數(shù)據(jù)思維的人,但他們很捉急,玩不起、玩不會(huì)大數(shù)據(jù),他不懂怎么存儲(chǔ)、怎么處理這些大數(shù)據(jù),這就需要云計(jì)算?;A(chǔ)設(shè)施的開(kāi)放還是傳統(tǒng)的PlatformasaService,比如AmazonAWS里有MapReduce,Google有BigQuery。這些大數(shù)據(jù)的基礎(chǔ)處理和分析平臺(tái)可以降低數(shù)據(jù)思維者的門檻,釋放他們的創(chuàng)造力。比如,每天爬幾十萬(wàn)的數(shù)據(jù),對(duì)價(jià)格信息(結(jié)構(gòu)化的和非結(jié)構(gòu)化的)進(jìn)行分析,然后告訴你買什么牌子、什么時(shí)候買最好。只有四個(gè)PhD搞算法,其他的靠AWS。另一家公司Prismatic,也利用了AWS,這是一家做個(gè)性化閱讀推薦的,我專門研究過(guò)它的計(jì)算圖、存儲(chǔ)和高性能庫(kù),用LISP的一個(gè)變種Clojure寫的非常漂亮,真正做技術(shù)的只有三個(gè)學(xué)生。所以當(dāng)這些基礎(chǔ)設(shè)施社會(huì)化以后,大數(shù)據(jù)思維者的春天很快就要到來(lái)。3、價(jià)值提取能力的開(kāi)放現(xiàn)在的模式一般是一大一小或一對(duì)多。比如Tesco和Dunnhumby,后者剛開(kāi)始是很小的公司,找到Tesco給它做客戶忠誠(chéng)度計(jì)劃,一做就做了幾十年,這樣的長(zhǎng)期戰(zhàn)略合作優(yōu)于短期的數(shù)據(jù)分析服務(wù),決策更注重長(zhǎng)期性。當(dāng)然,Dunnhumby現(xiàn)在已經(jīng)不是小公司了,也為其他大公司提供數(shù)據(jù)分析服務(wù)。再如沃爾瑪和另外一家小公司合作,做數(shù)據(jù)分析,最后他把這家小公司買下來(lái)了,成了它的WalmartLabs。一對(duì)多的模式,典型的是Pala
溫馨提示
- 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 成套監(jiān)控系統(tǒng)行業(yè)市場(chǎng)發(fā)展及發(fā)展趨勢(shì)與投資戰(zhàn)略研究報(bào)告
- 多輛掛車買賣合同范例
- 國(guó)家出境旅游合同范例
- 化工代理采購(gòu)合同范例
- 雙匯供銷合同范例
- 客戶居間服務(wù)合同范例
- 湖北企業(yè)靈活用工合同范例
- 與林地建房合同范例
- 建筑外墻粉刷合同范例
- 紹興商標(biāo)注冊(cè)代理合同范例
- 振蕩指標(biāo)MACD(波段操作精解)
- 養(yǎng)生餐廳調(diào)查研究報(bào)告
- 臨床醫(yī)學(xué)研究進(jìn)展展望新興領(lǐng)域與發(fā)展趨勢(shì)培訓(xùn)課件
- 北京市2022-2023學(xué)年三年級(jí)上學(xué)期語(yǔ)文期末試卷(含答案)2
- 普外科-臨床重點(diǎn)??平ㄔO(shè)項(xiàng)目自查總結(jié)報(bào)告
- 2023-2024年三年級(jí)上冊(cè)科學(xué)(教科版) 期末模擬試卷(三)(含解析)
- 消防爬梯施工方案
- 關(guān)于工程師思維素養(yǎng)課件
- 昆蟲(chóng)記32種昆蟲(chóng)簡(jiǎn)介
- 短視頻平臺(tái)私域建設(shè)研究報(bào)告
- 工業(yè)風(fēng)扇-專業(yè)介紹
評(píng)論
0/150
提交評(píng)論