當前位置:
首頁 > 科技 > 大數據10的個常見誤解:演算法即預言家、大數據必須乾淨

大數據10的個常見誤解:演算法即預言家、大數據必須乾淨

關鍵時刻,第一時間送達!

作者丨DennisO』Reilly

譯者丨roy

譯者註:如果數據有一點點就不錯了,那麼數據是海量的話就一定棒極了,對不對?這就好比說, 如果一個炎日夏日裡的微風讓你感覺涼爽,那麼你會為一陣一陣的涼風感到欣喜若狂。以下為譯文:

也許對大數據更好的一個類比是它就像一匹意氣風發的冠軍賽馬: 通過適當的訓練和天賦的騎師,良種賽馬可以創造馬場記錄–但沒有訓練和騎手,這個強大的動物根本連起跑門都進不了。

為了確保你組織的大數據計劃保持正軌,你需要消除以下10種常見的誤解。

1. 大數據就是『很多數據』

大數據從其核心來講,它描述了結構化或非結構化數據如何結合社交媒體分析,物聯網的數據和其他外部來源,來講述一個」更大的故事」。該故事可能是一個組織運營的宏觀描述,或者是無法用傳統的分析方法捕獲的大局觀。從情報收集的角度來看,其所涉及的數據的大小是微不足道的。

2. 大數據必須非常乾淨

在商業分析的世界裡,沒有「太快」之類的東西。相反,在IT世界裡,沒有「進垃圾,出金子」這樣的東西,你的數據有多乾淨?一種方法是運行你的分析應用程序,它可以識別數據集中的弱點。一旦這些弱點得到解決,再次運行分析以突出 「清理過的」 區域。

3. 所有人類分析人員會被機器演算法取代

數據科學家的建議並不總是被前線的業務經理們執行。行業高管Arijit Sengupta在TechRepublic 的一篇文章中指出,這些建議往往比科學項目更難實施。然而,過分依賴機器學習演算法也同樣具有挑戰性。Sengupta說,機器演算法告訴你該怎麼做,但它們沒有解釋你為什麼要這麼做。這使得很難將數據分析與公司戰略規劃的其餘部分結合起來。

預測演算法的範圍從相對簡單的線性演算法到更複雜的基於樹的演算法,最後是極其複雜的神經網路。

4. 數據湖是必須的

據豐田研究所數據科學家Jim Adler說,巨量存儲庫,一些IT經理們設想用它來存儲大量結構化和非結構化數據,根本就不存在。企業機構不會不加區分地將所有數據存放到一個共享池中。Adler說,這些數據是 「精心規劃」的,存儲於獨立的部門資料庫中,鼓勵」專註的專業知識」。這是實現合規和其他治理要求所需的透明度和問責制的唯一途徑。

5. 演算法是萬無一失的預言家

不久前,谷歌流感趨勢項目被大肆炒作,聲稱比美國疾病控制中心和其他健康信息服務機構更快、更準確地預測流感疫情的發生地。正如《紐約客》的Michele Nijhuis 在2017年6月3日的文章中所寫的那樣, 人們認為與流感有關詞語的搜索會準確地預測疫情即將爆發的地區。事實上,簡單地繪製本地溫度是一個更準確的預測方法。

谷歌的流感預測演算法陷入了一個常見的大數據陷阱——它產生了無意義的相關性,比如將高中籃球比賽和流感爆發聯繫起來,因為兩者都發生在冬季。當數據挖掘在一組海量數據上運行時,它更可能發現具有統計意義而非實際意義的信息之間的關係。一個例子是將緬因州的離婚率與美國人均人造黃油的消費量掛鉤:儘管沒有任何現實意義,但這兩個數字之間確實存在「統計上顯著」的關係。

6.你不能在虛擬化基礎架構上運行大數據應用

大約10年前,當」大數據」首次出現在人們眼前時,它就是Apache Hadoop的代名詞。就像VMware的Justin Murray在2017年5月12日的文章中所寫的,大數據這一術語現在包括一系列技術,從NoSQL(MongoDB,Apache Cassandra)到Apache Spark。

此前,批評者們質疑Hadoop在虛擬機上的性能,但Murray指出,Hadoop在虛擬機上的性能與物理機相當,而且它能更有效地利用集群資源。Murray還炮轟了一種誤解,即認為虛擬機的基本特性需要存儲區域網路(SAN)。實際上,供應商們經常推薦直接連接存儲,這提供了更好的性能和更低的成本。

7. 機器學習是人工智慧的同義詞

一個識別大量數據中模式的演算法和一個能夠根據數據模式得出邏輯結論的方法之間的差距更像是一個鴻溝。ITProPortal 的Vineet Jain在2017年5月26日的文章中寫道,機器學習使用統計解釋來生成預測模型。這是演算法背後的技術,它可以根據一個人過去的購買記錄來預測他可能購買什麼,或者根據他們的聽歌歷史來預測他們喜歡的音樂。

雖然這些演算法很聰明,但它們遠遠不能達到人工智慧的目的,即複製人類的決策過程。基於統計的預測缺乏人類的推理、判斷和想像力。從這個意義上說,機器學習可能被認為是真正AI的必要先導。即使是迄今為止最複雜的AI 系統,比如 IBM沃森,也無法提供人類數據科學家所提供的大數據的洞察力。

8. 大多數大數據項目至少實現了一半的目標

IT經理們知道沒有數據分析項目是100%成功的。當這些項目涉及大數據時,成功率就會直線下降,NewVantage Partners最近的調查結果顯示了這一點。在過去的五年中,95%的企業領導人表示,他們的公司參與了一個大數據項目,但只有48.4%的項目取得了」可衡量的結果」。

NewVantage Partners的大數據執行調查顯示, 只有不到一半的大數據項目實現了目標,而 「文化」變化是最難實現的。

事實上,根據2016年10月發布的Gartner的研究結果,大數據項目很少能跨過試驗階段。Gartner的調查發現,只有15%的大數據實現被部署到生產中,與去年調查報告的14%的成功率相對持平。

9. 大數據的增長將減少對數據工程師的需求

如果你公司大數據計劃的目標是盡量減少對數據科學家的需求,你可能會得到令人不快的驚喜。2017 Robert Half 技術薪資指南指出, 數據工程師的年薪平均躍升到13萬美元和19.6萬美元之間, 而數據科學家的薪資目前平均在11.6萬美元和16.3萬美元之間, 而商業情報分析員的薪資目前平均在11.8萬美元到13.875萬美元之間。

10. 員工和一線經理將張開雙臂擁抱大數據

NewVantage Partners的調查發現,85.5%的公司都致力於創造一個「數據驅動的文化」。然而,新的數據計劃的整體成功率僅為37.1%。這些公司最常提到的三個障礙是缺乏組織一致性(42.6%),缺乏中層管理人員的採納和理解(41%),以及業務阻力或缺乏理解(41%)。

未來可能屬於大數據,但獲得這一技術的好處需要大量的針對多樣人性的老式辛勤工作。

喜歡這篇文章嗎?立刻分享出去讓更多人知道吧!

本站內容充實豐富,博大精深,小編精選每日熱門資訊,隨時更新,點擊「搶先收到最新資訊」瀏覽吧!


請您繼續閱讀更多來自 CSDN 的精彩文章:

Google 終於要讓 20億Android 設備能玩上高性能的 AR 了
總架構師眼裡的架構和架構師的成長之道
非常實用的Linux命令行技巧
項目管理工具必須具備的5個功能

TAG:CSDN |

您可能感興趣

細數歷史上三位偉大預言家,預言准到爆,至今無法用科學解釋
知名預言家再發警告:貨幣「大崩潰」悄然臨近 黃金將飆至2000美元!
鏈得得《誰是預言家?》趙何娟:今年99%的媒體和數據服務商會死掉
他是唐朝預言家,三大預言已有兩個成真,第三個將在2040年!
曾經預測911和英國脫歐的預言家 曾對2019年作了三大預測
知名預言家警告:全球貨幣崩盤即將來臨 金價恐飆至2000美元
她曾被稱20世紀最偉大預言家,預言幾乎都實現,最大遺憾是中國
二十世紀最偉大的預言家,生前無數預言已成真,唯有臨終驚天預言正在到來
她被稱為二十世紀最偉大的預言家,預言大多實現,曾這樣預言中國
鏈得得《誰是預言家?》易理華:2019年成型的Fund會減少90%以上
區塊鏈預言時代只有偉大的預言家才能「大」成功!
金庸筆下有兩個預言家 一個百發百中 一個可以預測60年
一位神秘的預言家曾預言:2018年中國將成為「超級大國」!
預言家?不聽他的兩個掛了,聽他的隋文帝,37年後國破家亡
20世紀美國神奇女預言家,多次預言成功,死前她預言了中國什麼
飽受爭議的世界級預言家,其預言書再版達400餘年而仍不絕版
孔侑才是真「預言家」,追過劇的人紛紛後悔,觀眾:我錯過了百萬
此人是唐朝預言家,三大預言已實現了兩個,第三個將發生在2040年
世上最偉大的盲人「預言家」對人類未來幾百年的神預測
預言家諸葛亮,在墓碑上刻了九個字,300年後果然成真