1.1 大資料時代
1.1.1第三次資訊化浪潮
2010年前后,以云計算、大資料、物聯網的首發為標志迎來第三次資訊化浪潮,
IT發展史歷經的資訊化浪潮如下:

1.1.2 大資料時代的到來需要技術支撐

主要表現為:
- 存盤設備容量不斷增加
- CPU處理能力大幅提升
- 網路帶寬不斷增加
1.1.3 資料產生方式的變革促進大資料時代到來
第一階段:運營式系統階段,實體:購物記錄,資料僅由運營系統生成,
第二階段:用戶原創內容階段,實體:微信,每個網民都成為自媒體,可以向網路發送資訊,但到此為止還不足以促進大資料時代到來,
第三階段:感知式系統階段,物聯網(IoT)的大規模普及,實作了萬物互聯,物聯網底層是感知層,比如攝像頭、傳感器,這些設備時刻生成大量資料,物聯網的興起促使了大資料時代到來,

1.1.4 大資料的發展歷程

1.2 大資料的概念和影響
1.2.1大資料的4V特性
4V特性指velocity、variety、value、volume,

(1)資料量大:
大資料摩爾定律(根據IDC作出的估測,資料一直都在以每年50%的速度增長,也就是說每兩年就增長一倍),
人類在最近兩年產生的資料量相當于之前產生的全部資料量,

(2)資料型別繁多:
大資料是由結構化和非結構化資料組成:
- 結構化資料存盤在關系型資料庫中,只占10%,

- 大部分都是非結構化資料,型別非常多,

(3)處理速度快:
目前很多企業都需要秒級決策,從資料的生成到消耗,時間視窗非常小,可用于生成決策的時間非常少,
1秒定律:這一點和傳統的資料挖掘技術有著本質的不同,
(4)價值密度低,商業價值高:
如此大量的資料,很多可能都是沒有價值的資料,比如監控攝像頭時刻生成大量資料需要進行存盤,一旦發生案件時,攝像頭存盤的視頻才有用,但發生案件的幾率很小,因此價值密度低很低,
1.2.2大資料的影響
圖靈獎獲得者Jim Gray博士總結人類在科學研究上,先后經歷了實驗、理論、計算和資料四種范式,

在思維方式方面,大資料完全顛覆了傳統的思維方式:
- 全樣而非抽樣
大資料時代之前,我們無法保存和分析所有資料,只能統計學采用抽樣進行分析,舍棄了很多資料,只抽取一部分資料進行存盤、計算、分析,
而現在我們有足夠的空間、可以構建服務器集群進行龐大資料處理,就可以做全樣的資料分析, - 效率而非精確
之前在做抽樣統計時,需要不斷提高演算法精度,因為抽樣計算的結果誤差放到全樣上會被放大,容易超出許可范圍,
而全樣分析不存在誤差放大的問題,不追求精確度,而追求時效性、追求效率, - 相關而非因果
更多的追求事物的相關性,而不關注因果關系,不問為什么,只關注關聯性,

1.3 大資料的應用
1.3.1大資料的應用領域

1.3.2舉例:流感預測
谷歌使用大資料預測流感趨勢,利用搜索引擎實時收集用戶搜索的資訊,
通常遇到疾病時,會首先使用搜索引擎搜索,然后再去醫院,這些搜索關鍵詞構成了龐大的資料庫,

1.4 大資料的關鍵技術
1.4.1大資料技術的層次
下圖為大資料技術的層次,最核心的大資料技術在資料存盤與管理、資料處理與分析這兩個層面,

1.4.2兩大核心技術
兩大核心技術指的是分布式存盤、分布式處理,

分布式存盤:解決海量資料的存盤問題,單機無法存盤海量資料時,就借助集群進行分布式存盤,

分布式處理:解決海量資料的處理問題,單機無法高效完成海量資料處理時,就使用集群進行分布式處理,

1.4.3大資料技術以谷歌公司技術為代表

1.4.4大資料計算模式
目前有許多大資料相關產品存在,這些產品可能用于批處理、實時計算、互動式計算,但是沒有任何一款產品可以滿足所有需求,因此不同計算模式需要使用不同的產品,
典型的計算模式可以分為四種:
-
批處理計算:典型代表為MapReduce、Spark,
用于解決大規模資料的批量處理,
不適合做實時互動式計算,做不到秒級回應,
其中Spark實時性比MapReduce更好,并且可以進行迭代計算,比如資料挖掘需要迭代計算時就需要使用Spark,

-
流計算:典型代表為Storm、S4、Flume、Streams、Puma、DStream、SuperMario、銀河流資料處理平臺等,
需要進行實時處理,給出實時回應,否則分析結果就會失去商業價值,

流計算框架如下:

-
圖計算:典型代表為Pregel、GraphX、Giraph、PowerGraph、Hama、GoldenOrb等,
處理大規模圖結構資料,
現實生活中比如社交網路、交通網路都可以轉成圖結構進行處理,

-
查詢分析計算:典型代表為Hive、Dremel、Cassandra、Impala等,
用于大規模資料的存盤管理和查詢分析,
計算模式總結表如下:

1.5 大資料與云計算、物聯網的關系
1.5.1云計算
云計算要解決兩大核心問題:即海量資料存盤和處理問題,

云計算典型特征:虛擬化、多租戶,
云計算的概念:通過網路以服務的方式為用戶提供非常廉價的IT資源,
云計算的優勢:企業不需要自建IT基礎設施,可以租用云端資源,
云計算的三種模式:公有云、混合云、私有云,
公有云舉例:百度云,面向所有用戶,
私有云舉例:電信、移動,面向企業內部,
混合云:部分給自己,部分給公眾,

三種云服務:IaaS、PaaS、SaaS
- IaaS:基礎設定即服務
將基礎設施(計算資源和存盤)作為服務出租,
比如亞馬遜提供了EC2,可以直接購買并在環境上安裝系統和業務等,平臺已經提供CPU等資源, - PaaS:平臺即服務
個體沒有能力獨立開發云計算產品,不具備環境,
比如新浪搭建了云計算分布式開發平臺Sina App Engine,可以購買后在新浪上開發、部署云服務, - SaaS:軟體即服務
將軟體作為服務出售,
典型案例:云財務軟體,
從一個集中的系統部署軟體,使之在一臺本地計算機上(或從云中遠程地)運行的一個模型,由于是計量服務,SaaS允許出租應用程式,并計時收費,

云計算關鍵技術:
- 多租戶:同時為多個用戶服務,
- 虛擬化:上機操作均基于Linux環境,可以利用虛擬化技術,再虛擬機上裝Linux系統,比如虛擬專用網VPN,

云計算資料中心:資料中心是云計算的溫床,各種資料和應用都位于資料中心,

全球各地大量建設資料中心:

資料中心投資非常高昂、耗能非常大,因此必需建設在地址結構穩定、氣候涼爽的地方,
政務云、教育云、中小企業云、醫療云都是云計算的應用,

1.5.2物聯網
物聯網:IoT(The Internet of Things)
物聯網概念:物物相連的互聯網,是互聯網的延伸,

物聯網層次架構:

典型物聯網應用:智能公交,在公交車上的JPS定位相當于感知層,通過沿途基站傳輸資訊,用戶通過因特網訪問,
物聯網的關鍵技術:
- 識別與感知技術(二維碼、RFID、傳感器等)
- 網路與通信技術
- 資料挖掘與融合技術等,
物聯網應用:

1.5.3大資料、云計算、物聯網的關系
三者相輔相成,既有聯系又有區別,

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/298726.html
標籤:其他
