Hadoop 的產生:
??隨著各行業進入大資料時代,大規模的資料收集,大量的資料生產速度和資料結構的多樣性,使得大資料生態快速發展,用于處理和計算大規模的資料,
??大資料的特點:
????Volume 大量
????Velocity 高速
????Variety 多樣
????Value 低價值密度
????Veracity 真實性
??使用一臺機器無法處理的資料;
??Hadoop起源于Nutch(由java語言撰寫的搜索引擎),Nutch設計為一個大型全網搜索引擎,包括網頁抓取、索引、查詢等的功能,但是隨著網頁抓取的數量增加,遇到一個嚴重的問題,如何處理十億網頁的存盤和索引問題,
??Google為解決大資料計算,于2003-2004年發布三片論文,隨后以Google的論文為思想產生了的Hadoop生態:
????GFS --> HDFS
????Map-Reduce --> MR
????BigTable --> Hbase
??Nutch的開發人員根據Google的論文思想開源實作了HDFS和MapReduce,并獨立為Hadoop專案,與2008年成為Apache的頂級專案,
Hadoop及Hadoop生態,為了解決大量資料的存盤和計算
hadoop的概念:
翻譯翻譯官方檔案:https://hadoop.apache.org
??Hadoop是為了解決大量資料的存盤和計算而設計的,由單節點的機器擴展到多節點,甚至千臺的機器,使得這些計算機都能進行本地的存盤和計算,Hadoop不依靠硬體來確保這些機器的正常運行,Hadoop通過檢測和處理這些機器來保證整個存盤和計算的可用性,所以Hadoop具備易于在廉價的機器上擴展,且保持存盤和計算的完整性的特點,
??Hadoop目前已經不只是單個組件Hadoop(HDFS、MapReduce、yarn、等)的稱呼了,Hadoop也是對整個Hadoop生態的稱呼,Hadoop生態包含了報包括Hadoop等更多的組件,例如:Hbase、Hive、Pig、Spark、Zookeeper等等,這些組件都是致力于分布式的存盤和計算,

Hadoop的組成:
??Hadoop主要由4部分組成:
????Common:Hadoop基礎功能組件
????HDFS:Hadoop Distributed File System 分布式檔案系統
????YARN:Yet Another Resources Negotiator 運算資源調度系統
????MapReduce:Map 和 Reduce 分布式運算框架
??在Hadoop2.0時,將資源調度從MapReduce抽離出來,變為 YARN;之前的1.*版本中的資源調度是集成在MapReduce中的,
??Hadoop目前有三大發行版本
????Apache:原始版本,便于入門學習
????Cloudera:CDH,Cloudera Manager,兼容性,安全性,穩定性強
????HortonWorks:HDP,(HortonWorks Data Platform)可以使用Ambari進行系統的一鍵安裝和監控,
Hadoop的發展:
??2003~2004年,Google發布的三大論文為Hadoop提供了思想;Nutch的創始人Doug Cutting實作了DFS和MapReduce;
??2005年,Hadoop作為子專案,被引入到Apache基金會,Hadoop名字來源于Doug Cutting兒子的玩具“大象”;
??2008年,Hadoop成為Apache的頂級專案,迎來快速發展時期,
??2011年11月,Hadoop發布1.0版本,標志Hadoop初具生產規模,
??2012年5月,Hadoop發布2.0.0alpha版本,將YARN剝離出來,
??2017年12月,Hadoop發布3.0版本,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/297439.html
標籤:其他
上一篇:大資料技術之大資料概論
