Hadoop生態系統還包括Zookeeper,HBase,Hive,Pig,Mahout,Flume,Sqoop,Ambari等功能組件,
- 4.Hive
Hive是一個基于Hadoop的資料倉庫工具,用于對Hadoop檔案中的資料進行資料整理,特殊查詢和分析存盤,
它提供了類似于資料庫SQL的查詢語言——Hive QL,其陳述句可以快速實作簡單的MapReduce任務,hive自身可以將HiveQL陳述句轉換為mapReduce任務運行,不必開發專門的MapReduce應用
- 5.Pig
pig是一種資料流語言和運行環境適合于使用Hadoop和MapReduve平臺來查詢大型半結構化資料集,
pig的出現,大大簡化了Hadoop常見的作業任務,在Map Reduce的基礎上創建了更簡單抽象的程序語言,為Hadoop應用程式,提供了一種更加接近結構查詢語言的介面,
pig是一種相對簡單的語言,可以執行陳述句,從大型資料集中搜索某個滿足給定搜索條件的記錄時,pig要不mapreduce具有明顯的優勢,前者只需要撰寫一個簡單的腳本在集群中自動并行處理與分發,后者則需要撰寫一個單獨的Map Reduce應用程式,
- 6.Mahout
Mahout,提供一些可擴展的機器學習領域經典演算法的實作,幫助開發人員方便快捷的創建智能應用專案,
其包含許多實作,:聚類,分類,推薦過濾,頻繁子挖掘等,
用過使用Apache Hadoop庫,可以有效的擴展到云中,
- 7.ZooKeeper
zookeeper是針對谷歌Chubby的一個開源實作,高效和可靠的協同作業系統,提供分布式鎖之類的基本服務(如統一命名服務,狀態同步服務,集群管理,分布式應用配置置頂的管理等)
用于構建分布式應用,減輕分布式應用程式所承擔的協調任務,
- 8.Flume
Flume是Cloudera提供的一個高可用的,高可靠的,分布式的海量日志采集,聚合和傳輸的系統
Flume支持在日志系統中定制各類資料發送方,用于收集資料;同時,提供對資料進行簡單處理并寫到各種資料接收方的能力
- 9.Sqoop
Sqoop是SQL-to-Hadoop的縮寫,主要用來HAdoop和關系資料庫之間的交換資料,可以改進資料的互操作性,
通過Sqoop可以方便的將資料從MySQL,Oracle,PostgreSQL等關系資料庫中匯入Hadoop(可匯入HDFS,Hbase或Hive),或者將資料從Hadoop匯出關系資料庫,使傳統資料庫和Hadoop之間的資料遷移變得非常方便,
Sqoop是專門為大資料集設計的,支持增量更新,可以將新記錄添加到最近一次匯出的資料源上,或者指定上次修改的時間戳,
- 10.Ambari
Apache Ambari是一種基于web的工具,支持Apache Hadoop集群的安裝,部署,配置和管理,其目前支持大多數Hadoop組件

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/438662.html
標籤:其他
