主頁 >  其他 > 從Hadoop1.0到Hadoop2.0架構的優化和發展探索詳解

從Hadoop1.0到Hadoop2.0架構的優化和發展探索詳解

2020-11-25 11:29:32 其他


前言

本人大三軟體工程大資料專業,在此領域本人有諸多不明確疑問,可能文章會有些許錯誤,望大家在評論區指正,本篇文章錯誤將會不斷更正維護,


提示:以下是本篇文章正文內容,下面案例可供參考

一、Hadoop1.0

Hadoop1.0即第一代Hadoop,由分布式存盤系統HDFS和分布式計算框架MapReduce組成,其中HDFS由一個NameNode和多個DateNode組成,MapReduce由一個JobTracker和多個TaskTracker組成,

1.1HDFS1.0

HDFS采用了主從(Master/Slave)結構模型,一個HDFS集群包括一個名稱節點和若干個資料節點,名稱節點作為中心服務器,負責管理檔案系統的命名空間及客戶端對檔案的訪問,其中,master主節點稱之為Namenode節點,而slave從節點稱為DataNode節點,

  • NameNode管理著整個檔案系統,負責接收用戶的操作請求
  • NameNode管理著整個檔案系統的目錄結構,所謂目錄結構類似于我們Windows作業系統的體系結構
  • NameNode管理著整個檔案系統的元資料資訊,所謂元資料資訊指定是除了資料本身之外涉及到檔案自身的相關資訊
  • NameNode保管著檔案與block塊序列之間的對應關系以及block塊與DataNode節點之間的對應關系

對于第三點名稱節點保存元資料:

(1).在磁盤上:Fslnage和EditLog

(2).在記憶體中:映射資訊,即檔案包含哪些塊,每個塊存盤在哪個資料節點

NameNodeDataNode
保存元資料存盤檔案內容
元資料保存在記憶體中檔案內容保存在磁盤
保存檔案,block,datanode之間的映射關系維護了block id到datanode本地檔案的映射關系

namenode有且只有一個,雖然可以通過SecondaryNameNode與NameNode進行資料同步備份,但是總會存在一定的延時,如果NameNode掛掉,但是如果有部份資料還沒有同步到SecondaryNameNode上,還是可能會存在著資料丟失的問題,

第二名稱節點會定期與第一名稱節點通信,

缺陷:

  • 單點故障問題:NameNode含有我們用戶存盤檔案的全部的元資料資訊,當我們的NameNode無法在記憶體中加載全部元資料資訊的時候,集群就面臨崩潰,第二名稱節點無法解決單點故障問題,
  • 不可以水平擴展,不過可以縱向擴展增加硬碟,但是不方便不靈活,單臺機器的NameNode必然有到達極限的地方,
  • 系統整體性能受限于單個名稱節點的吞吐量,
  • 單個名稱節點難以提供不同程式之間的隔離性
  • Secondaryname只有冷備份作用,

1.2MadReduce1.0

對MapReduce來說,同樣時一個主從結構,是由一個JobTracker(主)和多個TaskTracker(從)組成,

MapReduce1.0既是有一個計算框架,也是一個資源管理調度框架,

可以看得出JobTracker相當于是一個資源管理調度器,必然要面對大量的任務處理,而且出現錯誤集群必然崩潰,

各個角色的功能:

作業調度流程圖:

缺陷:

  • 存在單點故障問題,一旦Master節點壞掉即JobTracker故障,其他節點不能再作業,
  • JobTacker作業過重,如果任務多時開銷太大,
  • 容易出現記憶體溢位,分配資源只考慮MapReduce任務數,不考慮CPU、記憶體,
  • 資源劃分不合理(強制劃分為slot,包括Map slot和Reduce slot)

二、Hadoop2.0

相對于Hadoop1.0來說,2就好多,這也是毋庸置疑的,總不可能越更新越差吧,

我們來詳細了解一下2版本究極加了哪些東西,

2.1HDFS2.0

2.1.1HDFS HA

HDFS HA(High Availability)是為了解決單點故障問題而設計,

JN:JounrnalNode日志節點,在學習期間一般使用3個節點來部署JN,

ZKFC:全稱是ZooKeeper Failover Controller,這個一個單獨的行程,其數量和NN數量一樣,負責監控NN節點的健康狀態,同時向ZK發送心跳表明它還在作業和NN的狀態,如果NN掛了,就可以讓ZK馬上選舉出新的NN(其實就是讓standbyNN的狀態切換稱active),所以ZKFC是NN的一個守護行程,其一般會和其對應的NN部署在同一個節點上,

ZK:ZooKeeper,當一個activeNN掛掉以后,從standbyNN節點中選舉新的NN來充當activeNN對外提供服務,一個是部署奇數臺的,這里建議當你的集群規模是在50臺一下的時候,ZK一般部署7個節點;50~100臺時,ZK在9或者11個節點;100以上就部署11個節點以上吧,但并部署越多越好的,ZK行程越多需要計算的時間就越多,選舉的時間就越長,所以合適就好,

HA集群設定了兩個名稱節點,“活躍(Active)”和“待命(Standby)”以至于不會落入單點故障,處于活躍狀態的名稱節點負責對外處理所有客戶端的請求,而處于待命狀態的名稱節點則作為備用節點,保存了足夠多的系統元資料,當名稱節點出現故障時提供快速恢復能力,也就是說,在HDFS HA中,處于待命狀態的名稱節點提供了“熱備份”,一旦活躍名稱節點出現故障,就可以立即切換到待命名稱節點,不會影響到系統的正常對外服務,

由于待命名稱節點是活躍的“熱備份”,因此活躍名稱節點的狀態資訊必須實時同步到待命名稱節點,兩種名稱節點的狀態同步,可以借助于一個共享存盤系統來實作,比如NFS(Network File System)、QJM(Quorum Journal Manager)或者Zookeeper,活躍名稱節點將更新資料寫入到共享存盤系統,待命名稱節點會一直監聽該系統,一旦發現有新的寫入,就立即從公共存盤系統中讀取這些資料并加載到自己的記憶體中,從而保證與活躍名稱節點狀態完全同步,此外,名稱節點中保存了資料庫(block)到實際存盤位置的映射資訊,即每個資料塊是由哪個資料節點存盤的,當一個資料節點加入HDFS集群時,它會把自己所包含的資料塊串列報告給名稱節點,此后會通過“心跳”的方式定期執行這種告知操作,以確保名稱節點的塊映射是最新的,

2.1.2HDFS Federation(聯邦)

HDFS1.0采用單名稱節點的設計,還存在可擴展性、性能和隔離性等問題,而HDFS聯邦可以很好地解決上述三個方面的問題,

  • HDFS聯邦采用多個相互獨立的名稱節點,使得HDFS的命名服務能夠水平擴展,這些名稱節點分別進行各自命名空間和塊的管理,相互之間是聯邦(Federation)關系,不需要批次協調,并且向后兼容
  • HDFS聯邦中,所有名稱節點會共享底層的資料節點存盤資源,資料節點向所有名稱節點匯報
  • 屬于同一個命名空間的塊構成一個“塊池”

  • 對于聯邦中多個命名空間,可以采用客戶端掛載表(Client Side Mount Table)方式進行資料共享和訪問
  • 客戶可以訪問不同的掛載點來訪問不同的子命名空間
  • 把各個命名空間掛載到全域“掛載表”(mount-table)中,實作資料全域共享
  • 同樣的命名空間掛載到個人的掛載表中,就稱為應用程式課件的命名空間

HDFS Federation設計可以解決單名稱節點存在的以下幾個問題:

  1. HDFS集群擴展性,多個名稱節點各自分管一部分目錄,使得一個集群可以擴展到更多節點,不再像HDFS1.0中那樣由于記憶體的限制制約檔案存盤數目
  2. 性能更高效,多個名稱節點管理不同的資料,且同時對外提供服務,將為用戶提供更好的讀寫吞吐率,
  3. 良好的隔離性,用戶可根據需要將不同業務資料交由不同名稱節點管理,這樣不同業務之間影響很小,

需要注意的是,HDFS Federation并不能解決單點故障問題,也就是說,每個名稱節點都存在在單點故障問題,需要為每個名稱節點部署一個后備名稱節點,以應對名稱節點掛掉對業務產生的影響,

2.2YARN

YARN設計思路是將原JobTacker三大功能拆分

Hadoop2.0以后,MapReduce1.0中的資源管理調度功能,被單獨分離出來形成了YARN,它是一個純粹的資源管理調度框架,而不是一個計算框架,被剝離了資源管理調度功能的MapReduce就變成了MapReduce2.0,它是運行在YARN之上的一個純粹的計算框架,不再自己負責資源調度管理服務,而是由YARN為其提供資源管理調度服務,

YARN作業調度流程

2.2.1ResourceManager

  • 處理客戶端請求
  • 啟動/監控ApplicationMaster
  • 監控NodeManager
  • 資源分配與調度

ResourceManager 擁有系統所有資源分配的決定權,負責集群中所有應用程式的資源分配,擁有集群資源主要、全域視圖,因此為用戶提供公平的,基于容量的,本地化資源調度,根據程式的需求,調度優先級以及可用資源情況,動態分配特定節點運行應用程式,它與每個節點上的NodeManager和每一個應用程式的ApplicationMaster協調作業,

ResourceManager的主要職責在于調度,即在競爭的應用程式之間分配系統中的可用資源,并不關注每個應用程式的狀態管理,

ResourceManager主要有兩個組件:Scheduler和ApplicationManager:Scheduler是一個資源調度器,它主要負責協調集群中各個應用的資源分配,保障整個集群的運行效率,Scheduler的角色是一個純調度器,它只負責調度Containers,不會關心應用程式監控及其運行狀態等資訊,同樣,它也不能重啟因應用失敗或者硬體錯誤而運行失敗的任務,

調度器被設計成一個可插拔的組件,YARN不僅自身提供了許多種直接可用的調度器,也應許用戶根據自己的需求設計調度器,

容器(Container)作為動態資源分配單位,每個容器中都封裝了一定數量的CPU、記憶體、磁盤等資源,從而限定每個應用程式可以使用的資源量,

2.2.2ApplicationMaster

  • 為應用程式申請資源,并分配給內部任務
  • 任務調度、監控與容錯

ApplicationManager主要負責接收job的提交請求,為應用分配第一個Container來運行ApplicationMaster,還有就是負責監控ApplicationMaster,在遇到失敗時重啟ApplicationMaster運行的Container

2.2.3NodeManager

  • 單個節點上的資源管理
  • 處理來自ResourceManager的命令
  • 處理來自ApplicationMaster的命令

NodeManager是yarn節點的一個“作業行程”代理,管理hadoop集群中獨立的計算節點,主要負責與ResourceManager通信,負責啟動和管理應用程式的container的生命周期,監控它們的資源使用情況(cpu和記憶體),跟蹤節點的監控狀態,管理日志等,并報告給RM,

NodeManager在啟動時,NodeManager向ResourceManager注冊,然后發送心跳包來等待ResourceManager的指令,主要目的是管理resourcemanager分配給它的應用程式container,NodeManager只負責管理自身的Container,它并不知道運行在它上面應用的資訊,在運行期,通過NodeManager和ResourceManager協同作業,這些資訊會不斷被更新并保障整個集群發揮出最佳狀態


總結

Hadoop1.0主要存在以下不足:

  • 抽象層次低,需要人工編碼
  • 表達能力有限
  • 開發者自己管理作業之間的依賴關系
  • 難以看到程式整體邏輯
  • 執行迭代操作效率低
  • 資源浪費
  • 實時性差

Hadoop的優化與發展主要體現在兩個方面:

  • 一方面是Hadoop自身兩大核心組件MapReduce和HDFS的架構設計改進
  • 另一方面是Hadoop生態系統其它組件的不斷豐富,加入了Pig、Tez、Spark和Kafka等新組件

參閱:

https://www.cnblogs.com/listenfwind/p/10121817.html

https://blog.csdn.net/u012050154/article/details/52353545

https://www.cnblogs.com/51runsky/p/4572428.html

https://www.cnblogs.com/xd502djj/p/4433020.html

https://blog.csdn.net/liweihope/article/details/88888644

https://www.cnblogs.com/ilifeilong/p/10617062.html

https://blog.csdn.net/weixin_43267534/article/details/84581262

https://www.cnblogs.com/zsql/p/11636112.html

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/227503.html

標籤:其他

上一篇:Alibaba新產“Java架構核心寶典”,全是流行技術,限時開放

下一篇:作業五年,面試官說我只會CRUD!竟然只給我10K!

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 網閘典型架構簡述

    網閘架構一般分為兩種:三主機的三系統架構網閘和雙主機的2+1架構網閘。 三主機架構分別為內端機、外端機和仲裁機。三機無論從軟體和硬體上均各自獨立。首先從硬體上來看,三機都用各自獨立的主板、記憶體及存盤設備。從軟體上來看,三機有各自獨立的作業系統。這樣能達到完全的三機獨立。對于“2+1”系統,“2”分為 ......

    uj5u.com 2020-09-10 02:00:44 more
  • 如何從xshell上傳檔案到centos linux虛擬機里

    如何從xshell上傳檔案到centos linux虛擬機里及:虛擬機CentOs下執行 yum -y install lrzsz命令,出現錯誤:鏡像無法找到軟體包 前言 一、安裝lrzsz步驟 二、上傳檔案 三、遇到的問題及解決方案 總結 前言 提示:其實很簡單,往虛擬機上安裝一個上傳檔案的工具 ......

    uj5u.com 2020-09-10 02:00:47 more
  • 一、SQLMAP入門

    一、SQLMAP入門 1、判斷是否存在注入 sqlmap.py -u 網址/id=1 id=1不可缺少。當注入點后面的引數大于兩個時。需要加雙引號, sqlmap.py -u "網址/id=1&uid=1" 2、判斷文本中的請求是否存在注入 從文本中加載http請求,SQLMAP可以從一個文本檔案中 ......

    uj5u.com 2020-09-10 02:00:50 more
  • Metasploit 簡單使用教程

    metasploit 簡單使用教程 浩先生, 2020-08-28 16:18:25 分類專欄: kail 網路安全 linux 文章標簽: linux資訊安全 編輯 著作權 metasploit 使用教程 前言 一、Metasploit是什么? 二、準備作業 三、具體步驟 前言 Msfconsole ......

    uj5u.com 2020-09-10 02:00:53 more
  • 游戲逆向之驅動層與用戶層通訊

    驅動層代碼: #pragma once #include <ntifs.h> #define add_code CTL_CODE(FILE_DEVICE_UNKNOWN,0x800,METHOD_BUFFERED,FILE_ANY_ACCESS) /* 更多游戲逆向視頻www.yxfzedu.com ......

    uj5u.com 2020-09-10 02:00:56 more
  • 北斗電力時鐘(北斗授時服務器)讓網路資料更精準

    北斗電力時鐘(北斗授時服務器)讓網路資料更精準 北斗電力時鐘(北斗授時服務器)讓網路資料更精準 京準電子科技官微——ahjzsz 近幾年,資訊技術的得了快速發展,互聯網在逐漸普及,其在人們生活和生產中都得到了廣泛應用,并且取得了不錯的應用效果。計算機網路資訊在電力系統中的應用,一方面使電力系統的運行 ......

    uj5u.com 2020-09-10 02:01:03 more
  • 【CTF】CTFHub 技能樹 彩蛋 writeup

    ?碎碎念 CTFHub:https://www.ctfhub.com/ 筆者入門CTF時時剛開始刷的是bugku的舊平臺,后來才有了CTFHub。 感覺不論是網頁UI設計,還是題目質量,賽事跟蹤,工具軟體都做得很不錯。 而且因為獨到的金幣制度的確讓人有一種想去刷題賺金幣的感覺。 個人還是非常喜歡這個 ......

    uj5u.com 2020-09-10 02:04:05 more
  • 02windows基礎操作

    我學到了一下幾點 Windows系統目錄結構與滲透的作用 常見Windows的服務詳解 Windows埠詳解 常用的Windows注冊表詳解 hacker DOS命令詳解(net user / type /md /rd/ dir /cd /net use copy、批處理 等) 利用dos命令制作 ......

    uj5u.com 2020-09-10 02:04:18 more
  • 03.Linux基礎操作

    我學到了以下幾點 01Linux系統介紹02系統安裝,密碼啊破解03Linux常用命令04LAMP 01LINUX windows: win03 8 12 16 19 配置不繁瑣 Linux:redhat,centos(紅帽社區版),Ubuntu server,suse unix:金融機構,證券,銀 ......

    uj5u.com 2020-09-10 02:04:30 more
  • 05HTML

    01HTML介紹 02頭部標簽講解03基礎標簽講解04表單標簽講解 HTML前段語言 js1.了解代碼2.根據代碼 懂得挖掘漏洞 (POST注入/XSS漏洞上傳)3.黑帽seo 白帽seo 客戶網站被黑帽植入劫持代碼如何處理4.熟悉html表單 <html><head><title>TDK標題,描述 ......

    uj5u.com 2020-09-10 02:04:36 more
最新发布
  • 2023年最新微信小程式抓包教程

    01 開門見山 隔一個月發一篇文章,不過分。 首先回顧一下《微信系結手機號資料庫被脫庫事件》,我也是第一時間得知了這個訊息,然后跟蹤了整件事情的經過。下面是這起事件的相關截圖以及近日流出的一萬條資料樣本: 個人認為這件事也沒什么,還不如關注一下之前45億快遞資料查詢渠道疑似在近日復活的訊息。 訊息是 ......

    uj5u.com 2023-04-20 08:48:24 more
  • web3 產品介紹:metamask 錢包 使用最多的瀏覽器插件錢包

    Metamask錢包是一種基于區塊鏈技術的數字貨幣錢包,它允許用戶在安全、便捷的環境下管理自己的加密資產。Metamask錢包是以太坊生態系統中最流行的錢包之一,它具有易于使用、安全性高和功能強大等優點。 本文將詳細介紹Metamask錢包的功能和使用方法。 一、 Metamask錢包的功能 數字資 ......

    uj5u.com 2023-04-20 08:47:46 more
  • vulnhub_Earth

    前言 靶機地址->>>vulnhub_Earth 攻擊機ip:192.168.20.121 靶機ip:192.168.20.122 參考文章 https://www.cnblogs.com/Jing-X/archive/2022/04/03/16097695.html https://www.cnb ......

    uj5u.com 2023-04-20 07:46:20 more
  • 從4k到42k,軟體測驗工程師的漲薪史,給我看哭了

    清明節一過,盲猜大家已經無心上班,在數著日子準備過五一,但一想到銀行卡里的余額……瞬間心情就不美麗了。最近,2023年高校畢業生就業調查顯示,本科畢業月平均起薪為5825元。調查一出,便有很多同學表示自己又被平均了。看著這一資料,不免讓人想到前不久中國青年報的一項調查:近六成大學生認為畢業10年內會 ......

    uj5u.com 2023-04-20 07:44:00 more
  • 最新版本 Stable Diffusion 開源 AI 繪畫工具之中文自動提詞篇

    🎈 標簽生成器 由于輸入正向提示詞 prompt 和反向提示詞 negative prompt 都是使用英文,所以對學習母語的我們非常不友好 使用網址:https://tinygeeker.github.io/p/ai-prompt-generator 這個網址是為了讓大家在使用 AI 繪畫的時候 ......

    uj5u.com 2023-04-20 07:43:36 more
  • 漫談前端自動化測驗演進之路及測驗工具分析

    隨著前端技術的不斷發展和應用程式的日益復雜,前端自動化測驗也在不斷演進。隨著 Web 應用程式變得越來越復雜,自動化測驗的需求也越來越高。如今,自動化測驗已經成為 Web 應用程式開發程序中不可或缺的一部分,它們可以幫助開發人員更快地發現和修復錯誤,提高應用程式的性能和可靠性。 ......

    uj5u.com 2023-04-20 07:43:16 more
  • CANN開發實踐:4個DVPP記憶體問題的典型案例解讀

    摘要:由于DVPP媒體資料處理功能對存放輸入、輸出資料的記憶體有更高的要求(例如,記憶體首地址128位元組對齊),因此需呼叫專用的記憶體申請介面,那么本期就分享幾個關于DVPP記憶體問題的典型案例,并給出原因分析及解決方法。 本文分享自華為云社區《FAQ_DVPP記憶體問題案例》,作者:昇騰CANN。 DVPP ......

    uj5u.com 2023-04-20 07:43:03 more
  • msf學習

    msf學習 以kali自帶的msf為例 一、msf核心模塊與功能 msf模塊都放在/usr/share/metasploit-framework/modules目錄下 1、auxiliary 輔助模塊,輔助滲透(埠掃描、登錄密碼爆破、漏洞驗證等) 2、encoders 編碼器模塊,主要包含各種編碼 ......

    uj5u.com 2023-04-20 07:42:59 more
  • Halcon軟體安裝與界面簡介

    1. 下載Halcon17版本到到本地 2. 雙擊安裝包后 3. 步驟如下 1.2 Halcon軟體安裝 界面分為四大塊 1. Halcon的五個助手 1) 影像采集助手:與相機連接,設定相機引數,采集影像 2) 標定助手:九點標定或是其它的標定,生成標定檔案及內參外參,可以將像素單位轉換為長度單位 ......

    uj5u.com 2023-04-20 07:42:17 more
  • 在MacOS下使用Unity3D開發游戲

    第一次發博客,先發一下我的游戲開發環境吧。 去年2月份買了一臺MacBookPro2021 M1pro(以下簡稱mbp),這一年來一直在用mbp開發游戲。我大致分享一下我的開發工具以及使用體驗。 1、Unity 官網鏈接: https://unity.cn/releases 我一般使用的Apple ......

    uj5u.com 2023-04-20 07:40:19 more