HDInsight Linux 在中國區正式上線,對于很多 Azure 上的大資料用戶來說,是一件喜大普奔的事情:)除了底層虛擬機是 Linux ,更加符合用戶的使用習慣以外,還增加了很多令人興奮的新特性,例如 R Server , Spark 以及 Kafka 的支持,版本的更新,完整的監控等等,本文主要從以下幾個方面來介紹 Spark 在 HDInsight Linux 上的創建,配置和開發:
第一部分:
為什么使用 Spark
HDInsight Linux 簡介
創建配置 Spark on HDInsight
第二部分:
HDInsight 的監控和管理
Spark 集群使用及應用開發部署
第三部分
利用 Spark 進行機器學習
Spark 集群上的第三方應用
Spark 簡介
一說到大資料分析,我們直接的反應就是 Hadoop 集群, MapReduce , HDFS 等等以及相關的生態系統,然而我們現在談大資料,并不僅僅是海量資料的處理,同時也包括機器學習,流式分析,資料挖掘,圖形計算……這也正是 Spark 作為一個基于記憶體的分布式并行大資料處理框架越來越火的原因之一,相對于傳統的 MapReduce , Spark 具有以下優點:
高性能:相對于傳統的 MapReduce ,基于磁盤的運算方式來講, Spark 是一個基于記憶體的分布式運算框架,并且由于 RDD 和 Cache 的使用,資料的交換基于記憶體,大幅度提升了性能,在不同的場景下,比 MapReduce 快10倍到100倍不等。
易于使用: 支持 Java,Python,R, Scala 開發語言,并且目前 Spark 提供超過 80 多種抽象的資料轉換操作,讓你可以快速構建并行處理程式。
生態系統:Spark 目前已經構建出了完善而成熟的生態系統,內建對于 HDFS, RDBMS, S3, Apache Hive, Cassandra and MongoDB, Azure Storage 等資料源的良好支持。
統一引擎:從下圖你可以看到, Spark SQL,Spark Streaming, Spark MLLib 以及 Graphx 均基于 Spark 核心引擎,也就意味著在一個平臺可以統一支持多種不同的應用,相對于 Hadoop 的碎片化的組建生態,對開發人員來講簡單很多也高效很多
多調度器支持:雖然 Spark 底層的資料存盤依然依賴于 HDFS,然而對于資源調度來說,Spark 可以使用 YARN,也可以使用 Mesos 甚至是獨立的調度器,部署非常靈活,尤其是在容器技術大行其道的時候,你可以在容器上跑 Spark ,用 Mesos 來統一管理
什么是 HDInsight
HDInsight 是微軟推出的基于云端的 Hadoop 大資料處理平臺,支持 Storm,Spark,HBase,R Server, Kafka,Interactive Hive(LLAP) 等多種不同的大資料框架,HDInsight Linux 顧名思義就是底層的頭結點和資料節點都是基于 Linux 的,目前是 Ubuntu 16.04 LTS 。本身來講 HDInsight 是基于大資料三大巨頭之一的 Hortonworks 公司的 Hortonworks Data Platform (HDP) 來構建的,并針對企業級用戶在云端使用的需求,增強了管理和安全多方面的功能。
如果你之前在自己的資料中心,在云端使用 HDInsight 可以為企業帶來諸多好處,例如:
易于使用,部署方便:對于 HDInsight 的集群部署來說,你不需要了解復雜的底層細節,頭結點,資料節點的配置,不同的組件等等,在 Azure 的管理界面,經過幾個簡單的點擊,幾分鐘的時間,一個 16 節點的集群就創建成功了
按需付費:你不需要為了你的企業運行大資料,一次采購大量的硬體,并且業務閑時機器閑置,浪費資源,你只需要在需要計算的時候,創建集群,運算完畢就可以洗掉該集群, Azure 只按照使用量來計費,由于計算和存盤分離的特性,你的資料庫會保存在 Azure 存盤上,每個月只需要少量存盤的錢
彈性擴展:你可以根據你的也無需要,在界面上擴展或者伸縮節點數目,滿足你的業務的彈性要求
豐富的服務和版本選擇:HDInsight 提供各個不同版本的 HBase,Hadoop,Spark,Storm,Hive,Pig,R, Kafka 等等生態系統組件,而且自動安裝配置,滿足你不同的業務需求
開源 100% 兼容:HDInsight 基于HDP 構建,與開源 Hadoop完全兼容,這就意味著你已有的大資料方案,可以快速的遷移到云
端而不需要或者輕微的改動(例如資料的存盤位置)就可以使用
資料持久化:從以下架構可以看出,HDInsight 的 HDFS 基于 Azure Storage 實作,意味著你存盤的每一分資料,都會默認存盤完全相同的三份,對于企業來說,資料安全就是核心,Azure 的存盤高可用性,保證了在任何情況下的資料可靠性
創建 HDInsight Linux for Spark
從下圖可以看到,創建 HDInsight 的簡單步驟,你可以先創建一個存盤賬號,用于存盤 Spark 要處理的資料,也可以在創建集群時一起創建,然后創建集群,完成后使用 Spark SQL 進行資料處理,在部署方式上,你可以使用 ARM 模板部署, Powershell 部署或者 Linux/Mac 下使用 Azure CLI 部署,本例中使用 Azure 管理界面進行部署。
1. 打開 Azure 新 portal,https://portal.azure.cn, 選擇新建,Intelligence + Analytics , 就可以看到 HDInsight 圖示,單擊進行創建:

2. 給你的 cluster 起一個名字,在本例中叫 hdispark,配置集群,在集群型別中,可以看到我們可以選擇 Hadoop,HBase,Storm,Spark,R server 等等,我們選擇 Spark ,作業系統目前型別只支持 Linux,版本選擇 Spark2.0,其對應的 HDP 是 3.5 版本:

3. 在應用程式選項部分,你可以看到 HDInsight Spark 自帶了一些第三方的,基于 Spark 的工具集和庫,你可以根據需要選擇使用,我們暫時忽略掉該部分,在下一章中詳細介紹:

4. 在憑據部分,第一個用戶名和密碼是你后面需要訪問 Ambari 儀表板需要的用戶名密碼,第二個用戶名密碼是你使用 SSH 進行遠程登錄的用戶名密碼,按照你的習慣進行設定,但這些用戶名和密碼必須記住,旺季后無法恢復,后面會使用到:

5. 資料源的部分,需要配置你的資料存盤在什么地方,目前 Data Lake 中國暫時不支持,所以我們只使用 Azure 存盤,配置你的資料處理存盤在哪個賬號里,如果是第一次創建,可以選擇創建新建存盤的賬號,指定名稱即可,或者你也可以使用你已經創建的存盤賬號:

注:如果你想洗掉 Spark 計算集群后,依然保存 Hive 和 Oozie 的資料,你需要提前創建一個 SQL 資料庫用來保存資料:
6. 在 Spark 集群中,默認需要兩個頭結點,你可以指定多個作業節點,在群集大小中,需要選擇合適的節點大小,和資料節點的個數,這部分的選擇關系到你有多大的資料量,需要多長時間完成,并且關系到成本,需要提前做規劃,選擇完成后,選擇確定:

7. 在高級特性配置中,你可以選擇配置 vNet,即將 Spark 集群部署到你的虛擬網路里面,這樣虛擬網路的虛擬機可以直接訪問集群;也可以自定義腳本,在集群部署完
成后再額外部署新的包或者執行安裝后的操作;點擊確定開始創建:

8. 創建完成后,你就可以看到 Spark 集群的儀表板界面,就可以看到儀表板界面,包括集群儀表板,Ambari ,SSH 登錄資訊,節點資訊,在本例中一共有 4 個節點,2 個頭節點,2 個作業節點:

由于篇幅的關系,我們將在下一節中介紹如何對 Spark 集群進行監控,管理以及 Spark 上的應用開發和部署。感興趣的朋友,也可通過點擊這里自行了解。
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/58901.html
標籤:Spark
