消費者是品牌最重要的資產,如何能夠更好地留存消費者是企業制勝的關鍵。以阿里為代表的平臺也提出了要從“流量運營”向“消費者運營”的轉型。在資訊技術發展日新月異的今天,各大企業與平臺紛紛建立了自己的大資料平臺,累積了海量的資料,如何利用這些資料來洞察消費者,做好消費者運營,成為企業必修的一個課題。本文將 ......
2020-09-11 more結合其他同學和自己的筆記總結如下 什么是hive? 基于Hadoop的開源的資料倉庫工具,用于處理海量結構化資料。 Hive把HDFS中結構化的資料映射成表。 Hive通過把HiveSQL進行決議和轉換,最終生成一系列在hadoop上運行的mapreduce任務,通過執行這些任務完成資料分析與處理。 ......
2020-09-11 more在本地搭建好偽分布式環境,打開虛擬機進入linux系統,如果是在root用戶下則需要切換至Hadoop用戶 su - hadoop 按需輸入hadoop密碼 在hadoop家目錄下啟動Hadoop集群 start-all.sh 查看行程,檢查是否正常啟動 jps 進入Hive安裝目錄 (具體目錄可能 ......
2020-09-11 morepyetl是一個純python開發的ETL框架, 相比sqoop, datax 之類的ETL工具,pyetl可以對每個欄位添加udf函式,使得資料轉換程序更加靈活,相比專業ETL工具pyetl更輕量,純python代碼操作,更加符合開發人員習慣 安裝 pip3 install pyetl 使用示例 ......
2020-09-11 more打開虛擬機進入linux系統 進入Hadoop目錄下 多用tab鍵 它可以自動補齊命令 1. 啟動Hadoop集群 start-all.sh 等價于 start-dfs.sh 和 start-yarn.sh 2. 關閉Hadoop集群 stop-all.sh 3. 查看啟動的服務行程 jps 4. ......
2020-09-11 more什么叫大資料,“大”,說的并不僅是資料的“多”!不能用資料到了多少TB ,多少PB 來說。 對于大資料,可以用四個詞來表示:大量,多樣,實時,不確定。 也就是資料的量龐大,資料的種類繁雜多樣話,資料的變化飛快,資料的真偽存疑。 大量:這個大家都知道,想百度,淘寶,騰訊,Facebook,Twitte ......
2020-09-11 moreElasticSearch目前最新版是7.7.0,其中部署的細節和之前的6.x有很多的不同,所以這里單獨拉出來寫一下,希望對用7.x的童鞋有一些幫助,然后部署完ES后配套的kibana也是7.7.0,這個就簡單了放到最后說,下面先進入ES 7.7.0的部署. 首先是下載es的安裝包,官網下載即可,我 ......
2020-09-11 more由于作業的需求,后續筆者作業需要和開源的OLAP資料庫ClickHouse打交道。ClickHouse是Yandex在2016年6月15日開源了一個分析型資料庫,以強悍的單機處理能力被稱道。 筆者在實際測驗ClickHouse和閱讀ClickHouse的原始碼程序之中,對"戰斗民族"開發的資料庫十分欣 ......
2020-09-11 more? 本章我們開始正式搭建大資料環境,目標是構建一個穩定的可以運維監控的大資料環境。我們將采用Ambari搭建底層的Hadoop環境,使用原生的方式搭建Flink,Druid,Superset等實時計算環境。使用大資料構建工具與原生安裝相結合的方式,共同完成大資料環境的安裝。 Ambari搭建底層大數 ......
2020-09-11 more本文來源于公眾號【胖滾豬學編程】,轉載請注明出處。 從今天開始,想和你一起死磕ElasticSearch,學習分布式搜索引擎,跟著胖滾豬就對了! 既然是ES的第一課,那么最重要的是讓你愛上它!不想說那些單純的優勢、概念了,直接上大廠的生產案例,才是最能吸引你的!跟著大廠走,沒問題的! 為啥選擇ES? ......
2020-09-11 more**?桔妹導讀:**GPU虛擬機實體創建速度慢是公有云面臨的普遍問題,由于通常情況下創建虛擬機屬于低頻操作而未引起業界的重視,實際生產中還是存在對GPU實體創建時間有苛刻要求的業務場景。本文將介紹滴滴云在解決該問題時的思路、方法、并展示最終的優化成果。 從公有云服務商那里購買過虛擬主機的資深用戶,一 ......
uj5u.com 2020-09-10 06:09:13 more**?桔妹導讀:**隨著云規模不斷擴大以及業務層面對延遲、帶寬的要求越來越高,采用DPDK 加速網路報文處理的方式在橫向縱向擴展都出現了局限性。可編程芯片成為業界熱點。本文主要講述了可編程網卡芯片在滴滴云網路中的應用實踐,遇到的問題、帶來的收益以及開源社區貢獻。 #1. 資料中心面臨的問題 隨著滴滴 ......
uj5u.com 2020-09-10 06:10:21 more**?桔妹導讀:**滴滴資料通道引擎承載著全公司的資料同步,為下游實時和離線場景提供了必不可少的源資料。隨著任務量的不斷增加,資料通道的整體架構也隨之發生改變。本文介紹了滴滴資料通道的發展歷程,遇到的問題以及今后的規劃。 #1. 背景 資料,對于任何一家互聯網公司來說都是非常重要的資產,公司的大資料 ......
uj5u.com 2020-09-10 06:11:05 more**桔妹導讀:**深耕人工智能領域,致力于探索AI讓出行更美好的滴滴AI Labs再次斬獲國際大獎,這次獲獎的專案是什么呢?一起來看看詳細報道吧! 近日,由國際計算語言學協會ACL(The Association for Computational Linguistics)舉辦的世界最具影響力的機器 ......
uj5u.com 2020-09-10 06:11:29 more1、什么是mpp? MPP (Massively Parallel Processing),即大規模并行處理,在資料庫非共享集群中,每個節點都有獨立的磁盤存盤系統和記憶體系統,業務資料根據資料庫模型和應用特點劃分到各個節點上,每臺資料節點通過專用網路或者商業通用網路互相連接,彼此協同計算,作為整體提供 ......
uj5u.com 2020-09-10 06:11:41 more**桔妹導讀:**指標體系是什么?如何使用OSM模型和AARRR模型搭建指標體系?如何統一流程、規范化、工具化管理指標體系?本文會對建設的方法論結合滴滴資料指標體系建設實踐進行解答分析。 #1. 什么是指標體系 ##1.1 指標體系定義 指標體系是將零散單點的具有相互聯系的指標,系統化的組織起來,通 ......
uj5u.com 2020-09-10 06:12:52 more我們經常在資料庫中使用 LIKE 運算子來完成對資料的模糊搜索,LIKE 運算子用于在 WHERE 子句中搜索列中的指定模式。 如果需要查找客戶表中所有姓氏是“張”的資料,可以使用下面的 SQL 陳述句: SELECT * FROM Customer WHERE Name LIKE '張%' 如果需要 ......
uj5u.com 2020-09-10 06:13:25 more**桔妹導讀:**Ceph是國際知名的開源分布式存盤系統,在工業界和學術界都有著重要的影響。Ceph的架構和演算法設計發表在國際系統領域頂級會議OSDI、SOSP、SC等上。Ceph社區得到Red Hat、SUSE、Intel等大公司的大力支持。Ceph是國際云計算領域應用最廣泛的開源分布式存盤系統, ......
uj5u.com 2020-09-10 06:14:51 more之前寫過《es~通過ElasticsearchTemplate進行聚合操作》的文章,這一次主要寫一個嵌套的聚合,例如先對sex集合,再對desc聚合,最后再對age求和,共三層嵌套。 Aggregations的部分特性類似于SQL語言中的group by,avg,sum等函式,Aggregation ......
uj5u.com 2020-09-10 06:14:59 more傻瓜式部署,只需替換IP與用戶 導讀: 現ELK四大組件分別為:Elasticsearch(核心)、logstash(處理)、filebeat(采集)、kibana(可視化) 下載均在https://www.elastic.co/cn/downloads/下tar包,各組件版本最好一致,配合fdm會 ......
uj5u.com 2020-09-10 06:15:05 moreMysql復習的一個小總結,用xmind寫的。(字數沒有都不給我發博客😹) 下面是一些備注 子查詢 MySQL子查詢稱為內部查詢,而包含子查詢的查詢稱為外部查詢。 子查詢可以在使用運算式的任何地方使用,并且必須在括號中關閉。 視圖 基本語法可以使用 CREATE VIEW 陳述句來創建視圖。 語法格 ......
uj5u.com 2022-05-09 07:13:07 more?大資料概述 在大資料這個概念興起之前,資訊系統存盤資料的方法主要是我們熟知的關系型資料庫,關系型資料庫,關系型模型之父 Edgar F. Codd,在 1970 年 Communications of ACM 上發表了《大型共享資料庫資料的關系模型》的經典論文,從此之后關系模型的語意設計達到了 4 ......
uj5u.com 2022-05-09 07:13:01 more一、下載安裝IDEA IDEA2020.2.3版本:https://www.cnblogs.com/liugp/p/13868346.html 最新版本安裝詳情請參考:https://www.jb51.net/article/196349.htm 二、搭建本地hadoop環境(window10) 可 ......
uj5u.com 2022-05-09 07:12:17 moreMySQL8新增降序索引 桃花塢里桃花庵,桃花庵里桃花仙。桃花仙人種桃樹,又摘桃花賣酒錢。 一、MySQL5.7 降序索引 MySQL在語法上很早就已經支持降序索引,但實際上創建的卻仍然是升序索引,如下MySQL 5.7 所示,row2欄位降序,但是從show create table看 row2 ......
uj5u.com 2022-05-09 07:11:36 moreLinux環境下,MySQL的主要目錄及其作用、資料庫和資料表在檔案系統上的存盤結構。 ......
uj5u.com 2022-05-09 07:11:28 moreMysql復習的一個小總結,用xmind寫的。(字數沒有都不給我發博客😹) 下面是一些備注 子查詢 MySQL子查詢稱為內部查詢,而包含子查詢的查詢稱為外部查詢。 子查詢可以在使用運算式的任何地方使用,并且必須在括號中關閉。 視圖 基本語法可以使用 CREATE VIEW 陳述句來創建視圖。 語法格 ......
uj5u.com 2022-05-09 07:10:34 moreMySQL8新增降序索引 桃花塢里桃花庵,桃花庵里桃花仙。桃花仙人種桃樹,又摘桃花賣酒錢。 一、MySQL5.7 降序索引 MySQL在語法上很早就已經支持降序索引,但實際上創建的卻仍然是升序索引,如下MySQL 5.7 所示,row2欄位降序,但是從show create table看 row2 ......
uj5u.com 2022-05-09 07:10:25 moreLinux環境下,MySQL的主要目錄及其作用、資料庫和資料表在檔案系統上的存盤結構。 ......
uj5u.com 2022-05-09 07:10:19 more?大資料概述 在大資料這個概念興起之前,資訊系統存盤資料的方法主要是我們熟知的關系型資料庫,關系型資料庫,關系型模型之父 Edgar F. Codd,在 1970 年 Communications of ACM 上發表了《大型共享資料庫資料的關系模型》的經典論文,從此之后關系模型的語意設計達到了 4 ......
uj5u.com 2022-05-09 07:10:05 more一、下載安裝IDEA IDEA2020.2.3版本:https://www.cnblogs.com/liugp/p/13868346.html 最新版本安裝詳情請參考:https://www.jb51.net/article/196349.htm 二、搭建本地hadoop環境(window10) 可 ......
uj5u.com 2022-05-09 07:09:25 more