主頁 >  其他 > 編譯器優化丨Cache優化

編譯器優化丨Cache優化

2022-12-03 07:07:13 其他

摘要:本文重點介紹幾種通過優化Cache使用提高程式性能的方法,

本文分享自華為云社區《編譯器優化那些事兒(7):Cache優化》,作者:畢昇小助手,

引言

軟體開發人員往往期望計算機硬體擁有無限容量、零訪問延遲、無限帶寬以及便宜的記憶體,但是現實卻是記憶體容量越大,相應的訪問時間越長;記憶體訪問速度越快,價格也更貴;帶寬越大,價格越貴,為了解決大容量、高速度、低成本之間的矛盾,基于程式訪問的區域性原理,將更常用資料放在小容量的高速存盤器中,多種速度不同的存盤器分層級聯,協調作業,

圖1 memory hierarchy for sever [1]

現代計算機的存盤層次可以分幾層,如圖1所示,位于處理器內部的是暫存器;稍遠一點的是一級Cache,一級Cache一般能夠保存64k位元組,訪問它大約需要1ns,同時一級Cache通常劃分為指令Cache(處理器從指令Cache中取要執行的指令)和資料Cache(處理器從資料Cache中存/取指令的運算元);然后是二級Cache,通常既保存指令又保存資料,容量大約256k,訪問它大約需要3-10ns;然后是三級Cache,容量大約16-64MB,訪問它大約需要10-20ns;再接著是主存、硬碟等,注意,CPU和Cache是以word傳輸的,Cache到主存以塊(一般64byte)傳輸的,

前文提到了程式的區域性原理,一般指的是時間區域性(在一定時間內,程式可能會多次訪問同一記憶體空間)和空間區域性(在一定時間內,程式可能會訪問附近的記憶體空間),高速快取(Cache)的效率取決于程式的空間和時間的區域性性質,比如一個程式重復地執行一個回圈,在理想情況下,回圈的第一個迭代將代碼取至高速快取中,后續的迭代直接從高速快取中取資料,而不需要重新從主存裝載,因此,為了使程式獲得更好的性能,應盡可能讓資料訪問發生在高速快取中,但是如果資料訪問在高速快取時發生了沖突,也可能會導致性能下降,

篇幅原因,本文重點討論編譯器在Cache優化中可以做哪些作業,如果讀者對其他記憶體層次優化感興趣,歡迎留言,下面將介紹幾種通過優化Cache使用提高程式性能的方法,

對齊和布局

現代編譯器可以通過調整代碼和資料的布局方式,提高Cache命中率,進而提升程式性能,本節主要討論資料和指令的對齊、代碼布局對程式性能的影響,大部分處理器中Cache到主存是以Cache line(一般為64Byte,也有地方稱Cache塊,本文統一使用Cache line)傳輸的,CPU從記憶體加載資料是一次一個Cache line,CPU往記憶體寫資料也是一次一個Cache line,假設處理器首次訪問資料物件A,其大小剛好為64Byte,如果資料物件A首地址并沒有進行對齊,即資料物件A占用兩個不同Cache line的一部分,此時處理器訪問該資料物件時需要兩次記憶體訪問,效率低,但是如果資料物件A進行了記憶體對齊,即剛好在一個Cache line中,那么處理器訪問該資料時只需要一次記憶體訪問,效率會高很多,編譯器可以通過合理安排資料物件,避免不必要地將它們跨越在多個Cache line中,盡量使得同一物件集中在一個Cache中,進而有效地使用Cache來提高程式的性能,通過順序分配物件,即如果下一個物件不能放入當前Cache line的剩余部分,則跳過這些剩余的部分,從下一個Cache line的開始處分配物件,或者將大小(size)相同的物件分配在同一個存盤區,所有物件都對齊在size的倍數邊界上等方式達到上述目的,

Cache line對齊可能會導致存盤資源的浪費,如圖2所示,但是執行速度可能會因此得到改善,對齊不僅僅可以作用于全域靜態資料,也可以作用于堆上分配的資料,對于全域資料,編譯器可以通過匯編語言的對齊指令命令來通知聯結器,對于堆上分配的資料,將物件放置在Cache line的邊界或者最小化物件跨Cache line的次數的作業不是由編譯器來完成的,而是由runtime中的存盤分配器來完成的[2],

圖2 因塊對齊可能會浪費存盤空間

前文提到了資料物件對齊,可以提高程式性能,指令Cache的對齊,也可以提高程式性能,同時,代碼布局也會影響程式的性能,將頻繁執行的基本塊的首地址對齊在Cache line的大小倍數邊界上能增加在指令Cache中同時容納的基本塊數目,將不頻繁執行的指令和頻繁指令的指令放到不同的Cache line中,通過優化代碼布局來提升程式性能,

利用硬體輔助

Cache預取是將記憶體中的指令和資料提前存放至Cache中,達到加快處理器執行速度的目的,Cache預取可以通過硬體或者軟體實作,硬體預取是通過處理器中專門的硬體單元實作的,該單元通過跟蹤記憶體訪問指令資料地址的變化規律來預測將會被訪問到的記憶體地址,并提前從主存中讀取這些資料到Cache;軟體預取是在程式中顯示地插入預取指令,以非阻塞的方式讓處理器從記憶體中讀取指定地址資料至Cache,由于硬體預取器通常無法正常動態關閉,因此大部分情況下軟體預取和硬體預取是并存的,軟體預取必須盡力配合硬體預取以取得更優的效果,本文假設硬體預取器被關閉后,討論如何利用軟體預取達到性能提升的效果,

預取指令prefech(x)只是一種提示,告知硬體開始將地址x中的資料從主存中讀取到Cache中,它并不會引起處理停頓,但若硬體發現會產生例外,則會忽略這個預取操作,如果prefech(x)成功,則意味著下一次取x將命中Cache;不成功的預取操作可能會導致下次讀取時發生Cache miss,但不會影響程式的正確性[2],

資料預取是如何改成程式性能的呢?如下一段程式:

double a[n];
for (int i = 0; i < 100; i++)
 a[i] = 0;

假設一個Cache line可以存放兩個double元素,當第一次訪問a[0]時,由于a[0]不在Cache中,會發生一次Cache miss,需要從主存中將其加載至Cache中,由于一個Cache line可以存放兩個double元素,當訪問a[1]時則不會發生Cache miss,依次類推,訪問a[2]時會發生Cache miss,訪問a[3]時不會發生Cache miss,我們很容易得到程式總共發生了50次Cache miss,

我們可以通過軟體預取等相關優化,降低Cache miss次數,提高程式性能,首先介紹一個公式[3]:

上述公式中L是memory latency,S是執行一次回圈迭代最短的時間,iterationAhead表示的是回圈需要經過執行幾次迭代,預取的資料才會到達Cache,假設我們的硬體架構計算出來的iterationAhead=6,那么原程式可以優化成如下程式:

double a[n];
for (int i = 0; i < 12; i+=2)   //prologue 
 prefetch(&a[i]);
for (int i = 0; i < 88; i+=2) { // steady state
 prefetch(&a[i+12]);
 a[i] = 0;
 a[i+1] = 0;
}
for (int i = 88; i < 100; i++) //epilogue
 a[i] = 0;

由于我們的硬體架構需要回圈執行6次后,預取的資料才會到達Cache,一個Cache line可以存放兩個double元素,為了避免浪費prefetch指令,所以prologue和steady state回圈都展開了,即執行prefetch(&a[0])后會將a[0]、a[1]從主存加載至Cache中,下次執行預取時就無需再次將a[1]從主存加載至Cache了,prologue回圈先執行陣列a的前12個元素的預取指令,等到執行steady state回圈時,當i = 0時,a[0]和a[1]已經被加載至Cache中,就不會發生Cache miss了,依次類推,經過上述優化后,在不改變語意的基礎上,通過使用預取指令,程式的Cache miss次數從50下降至0,程式的性能將會得到很大提升,

注意,預取并不能減少從主存盤器取資料到高速快取的延遲,只是通過預取與計算重疊而隱藏這種延遲,總之,當處理器有預取指令或者有能夠用作預取的非阻塞的讀取指令時,對于處理器不能動態重排指令或者動態重排緩沖區小于我們希望隱藏的具體Cache延遲,并且所考慮的資料大于Cache或者是不能夠判斷資料是否已在Cache中,預取是適用的,預取也不是萬能,不當的預取可能會導致高速快取沖突,程式性能降低,我們應該首先利用資料重用來減少延遲,然后才考慮預取,

除了軟體預取外,ARMv8還提供了Non-temporal的Load/Store指令,可以提高Cache的利用率,對于一些資料,如果只是訪問一次,無需占用Cache,可以使用這個指令進行訪問,從而保護Cache中關鍵資料不被替換,比如memcpy大資料的場景下,使用該指令對于其關鍵業務而言,是有一定的收益的,

回圈變換

重用Cache中的資料是最基本的高效使用Cache方法,對于多層嵌套回圈,可以通過交換兩個嵌套的回圈(loop interchange)、逆轉回圈迭代執行的順序(loop reversal)、將兩個回圈體合并成一個回圈體(loop fusion)、回圈拆分(loop distribution)、回圈分塊(loop tiling)、loop unroll and jam等回圈變換操作,選擇適當的回圈變換方式,既能保持程式的語意,又能改善程式性能,我們做這些回圈變換的主要目的是為了實作暫存器、資料高速快取以及其他存盤層次使用方面的優化,

篇幅受限,本節僅討論回圈分塊(loop tiling)如何改善程式性能,若對loop interchange感興趣,請點擊查閱,下面這個簡單的回圈:

for(int i = 0; i < m; i++) {
 for(int j = 0; j < n; j++) {
 x = x+a[i]+c*b[j];
 }
}

我們假設陣列a、b都是超大陣列,m、n相等且都很大,程式不會出現陣列越界訪問情況發生,那么如果b[j]在j層回圈中跨度太大時,那么被下次i層回圈重用時資料已經被清出高速快取,即程式訪問b[n-1]時,b[0]、b[1]已經被清出快取,此時需要重新從主存中將資料加載至快取中,程式性能會大幅下降,

我們如何通過降低Cache miss次數提升程式的性能呢?通過對回圈做loop tiling可以符合我們的期望,即通過回圈重排,使得資料分成一個一個tile,讓每一個tile的資料都可以在Cache中被hint[4],從內層回圈開始tiling,假設tile的大小為t,t遠小于m、n,t的取值使得b[t-1]被訪問時b[0]依然在Cache中,將會大幅地減少Cache miss次數,假設n-1恰好被t整除,此時b陣列的訪問順序如下所示:

i=1; b[0]、b[1]、b[2]...b[t-1]
i=2; b[0]、b[1]、b[2]...b[t-1]
...
i=n; b[0]、b[1]、b[2]...b[t-1]
...
...
...
i=1; b[n-t]、b[n-t-1]、b[n-t-2]...b[n-1]
i=2; b[n-t]、b[n-t-1]、b[n-t-2]...b[n-1]
...
i=n; b[n-t]、b[n-t-1]、b[n-t-2]...b[n-1]

經過loop tiling后回圈變換成:

for(int j = 0; j < n; j+=t) {
 for(int i = 0; i < m; i++) {
 for(int jj = j; jj < min(j+t, n); jj++) {
 x = x+a[i]+c*b[jj];
  }
 }
}

假設每個Cache line能夠容納X個陣列元素,loop tiling前a的Cache miss次數為m/X,b的Cache miss次數是m*n/X,總的Cache miss次數為m*(n+1)/x,loop tiling后a的Cache miss次數為(n/t)*(m/X),b的Cache miss次數為(t/X)*(n/t)=n/X,總的Cache miss次數為n*(m+t)/xt,此時,由于n與m相等,那么loop tiling后Cache miss大約可以降低t倍[4],

前文討論了loop tiling在小用例上如何提升程式性能,總之針對不同的回圈場景,選擇合適的回圈交換方法,既能保證程式語意正確, 又能獲得改善程式性能的機會,

小結

汝之蜜糖,彼之砒霜,針對不同的硬體,我們需要結合具體的硬體架構,利用性能分析工具,通過分析報告和程式,從系統層次和演算法層次思考問題,往往會有意想不到的識訓,本文簡單地介紹了記憶體層次優化相關的幾種方法,結合一些小例子深入淺出地講解了一些記憶體層次優化相關的知識,紙上得來終覺淺,絕知此事要躬行,更多性能優化相關的知識需要我們從實踐中慢慢摸索,

參考

  1. John L. Hennessy, David A. Patterson. 計算機體系結構:量化研究方法(第6版). 賈洪峰,譯

  2. Andrew W.Apple, with Jens Palsberg. Modern Compiler Implenentation in C

  3. http://www.cs.cmu.edu/afs/cs/academic/class/15745-s19/www/lectures/L20-Global-Scheduling.pdf

  4. https://zhuanlan.zhihu.com/p/292539074

 

點擊關注,第一時間了解華為云新鮮技術~

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/539033.html

標籤:其他

上一篇:結合RocketMQ 原始碼,帶你了解并發編程的三大神器

下一篇:opencv的學習記錄(python)

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 網閘典型架構簡述

    網閘架構一般分為兩種:三主機的三系統架構網閘和雙主機的2+1架構網閘。 三主機架構分別為內端機、外端機和仲裁機。三機無論從軟體和硬體上均各自獨立。首先從硬體上來看,三機都用各自獨立的主板、記憶體及存盤設備。從軟體上來看,三機有各自獨立的作業系統。這樣能達到完全的三機獨立。對于“2+1”系統,“2”分為 ......

    uj5u.com 2020-09-10 02:00:44 more
  • 如何從xshell上傳檔案到centos linux虛擬機里

    如何從xshell上傳檔案到centos linux虛擬機里及:虛擬機CentOs下執行 yum -y install lrzsz命令,出現錯誤:鏡像無法找到軟體包 前言 一、安裝lrzsz步驟 二、上傳檔案 三、遇到的問題及解決方案 總結 前言 提示:其實很簡單,往虛擬機上安裝一個上傳檔案的工具 ......

    uj5u.com 2020-09-10 02:00:47 more
  • 一、SQLMAP入門

    一、SQLMAP入門 1、判斷是否存在注入 sqlmap.py -u 網址/id=1 id=1不可缺少。當注入點后面的引數大于兩個時。需要加雙引號, sqlmap.py -u "網址/id=1&uid=1" 2、判斷文本中的請求是否存在注入 從文本中加載http請求,SQLMAP可以從一個文本檔案中 ......

    uj5u.com 2020-09-10 02:00:50 more
  • Metasploit 簡單使用教程

    metasploit 簡單使用教程 浩先生, 2020-08-28 16:18:25 分類專欄: kail 網路安全 linux 文章標簽: linux資訊安全 編輯 著作權 metasploit 使用教程 前言 一、Metasploit是什么? 二、準備作業 三、具體步驟 前言 Msfconsole ......

    uj5u.com 2020-09-10 02:00:53 more
  • 游戲逆向之驅動層與用戶層通訊

    驅動層代碼: #pragma once #include <ntifs.h> #define add_code CTL_CODE(FILE_DEVICE_UNKNOWN,0x800,METHOD_BUFFERED,FILE_ANY_ACCESS) /* 更多游戲逆向視頻www.yxfzedu.com ......

    uj5u.com 2020-09-10 02:00:56 more
  • 北斗電力時鐘(北斗授時服務器)讓網路資料更精準

    北斗電力時鐘(北斗授時服務器)讓網路資料更精準 北斗電力時鐘(北斗授時服務器)讓網路資料更精準 京準電子科技官微——ahjzsz 近幾年,資訊技術的得了快速發展,互聯網在逐漸普及,其在人們生活和生產中都得到了廣泛應用,并且取得了不錯的應用效果。計算機網路資訊在電力系統中的應用,一方面使電力系統的運行 ......

    uj5u.com 2020-09-10 02:01:03 more
  • 【CTF】CTFHub 技能樹 彩蛋 writeup

    ?碎碎念 CTFHub:https://www.ctfhub.com/ 筆者入門CTF時時剛開始刷的是bugku的舊平臺,后來才有了CTFHub。 感覺不論是網頁UI設計,還是題目質量,賽事跟蹤,工具軟體都做得很不錯。 而且因為獨到的金幣制度的確讓人有一種想去刷題賺金幣的感覺。 個人還是非常喜歡這個 ......

    uj5u.com 2020-09-10 02:04:05 more
  • 02windows基礎操作

    我學到了一下幾點 Windows系統目錄結構與滲透的作用 常見Windows的服務詳解 Windows埠詳解 常用的Windows注冊表詳解 hacker DOS命令詳解(net user / type /md /rd/ dir /cd /net use copy、批處理 等) 利用dos命令制作 ......

    uj5u.com 2020-09-10 02:04:18 more
  • 03.Linux基礎操作

    我學到了以下幾點 01Linux系統介紹02系統安裝,密碼啊破解03Linux常用命令04LAMP 01LINUX windows: win03 8 12 16 19 配置不繁瑣 Linux:redhat,centos(紅帽社區版),Ubuntu server,suse unix:金融機構,證券,銀 ......

    uj5u.com 2020-09-10 02:04:30 more
  • 05HTML

    01HTML介紹 02頭部標簽講解03基礎標簽講解04表單標簽講解 HTML前段語言 js1.了解代碼2.根據代碼 懂得挖掘漏洞 (POST注入/XSS漏洞上傳)3.黑帽seo 白帽seo 客戶網站被黑帽植入劫持代碼如何處理4.熟悉html表單 <html><head><title>TDK標題,描述 ......

    uj5u.com 2020-09-10 02:04:36 more
最新发布
  • 2023年最新微信小程式抓包教程

    01 開門見山 隔一個月發一篇文章,不過分。 首先回顧一下《微信系結手機號資料庫被脫庫事件》,我也是第一時間得知了這個訊息,然后跟蹤了整件事情的經過。下面是這起事件的相關截圖以及近日流出的一萬條資料樣本: 個人認為這件事也沒什么,還不如關注一下之前45億快遞資料查詢渠道疑似在近日復活的訊息。 訊息是 ......

    uj5u.com 2023-04-20 08:48:24 more
  • web3 產品介紹:metamask 錢包 使用最多的瀏覽器插件錢包

    Metamask錢包是一種基于區塊鏈技術的數字貨幣錢包,它允許用戶在安全、便捷的環境下管理自己的加密資產。Metamask錢包是以太坊生態系統中最流行的錢包之一,它具有易于使用、安全性高和功能強大等優點。 本文將詳細介紹Metamask錢包的功能和使用方法。 一、 Metamask錢包的功能 數字資 ......

    uj5u.com 2023-04-20 08:47:46 more
  • vulnhub_Earth

    前言 靶機地址->>>vulnhub_Earth 攻擊機ip:192.168.20.121 靶機ip:192.168.20.122 參考文章 https://www.cnblogs.com/Jing-X/archive/2022/04/03/16097695.html https://www.cnb ......

    uj5u.com 2023-04-20 07:46:20 more
  • 從4k到42k,軟體測驗工程師的漲薪史,給我看哭了

    清明節一過,盲猜大家已經無心上班,在數著日子準備過五一,但一想到銀行卡里的余額……瞬間心情就不美麗了。最近,2023年高校畢業生就業調查顯示,本科畢業月平均起薪為5825元。調查一出,便有很多同學表示自己又被平均了。看著這一資料,不免讓人想到前不久中國青年報的一項調查:近六成大學生認為畢業10年內會 ......

    uj5u.com 2023-04-20 07:44:00 more
  • 最新版本 Stable Diffusion 開源 AI 繪畫工具之中文自動提詞篇

    🎈 標簽生成器 由于輸入正向提示詞 prompt 和反向提示詞 negative prompt 都是使用英文,所以對學習母語的我們非常不友好 使用網址:https://tinygeeker.github.io/p/ai-prompt-generator 這個網址是為了讓大家在使用 AI 繪畫的時候 ......

    uj5u.com 2023-04-20 07:43:36 more
  • 漫談前端自動化測驗演進之路及測驗工具分析

    隨著前端技術的不斷發展和應用程式的日益復雜,前端自動化測驗也在不斷演進。隨著 Web 應用程式變得越來越復雜,自動化測驗的需求也越來越高。如今,自動化測驗已經成為 Web 應用程式開發程序中不可或缺的一部分,它們可以幫助開發人員更快地發現和修復錯誤,提高應用程式的性能和可靠性。 ......

    uj5u.com 2023-04-20 07:43:16 more
  • CANN開發實踐:4個DVPP記憶體問題的典型案例解讀

    摘要:由于DVPP媒體資料處理功能對存放輸入、輸出資料的記憶體有更高的要求(例如,記憶體首地址128位元組對齊),因此需呼叫專用的記憶體申請介面,那么本期就分享幾個關于DVPP記憶體問題的典型案例,并給出原因分析及解決方法。 本文分享自華為云社區《FAQ_DVPP記憶體問題案例》,作者:昇騰CANN。 DVPP ......

    uj5u.com 2023-04-20 07:43:03 more
  • msf學習

    msf學習 以kali自帶的msf為例 一、msf核心模塊與功能 msf模塊都放在/usr/share/metasploit-framework/modules目錄下 1、auxiliary 輔助模塊,輔助滲透(埠掃描、登錄密碼爆破、漏洞驗證等) 2、encoders 編碼器模塊,主要包含各種編碼 ......

    uj5u.com 2023-04-20 07:42:59 more
  • Halcon軟體安裝與界面簡介

    1. 下載Halcon17版本到到本地 2. 雙擊安裝包后 3. 步驟如下 1.2 Halcon軟體安裝 界面分為四大塊 1. Halcon的五個助手 1) 影像采集助手:與相機連接,設定相機引數,采集影像 2) 標定助手:九點標定或是其它的標定,生成標定檔案及內參外參,可以將像素單位轉換為長度單位 ......

    uj5u.com 2023-04-20 07:42:17 more
  • 在MacOS下使用Unity3D開發游戲

    第一次發博客,先發一下我的游戲開發環境吧。 去年2月份買了一臺MacBookPro2021 M1pro(以下簡稱mbp),這一年來一直在用mbp開發游戲。我大致分享一下我的開發工具以及使用體驗。 1、Unity 官網鏈接: https://unity.cn/releases 我一般使用的Apple ......

    uj5u.com 2023-04-20 07:40:19 more