在年初的CES上,Intel所説的Tiger Lake-H移動高性能處理器以及Rocket Lake-S桌面處理器均已推出,目前第11代酷睿處理器已經全部佈局完畢。同時在會上也宣佈了今年會推出第12代酷睿處理器 Alder Lake,這款處理器可以説是近年來x86處理器的一次大變革,是首次大規模在主流市場上應用混合x86架構,其實在2019年Intel已經在Lakefield處理器上試驗過這種類似ARM big.LITTLE的異構計算架構,而現在正是那次試驗修成正果之時。

其實關於Alder Lake在半年內就已經陸續流出來許多信息,比如它支持PCI-E 5.0和DDR5,會繼續沿用Xe架構核顯,最頂級的版本會採用8+8的組合,採用Intel 7工藝,以及桌面版本會改用LGA 1700接口等等信息,在上週的2021年Intel架構日活動上官方終於正式解禁了Alder Lake處理器的具體架構信息。
在談論Alder Lake處理器之前,我們需要了解組成Alder Lake的兩種核心:能效核(E-Core)與性能核(P-Core),以及為了讓系統更好的調配兩種不同架構不同功能的核心所推出的技術:Intel硬件線程調度器。

能效核
Gracemont是 能效核的曾用代號,它是Atom處理器所用的Mont系列的第七代架構,它更追求能效,會在多線程以及線程吞吐上有所加強。此高能效x86微架構在有限的硅片空間實現多核任務負載,並具備寬泛的頻率範圍。該架構致力通過低電壓能效核降低整體功率消耗,為更高頻率運行提供功率熱空間。這也讓能效核提升性能,以滿足更多動態任務負載。

能效核可以利用各種技術進步,在不額外增加處理器功率的情況下對工作負載進行優先級排序,並改進處理器的IPC性能。
Gracemont大幅擴大了分支預測器,現在 擁有5000個條目的分支目標緩存區,實現更準確的分支預測。一級指令緩存增大到64KB,在不耗費內存子系統功率的情況下保存可用指令 ,它還擁有Intel的首款按需指令長度解碼器,可生成預解碼信息,加速具有大量代碼的現代工作負載。採用兩組三寬度的簇亂序執行解碼器,可在保持能效的同時,每時鐘週期解碼多達6條指令

後端執行單元拓寬了,具備5組寬度分配、8組寬度引退、256個亂序窗口入口和17個執行端口 ,共計擁有4個整數ALU、2個載入AGU、2個存儲AGU、2個跳轉端口、2個整數存儲數據、2個浮點/矢量存儲、2個浮點/矢量堆棧、以及第3矢量ALU。

存儲系統採用了雙載入雙存儲的配置,每4個核心共享4MB二級緩存,緩存帶寬高達64 Bytes/cycle,延遲則是17時鐘週期,並支持深度緩衝、高級預取器和Intel資源調配技術。

指令集方面,支持控制流強制技術和虛擬化技術重定向保護等功能;同時它也是首款支持AVX2指令集的“Mont”核心,以及支持整數人工智能操作的新擴展。

與Skylake核心相比,能效核能夠在相同功耗下實現40%的單線程性能提升,或者只有不到40%的功耗提供相同的性能。與雙核四線程Skylake相比,四個能效核能夠在功耗更低的情況下同時帶來80%的性能提升, 或者在提供相同性能的同時功耗減少80%。

性能核
性能核的曾用代號是Golden Cove,是Sunny Cove與Willow Cove這條核心線路下的直系後代。Tiger Lake所用的Willow Cove核心與Ice Lake上的Sunny Cove相比只是改動了緩存部分,改動非常小,而Golden Cove與Willow Cove相比改動則非常大。

性能核旨在提高速度,突破低時延和單線程應用程序性能的限制。工作負載的代碼體積正在不斷增長,需要更強的執行能力。數據集也隨着數據帶寬的需求提升而大幅增加。全新性能核微架構帶來了顯著增速同時更好地支持代碼體積較大的應用程序,與現有CPU架構相比,性能核的改動可以歸納為更寬、更深、更智能。

從Skylake到Sunny Cove,前端的改動非常小,主要是增大了緩衝區,而Golden Cove這次則是直接拓寬了前端,解碼長度從16字節翻倍到32字節,解碼器由4個增至6個,每時鐘週期執行微指令從6增至8。微指令隊列每個線程從70條目增加到72條目,單線程則從70增加到144。微指令緩存從2.25K擴大到4K,增加了命中率與前端帶寬。
增強了編碼預取能力,4K指令TLB從128條目增加到256條目,2M/4M指令TLB從16條目增加到32條目,分支目標從5K增至12K,同時改進了分支預測精度,具備更智能的編碼預取機制。

亂序引擎分配由5路增至6路,執行端口由10個增至12個,重排序緩衝區當年Sunny Cove已經從224條目增加到384條目,現在Golden Cove進一步增加到512條目,重命名和分配階段也可以執行更多指令。

整數執行引擎增加了第五個通用執行端口,五個端口都有ALU和LEA單元,增加ALU數量很重要,因為ALU操作非常普遍,很多軟件都對其加以利用。

矢量執行引擎在端口1和端口5下方各加了一個FADD快速加法器,此前Intel的處理器浮點加發都是交由FMA單元處理的,在端口0和1上需要4個時鐘週期,而端口5上則要6個時鐘週期,現在交由FADD做的話只需要3個時鐘週期,效率更高而且延遲更低。
FMA單元現在支持FP16浮點數據類型,它屬於AVX-512指令集的一部分,這在加速網絡應用方面非常有效。

此外端口5上還多了個AMX單元,它的全稱是Advanced Matrix Extensions高級矩形擴展,它可執行矩陣乘法運算,現在支持AVX512_VNNI的處理器每個內核每時鐘週期可執行256次int8運算,而現在藉助AMX可讓這性能提升至8倍,達到每時鐘週期執行2048次int8運算,這可用於AI學習推理和訓練,讓處理器的AI性能大幅加速。

緩存系統方面,增加了一個AGU Load的端口,載入端口從2個增加到3個,吞吐量提高了50%,可同時載入3組256bit的數據或2組512bit的數據,這有效的降低了L1緩存延遲, 同時加深了載入與存儲緩存區,使其具備更強的內存並行性,對大型數據和代碼體積較大的應用程序提供更好的支持。
L1數據TLB從64條目增加到96條目,L1數據緩存可並行多獲取25%以上的未命中,數據預取器得到了增強,可面對更強的亂序執行架構,可同時服務4個page-table walks,較上代架構翻了一倍,這對現代大型、不規則數據集的工作負載更為有利。

L2緩存桌面與移動端每核心還是和Tiger Lake一樣是1.25MB,但與現在11代桌面處理器相比則是增加了150%,服務器的Sapphire Rapids則是每核心2MB,優化了全寫入預測帶寬,減少內存讀取。

Golden Cove相比目前第11代酷睿桌面處理器的Cypress Cove,在通用性能的ISO頻率下,針對大範圍的工作負載實現了平均約19%的性能提升,大家可以理解成IPC提升了這麼多。
兩種核心的性能差距
那麼效能核與性能核之間到底有多少性能差距呢?
傳統的處理器,單線程性能與多線程性能是呈線性關係的,核心架構的單線程性能越強,多線程性能就越強

但在Alder Lake這種混合架構處理器中就不一樣了,P-Core性能核的目的是提升處理器的單線程性能,而E-Core效能核的目的設計目的則是用更低的功耗來提升多線程性能,根據Intel的示意圖,四個效能核加起來才等於一個性能核那麼大。

性能核在同功耗的情況下單線程性能比效能核高出50%,而且實際情況是性能核的頻率與功耗會比效能核高得多,所以這個差距會更大,當然了,效能核本身的性能不差,別把他們看作ARM處理器的小核。
多線程的時候就會變得很有趣,4個性能核與2個性能核加8個效能核的芯片尺寸應該是差不多的,前者有8個線程,後者則是4+8共12個線程,而Intel給出的測試結果是2+8的組合比單純4個性能核多線程要領先50%。
很明顯想提升多線程性能堆效能核其實更省芯片面積,更加划算 ,當然了實際使用時大部分應用不會直接把CPU的線程數佔滿,這時就需要性能核展現其高效的單線程了,Intel肯定是實際考量過各種日常應用的負載情況才有了各種不同核心數量組合的Alder Lake處理器。
英特爾硬件線程調度器
Alder Lake處理器內有性能核與效能核兩種核心,為使操作系統能夠更為正確的使用兩種核心,Intel開發了一種改進的調度技術——Intel Thread Director,也就是英特爾硬件線程調度器。

硬件線程調度器直接內置於硬件中,可提供對內核狀態和線程指令混合比的低級遙測,讓操作系統能夠在恰當的時間將合適的線程放置在合適的內核上。硬件線程調度器具有動態性和自適應性——它會根據實時的計算需求調整調度決策——而非一種簡單的、基於規則的靜態方法 。
傳統的操作系統調度器會根據有限的數據來分配任務,如前台和後台任務,硬件線程調度器則是根據實時的監控內核狀態然後做出一個動態和智能的反應,從而幫助操作系統做出更智能的調度決策,將需要更高性能的線程引導到當時適合的性能核上 ,它只需大概30ms就能識別出工作負載的類型並反饋給系統的調度程序。
這一點帶來的最大好處是軟件不需要重寫代碼,如果是固定線程調配,軟件就需要考慮把哪些線程放到更高性能的核上,哪些線程要放到更追求能耗的核上面,而通過硬件線程調度器這種實時動態智能調整,軟件不需要做這樣的適配和調優。
其次是通過與微軟合作,在Windows 11系統上實現了硬件級別的線程調整,硬件線程調度器能夠把更多內核信息通過回報給操作系統的調度器,操作系統就可以更好的在系統級別去做線程的調度,這套體系能更好服務於Alder Lake混合的性能核和能效核。
至於Windows 10系統,要用上硬件線程調度器還有一些工作要做,現在還沒有更多信息可披露。
Alder Lake處理器
上面説了這麼多架構方面的東西,其實都是第12酷睿Alder Lake處理器的一部分,而接下來終於要介紹這款處理器的規格了。

Alder Lake是Intel首款大規模推向各級市場的混合架構處理器,而此前的Lakefield只是一個試點,新一代處理器將採用Intel 7工藝生產,也就是原本的10nm Enhaned SuperFin,會囊括TDP 9W到125W的產品,新的處理器支持DDR5、PCI-E 5.0、Thunderbolt 4以及WiFi 6E。

Alder Lake處理器有三種不同的封裝方式,包括桌面的Socket LGA 1700,移動版的BGA Type3以及低功耗移動版BGA Type4 HDI,兩種移動版的都會與PCH一同封裝在同一塊PCB上。

桌面版的最多8個效能核8個性能核,16核心24線程,配備32個EU的核顯,TDP最高125W,從方框圖上可以看出桌面版的沒有整合Thunderbolt 4控制器,也沒有用來處理圖像輸入數據的IPU圖像處理單元。
移動版最多8個效能核6個性能核,14核心20線程,配備96個EU的核顯,TDP應該在15W到45W之間,BGA Type3的封裝尺寸為50*25*1.3mm。
低功耗移動版最多8個效能核2個性能核,10核心12線程,配備96個EU的核顯,TDP小於9W,BGA Type4 HDI的封裝尺寸是28.5*19*1.1mm。

Alder Lake的每個效能核心可提供1條線程,而每個性能核心則可提供2條線程,所以才有了16核24線程這樣的組合。L3緩存的話則是每個性能核心最多3MB,每4個效能核心也最多3MB,所以桌面版的最多會有30MB L3緩存,而移動版的應該是最多24MB。

內存支持方面,Alder Lake同時支持DDR5-4800、DDR4-3200、LPDDR5-5200、LPDDR4x-4266這四種內存,同時還會支持內存的動態電壓頻率縮放,並強化超頻能力,從方框圖上來看這應該是移動版的處理器,桌面版估計也是一樣的。

桌面版Alder Lake可提供16條PCI-E 5.0通道與4條PCI-E 4.0,很明顯PCI-E 5.0是給顯卡的,PCI-E 4.0則是給M.2 SSD,同時桌面級的PCH則最多可提供12條PCI-E 4.0與16條PCI-E 3.0。整套平台可提供PCI-E 5.0/4.0/3.0各16條,共48條PCI-E通道,作為對比,現在11代酷睿搭Z590可提供20條PCI-E 4.0與24條PCI-E 3.0,共44條PCI-E通道,而AMD鋭龍3000/5000處理器搭X570平台則可提供36條PCI-E 4.0。

Alder Lake擁有三種不同的高速總線,包括1000GB的內部數據總線,用來鏈接各個核心、核顯、L3緩存以及CPU內其他各個模塊,這個其實就是原來的環形總線,並沒有改動。內存總線帶寬最高能達204GB/s,目前不太清楚Intel是怎麼算出來的,雙通道128bit的DDR5要達到這個帶寬要跑到12750MHz的頻率。I/O總線帶寬最高是64GB/s,這整合對應PCI-E 5.0 x16的帶寬。
總結
Alder Lake對於x86處理器來説是一個重大的變革,能效核與性能核這種混合x86架構是首次大規模應用到消費級市場上,而PCI-E 5.0與DDR5內存也是由Alder Lake處理器首次消費級市場,兩年前被AMD搶了PCI-E 4.0的首發後,這次Intel直接拿下了PCI-E 5.0與DDR5的首發,説Alder Lake是一款非常激進的處理器也不為過。
從性能核的IPC會比現在的第11代酷睿桌面處理器Rocket Lake提升19%這點來看,Alder Lake的整體性能應該是會很不錯的,但軟件能否正確用到兩種架構目前還是個疑問,根據Intel的説法,硬件線程調度器與Windows 11的組合會很好的解決線程調度的問題,但實際表現如何還得等到產品正式發售時才知道。
Intel架構日的PPT上有寫着Alder Lake會在2021年初秋發佈,而此前的小道消息則説是10月或者11月,反正今年年內肯定是能和大家見面的,它是一款相當讓人期待的產品,特別是對於桌面市場而言,終於可以和那些14nm工藝的處理器説拜拜了。