超能課堂(342):Panther Lake深度解析,融合能效與性能打造下一代AI PC核心

上週英特爾公佈了代號為Panther Lake的新一代客户端處理器的架構細節,它將會是未來的酷睿Ultra 300系列移動處理器,計劃是在明年初正式推出。它與服務器端的Clearwater Forest一樣使用Intel 18A製程工藝打造,新產品將為廣泛的消費級與商用AI PC、遊戲設備以及邊緣計算解決方案提供算力支持,預計今年晚些時候開始出貨,2026年1月實現廣泛的市場供應。

現在的酷睿Ultra 200系列移動處理器產品組合是相當複雜的,首先它包含Lunar Lake與Arrow Lake兩種不同的處理器,就產品架構而言,Lunar Lake其實比Arrow Lake更先進,它擁有最新的Xe2 Battlemage架構GPU和算力達到48 TOPS的第四代NPU。但它的核心規模並不大,因為Lunar Lake是追求高電池續航而設計的,只有4P+4LP E核,擴展能力也有限,再加上內存是直接焊在CPU上的所以並不怎麼受廠家歡迎。

而Arrow Lake則更細分為HX、H和U三個系列,它的核心規模比Lunar Lake大得多,然而它身上也有不少妥協的地方,因為它本身就是從Meteor Lake基礎上發展而來的,所以也直接沿用了Meteor Lake的部分模塊。它的SoC模塊就是Meteor Lake上的,所以你能Arrow Lake-H在上面看到Skymont架構的E核與Crestmont架構的LP-E核這種神奇組合,由於NPU也在SoC模塊上,所以Arrow Lake只有算力13 TOPS的第三代NPU。GPU方面,Arrow Lake-HX直接沿用Meteor Lake的Xe-LPG核顯,而Arrow Lake-H上的則是增加了XMX單元的Xe-LPG+,其實都屬於第一代Arc Alchemist架構的產品。至於Arrow Lake-U更直接是升級Intel 3工藝的Meteor Lake-U,和酷睿Ultra 200差非常遠。

現在Panther Lake要把Lunar Lake級別的能效與Arrow Lake級別的性能與擴展性整合在一起,打造在各方面都具備競爭力的產品,它擁有全新的Cougar Cove架構P核,Darkmont架構E核,Xe3 GPU與第五代NPU,Panther Lake基於最新的Intel 18A製程工藝打造,並使用Foveros-S封裝技術把不同工藝的模塊封裝在一起。下面我們就來深入研究一下Panther Lake。

Intel 18A是其開發和製造的首個2納米級別製程節點。與Intel 3製程工藝相比,Intel 18A的每瓦性能提升高達15%,芯片密度提升約30%。該技術通過RibbonFET晶體管和PowerVia背面供電技術顯著提升性能與能效。Intel 18A已經在兩座工廠開始生產,英特爾在美國亞利桑那州的Fab-52晶圓廠已經正式在這個月全面投入運營,預計在2025年第四季度Intel 18A工藝能夠達成大規模量產的良率目標,從而全面進入高產能的生產階段。

RibbonFET即GAA全環繞柵極晶體管,它的柵極環繞晶體管溝道,從而能夠嚴格控制溝道中的電流,可以降低漏電流,並提高晶體管開關時的效率,這也有助於降低工作電壓。此外,RibbonFET的柵極長度比FinFET短5~10%,並且每個晶體管的功耗降低了20%。

PowerVia背面供電將電源線路移至晶體管背面,傳統的晶圓設計是信號線路和電源線路混合放在晶體管上面,這樣會帶來明顯的線路擁塞和功耗損失問題。PowerVia把電源線路移動到晶體管背面,把信號線路和供電線路分離了,這首先消除了信號干擾,有更好的信號完整性。並縮短了晶體管與電源之間的距離,降低了電阻,有效減少了從封裝到晶體管之間的壓降,最多可達30%。線路的優化提升了標準單元利用率最多可達10%,從而提升了晶體管密度。

Panther Lake採用2.5D Foveros-S先進封裝技術,它在2019年就進入了規模生產,到現在已經是一個很成熟的技術了,利用該技術把各個功能模塊和被動基礎模塊相連,能在芯片內可以實現高效堆疊和低延遲互連,能夠充分發揮其在高密度、高能耗場景下的優勢。

説完了製程工藝,接下來我們迴歸Panther Lake處理器本身,它由計算模塊、圖形模塊、平台控制模塊和基礎模塊四個大模塊所組成,還添加了填充材料填補各模塊大小差異造成的空隙。計算模塊、圖形模塊和平台控制模塊使用Foveros-S封裝工藝安裝在基礎模塊之上,這種設計其實是自第一代酷睿Ultra處理器Meteor Lake一路延續下來的。關於各模塊的生產工藝,計算模塊是Intel 18A,圖形模塊有兩種,12個Xe核心的用台積電N3E工藝,4個Xe核心的用Intel 3工藝,平台控制模塊採用台積電N6工藝,基礎模塊用的是Intel 16工藝。

Panther Lake有兩種計算模塊和圖形模塊,計算模塊有4P+8E+4LP E核與4P+4LP E核兩種,圖形模塊有12個Xe核心和4個Xe核心兩種。這兩種模塊有三種組合,兩種計算模塊都會搭配小的圖形模塊,但大的12個Xe核心圖像模塊只會搭配16核的計算模塊使用,這些處理器會搭配相同的NPU、IPU以及媒體和顯示引擎,但內存和I/O擴展會有些差別。

最小的8核心的版本只支持LPDDR5X-6800或DDR5-6400的內存速率,提供4條PCIe 5.0和8條PCIe 4.0通道,這種配置的產品應該是面向低功耗設備的,也就是Panther Lake-U系列。

16核搭配4Xe GPU的版本支持LPDDR5X-8533或DDR5-7200內存速率,提供12條PCIe 5.0和8條PCIe 4.0通道,它和其他版本相比有更多的PCIe通道,表明它是要搭配獨顯使用的,基本上就是Panther Lake-H系列。

16核搭12Xe GPU的版本只支持LPDDR5X-9600內存,估計是要為高性能核顯提供更高的內存帶寬,這是為追求圖形和AI性能的輕薄平台而準備的,所以沒考慮對獨顯的支持,擴展能力和8核版本是一樣的,只有4條PCIe 5.0和8條PCIe 4.0通道。

所有Panther Lake均可提供4個Thunderbolt 4接口,2個USB 3.2、8個USB 2.0口,支持WIFi 7 R2和藍牙6.0。

其實Panther Lake的結構更像Lunar Lake,把Lunar Lake的GPU分拆成一個獨立模塊就是現在Panther Lake的樣子,計算模塊內部也是採用第二代Scalable fabric(NOC)總線通信,當然了P核與E核之間是使用環形總線通信的,但它們與LP E核就需要走NOC通信了,模塊之間則採用D2D界面相互連接。

Arrow Lake最大的問題就是內存控制器被放置在SoC模塊裏面,計算模塊的CPU核心訪問內存控制器需要進行跨芯片通信,延遲相當大,Panther Lake和Lunar Lake一樣內存控制器放在計算模塊內,完全沒這個問題。

接下來我們就來看看Panther Lake的兩種CPU內核,全新的Cougar Cove性能核與Darkmont能效核。

性能核:Cougar Cove

Panther Lake所用的P核代號為Cougar Cove,它是在Arrow Lake和Lunar Lake上使用的Lion Cove架構P核基礎上優化而來的,執行端口數量和流水線長度都沒變化,主要是針對Intel 18A工藝進行優化。採用了基於AI的電源管理,更好的根據CPU實時動態負載變化去調配內部的硬件資源,讓核心性能充分發揮同時避免電力浪費。

Cougar Cove主要進行了以下三點優化:

內存消歧,以往CPU在處理內存讀寫操作時,需要嚴格遵循指令的順序,這導致了內存帶寬利用率低下。內存消歧允許CPU的多個執行單元進行亂序或並行的內存讀寫操作,該技術能精準預測哪些操作可以並行執行,哪些存在依賴需要等待,能夠顯著提升CPU與內存之間的帶寬利用率。Cougar Cove相比Lion Cove,消歧技術性能更可靠,細節更準,並且恢復更快。

TLB增強,它是是CPU內部虛擬地址到物理地址的映射緩存,Cougar Cove的TLB容量擴大了50%,讓CPU面對更復雜的現代工作負載能夠更快、更可靠地運行。

分支預測,Cougar Cove的分支預測相比Lion Cove在預測準確性上有了進一步提高,另外分支預測的延遲也大幅度縮短,讓CPU能夠將更少的時間花費在預測和修正的開銷上,而將更多的時間投入到計算任務中,最終讓性能與能效都有所提升。

能效核:Darkmont

Panther Lake所用的E核代號為Darkmont,它同樣是Arrow Lake和Lunar Lake所用的Skymont的進一步演進,它保留了上代的26個調度端口,引入了內存消歧技術,提升了Nanocode性能,讓能效核的執行單元的硬件得到更充分的利用,在提升能效的同時,實現了性能提升。

Darkmont主要進行了以下四點優化:

分支預測,Darkmont可以預測更後面的分支,並且可以提高準確性,降低延遲。

動態預取器控制,預取器能夠根據當前的工作負載類型和實時變化,智能地調整預取策略,讓執行單元最大限度地保持繁忙狀態,提升了性能,在某些場景下還能降低不必要的功耗。

Nanocode,它是比傳統Microcode更底層的微操作指令,後者面向CPU邏輯模塊,而前者則進一步分解直接面向硬件執行小單元,這種更細粒度的控制,能夠更精準、更靈活地調度硬件資源。Darkmont相比Skymont,它的Nanocode能夠覆蓋更多的指令,可在更多場景下充分釋放E核的性能與低功耗優勢。

內存消歧,這個其實與Cougar Cove P核的改進是一樣的,提升了E核的內存利用率。

緩存和內存子系統

Panther Lake的計算模塊相比與Lunar Lake,基本上就是把GPU分拆成獨立模塊,這樣就可以更靈活的去搭配不同規格GPU。和Meteor Lake和Arrow Lake相比的話,就是把SoC模塊一分為二,I/O部分全部劃分到平台控制模塊,把剩下的內存控制器、LP-E核、NPU、IPU、媒體與視頻單元都併入計算模塊。

Panther Lake的緩存和內存子系統的結構基本是延續了Lunar Lake的設計,只不過Lunar Lake上可沒有掛在環形總線上的E核。Panther Lake的P核與E核都掛在環形總線上,它們共享18MB L3緩存,Cougar Cove P核每個核心有3MB L2緩存,而Darkmont E核則是每組共享4MB L2緩存。

計算模塊上還有一組4個Darkmont E核充當低功耗島的作用,同樣擁有4MB共享L2緩存,它們掛在NOC總線上,所以也沒有三級緩存。但Panther Lake延續了Lunar Lake上的內存端緩存設計,LP-E核、NPU、IPU與媒體引擎都可以使用它,內存端緩存可降低這些模塊對系統內存的依賴,避免重複讀取,有效降低延遲並大幅節省能耗。

代際性能提升

在經過多項升級之後,Panther的單線程性能較Lunar Lake和Arrow Lake-H在同功耗時提升了10%,在同樣性能的時候最多可降低40%的功耗。

多線程方面,在相同功耗下,Panther對比Lunar Lake有50%的性能提升。與Arrow Lake-H相比,在提供相似的性能的時候功耗最多可降低30%。

硬件線程調度器與軟件升級

自英特爾在12代酷睿Alder Lake處理器引入混合架構以來,硬件線程調度器就成了一個很關鍵的東西,它關係到CPU能否把線程分配給正確的核心。

Panther Lake的硬件線程調度器對分類模型做了優化,根據新架構的核心特性進行了分類,給系統更準確的調度指數參考,舊的分類模型不再適用於Panther Lake。電源管理輸入也有改善,現在能根據OEM的電源模式是傾向能效還是性能去調整反饋表的內容,能給操作系統一個更加貼近Panther Lake性能的,更能反映真實情況的反饋表。

這些改善擴大了硬件線程調度器的作用範圍,原本只有在某些特定場景下發揮功能,現在能做更多場景下看到會有線程調度的動作。這個調度是高度並行的,能夠跨三個級別的混合核心之間相互來回調度。

Panther Lake的核心調度其實與Meteor Lake較為相似,線程進來會先分配LP-E核,如果性能不夠就把負載調進E核,再不夠就讓P核來,下面我們來看看實際的應用調度情況。

常用的會議軟件Teams,使用時會開啓背景虛化和AI特效等。圖中的小方塊就是操作系統隔離區,當設置效率優先的時候,在Teams使用場景下基本上所有負載都集中在LP-E核,只有零散工作分配給P核與E核,這樣就能保證足夠低的功耗來提升設備續航時間。

接下來是UL Procyon生產力基準測試,也就是Office套件的測試。在這種混合工作負載環境下,在沒有高負載需求時任務都在LP-E核上跑,當檢測到需要高性能時,系統會迅速將該負載調度至P核進行處理,從而為用户提供快速響應。

這是在OS不分區的設置下CineBench 2024多線程測試的負載情況,這設置允許操作系統自由調度至各個核心。在初始階段軟件還在啓動,僅需少量核心工作。但一旦進入計算密集型階段,所有核心均開放給操作系統進行調度,從而充分釋放多線程性能潛力。

遊戲方面測試的是《控制》,在不分區的系統設置下,所有核心都會開放給系統調度,可以看到所有核心都有負載,但《控制》這款遊戲對CPU的負載並不大,更側重GPU,這種調度策略會讓CPU消耗過多功耗,擠佔了可分配給核顯的電力。

在混合模式下,負載會集中在P核與E核上,不會分配給LP-E核,通過這種智能調度,CPU的整體功耗有效降低,節省下來的功耗可以分配給核顯,使其獲得更多的電力支持,遊戲性能提升了10%左右。

英特爾在系統軟件層面構建了一個管理堆棧,通過OEM廠商提供的一些性能模式,比如野獸模式、性能模式等,這些模式可以對應英特爾平台軟件的某個性能與效率節點,然後再傳遞給SoC電源管理,再傳遞給硬件線程調度器,最後通過系統實際反應到SoC的行為上。通過這些軟件工具,OEM能夠根據其平台需求,在性能與能效曲線上找到最佳配置點,從而滿足特定的系統要求。

英特爾還做了一個智能體驗優化器,能夠在後台根據實時工作負載,自動在預設的性能模式和更高效的節能模式之間進行無縫切換,只要是搭載Panther Lake的設備,在選擇平衡模式時,用户即可享受到系統根據實時負載智能調配性能與能效。

Panther Lake的核顯是基於Xe3 GPU的,但需要明確的是,Xe3並非基於Celestial架構,而是Battlemage的延伸,它會被命名為鋭炫B系列,和現在的Battlemage獨顯一樣。未來還會有Xe3P GPU,那個被劃分到下一代鋭炫系列,大家應該能猜到是什麼了。

英特爾GPU裏面最基本的構建單元是渲染切片,在Xe3中每個渲染切片中的Xe核心數量從Xe2的4個擴展到6個,光追單元數量也跟着增加至6個,從而提供更強大、更充足的計算能力。

上面已經説過了,Panther Lake有兩種GPU配置,4個Xe核心的GPU包含32個XMX引擎、4MB L2緩存、1個幾何管線、4個採樣器、4個光線追蹤單元、2個像素後端。

12個Xe核心的GPU包含96個XMX引擎、16MB L2緩存、2個幾何管線、12個採樣器、12個光線追蹤單元、4個像素後端,擁有更強大的性能。Lunar Lake上面的Xe2核顯配備8MB L2緩存,現在翻倍到16MB,內存訪問量可以有效減少17%~36%,能夠提供更流暢的運行體驗。

Xe3從引擎到切片進行了全面優化,包括第三代Xe核心、更強的光線追蹤單元、優化的Xe矢量引擎以及更出色的圖形專用硬件管線。

第三代Xe核心包括8個512位矢量引擎和8個2048位XMX引擎,這點與Xe2是一樣的,但L1緩存容量增加了33%,賦予了Xe核心更強大的性能。

新的Xe矢量引擎線程數增加了25%,添加了可變寄存器,有效提升了Xe矢量引擎的使用效率,使得相同的硬件能夠支持更多、更快的負載。它支持原生FP8反量化,以及SIMD16原生ALU、三路併發、擴展數據指令集與FP64,並支持Xe矩陣擴展。

XMX AI加速引擎是AI運算核心算力的來源,可提供高達120TOPS的算力,每個時鐘週期可執行1024個XMX TF32操作,支持2048個XMX FP16/BF16運算,4096個XMX INT8運算和8192個XMX INT4/INT2運算,這些都比上一代有了顯著提升。

光線追蹤單元支持異步光線追蹤的動態光線管理,可大幅提升光線追蹤負載下的性能。

Xe3採用更優的固定功能管線,配備全新的URB管理器,它用於GPU內部子單元之間的數據轉換和傳輸。在以往的URB設計中,即使只傳輸少量數據,也需要對整個URB進行同步,效率低下。新的URB管理器設計允許對部分URB進行傳輸同步,最高可支持2倍的異向性過濾,並使模板測試速率最高提升2倍。

Xe3擁有第三代Xe核心、更強的光線追蹤單元、更高利用率的Xe矢量引擎以及更優的圖形專用硬件管線,這些共同帶來了顯著的性能提升。

Panther Lake上的Xe3核顯,前一代Lunar Lake的Xe2,性能提升可超過50%。若與使用更早Xe架構的Arrow Lake-H相比,新的核顯實現了40%的每瓦性能提升。

最後英特爾還預告了會在Xe3上推出多幀生成功能,支持一幀原始畫面生成四幀輸出畫面,將是未來XeSS 3核心部分之一。其通過抓取運動向量和深度緩衝區構建的光流網絡,基於AI技術,實現更流暢的遊戲畫面。XeSS-MFG多幀生成技術分為遊戲內支持與驅動內支持,所有支持XeSS 2裏XeSS-FG的遊戲都能直接支持,不需要額外去做適配。

XeSS-MFG多幀生成技術支持所有配備XMX硬件的鋭炫GPU,從鋭炫A系列到鋭炫B系列獨立顯卡,還有各種依託Xe系列架構的核顯產品,這讓英特爾成為首個將多幀生產引入到多代硬件的公司。

Panther Lake上使用了英特爾第五代NPU,也就是NPU5,它主要是提升了芯片面積效率,NPU5在每個神經計算引擎中都擁有更大的MAC單元,更大的MAC單元能帶來更高的計算密度和運算效率。所以NPU5相比於NPU4,每個Slice中的神經單元數量從6個減少到3個,但每個神經計算引擎的計力翻倍,這有效提升了整體運算效率和Die size的利用率。

NPU5的Slice包含三個神經計算引擎,提供12K的矩陣運算能力、4.5MB的暫存器內存、6個SHAVE DSP以及256KB的L2緩存,這些較上一代都有提升。

NPU5的計算效率相對於NPU4有顯著提高,單位面積下的TOPS性能提升超過40%,可以看到新的NPU5芯片面積明顯小於NPU4。

NPU5支持INT8和FP8量化的運算,目前在推理任務中8位的模型是較為常用的,且精度損失在可接受範圍內,NPU5每週期可以進行2048個INT8或FP8的MAC運算,而FP16則是每週期2048,效率比NPU4有兩倍的提升。

NPU5可提供高達50TOPS的計算能力,這主要得益於超過40%的單位面積TOPS提升,以及針對AI負載的特定優化,包括對激活函數的支持和原生FP8的數據類型支持,從而顯著提升了NPU的算力。

整個Panther Lake SoC可提供高達180TOPS的平台算力,其中CPU算力為10TOPS,NPU為50TOPS,GPU貢為120TOPS。算力提升並非簡單的數字疊加,而是不同的硬件單元可以被用在不同的負載上。CPU主要支持輕量級AI工作負載,NPU用來支持一些持續性低功耗的AI負載,而GPU則服務於高吞吐量、高性能要求的負載。

最後來總結一下,Panther Lake的性能和能效都得到了明顯的提升,單線程性能在同功耗下較Lunar Lake提高了10%,綜合性能同功耗下提升了50%。在提供相同的多線程性能時,功耗比Arrow Lake-H降低了30%。GPU性能綜合提高了50%。新的NPU5將比上代的NPU4有超過40%的單位面積TOPS提升。整個SoC的功耗相比Lunar Lake下降可達10%,相比Arrow Lake則有高達40%的功耗降低。

Panther Lake還配備新的IPU7.5,支持增強型HDR,支持AI降噪和基於AI驅動的局部色調映射,可以提供更生動的視頻和照片。還支持Wi-Fi 7 R2與藍牙6,有更好的無線連接體驗。

預計Panther Lake會在明年CES上正式發佈,而搭載該處理器的筆記本電腦將在2026年第一季度陸續上市,還有3個月的時間給英特爾和OEM合作伙伴去打磨自己的產品,從處理器的規格來看,Panther Lake只會覆蓋U和H兩個產線,由於核心規模過小,HX的高性能處理器還是得靠老產品繼續服役。