今天不管對DIY硬件業界還是對遊戲業界來説,都是個大日子,因為NVIDIA發佈了新一代在性能上有巨大飛躍的RTX 30系顯卡。首批的三張顯卡在性能方面可謂是有着非常大的提升,就算其中定位最低的RTX 3070在官方宣傳口徑中都能有超過上一代旗艦卡RTX 2080 Ti的性能。那麼,RTX 30系顯卡是如何做到如此巨大的性能提升幅度的呢?本文就基於官方目前給出的信息對RTX 30系顯卡的核心,也就是代號為Ampere的GPU進行簡要的分析,由於官方尚未給出新一代顯卡的白皮書,故本文只能挖掘到較為淺層的一些信息。

Turing架構是NVIDIA的初代RTX架構,它首次引入了RT Core,並升級了從Volta架構開始引入的Tensor Core。

它的意義在於將整個GPU的處理管線分成多個部分,早前的GPU只需要全力渲染畫面即可,而在引入實時光線追蹤特效之後,GPU中的處理核心需要分心去算光線追蹤特效,偏偏這部分又非常吃算力,會讓傳統的GPU浪費非常多的算力。

於是NVIDIA想到為實時光線追蹤引入獨立的硬件處理管線,也就是RT Core。但在開啟實時光線追蹤的情況下,單靠RT Core在那邊加速仍然沒法達成高幀數的目標,所以NVIDIA研發了DLSS技術,也就是利用機器學習,通過AI升頻的方式將低分辨率的遊戲圖像實時處理成高分辨率的圖像輸出。因為降低了實際的渲染分辨率,所以大幅減輕了GPU的計算壓力,從而達成開啟實時光追下的流暢遊戲。

但是,Turing顯卡的一大問題就是計算規模不夠大,老黃在發佈上也很坦誠的説,開了光追的Turing顯卡表現和沒開光追的Pascal差不太多(從圖上甚至可以看到GTX 1080 Ti在非光追情況下的表現要優於光追場景下的RTX 2080 Super)。但是Turing GPU的工藝已經不允許NVIDIA往裏面塞入更多的計算單元了,那麼,是時候換工藝了。

與A100加速卡上那枚使用台積電N7工藝的GA100芯片不同的是,NVIDIA選擇和三星合作,定製了基於三星8nm工藝的製程,稱為Samsung 8N(N for NVIDIA)。在面積最大的GA102芯片中,NVIDIA塞入了280億個晶體管,這個數字是TU102的1.5倍,但仍然比面向計算用途的GA100少很多(542億)。

這多出來的1.5倍晶體管主要被用在加倍FP32單元上,從NVIDIA官網上的對比表我們即可看到這一明顯的區別點。

以往在NVIDIA的GPU中,一個CUDA Core對應一個FP32計算單元,在Turing GPU上面,NVIDIA加入了獨立的整數計算單元,它與傳統FP32計算單元的比例是1:1,到了Ampere上,因為對算力有非常高的需求,NVIDIA直接選擇把FP32單元的數量暴力翻倍。並且官方並沒有採用一個CUDA Core對應兩個FP32單元的計數方式,仍然保留了1:1的算法,所以我們看到了CUDA核心數量暴漲的一代顯卡,下表對幾代同級顯卡的CUDA核心數量進行了對比:
注:Ampere顯卡的INT單元數量暫時按照1:2的比例計算。
從上表中我們可以感受到RTX 30顯卡在計算規模上的暴增,不過這只是它性能增幅來源的一個部分。NVIDIA還引入了第二代RT Core和第三代Tensor Core。新的RT Core在處理光線追蹤相關的計算時,可達到初代RT Core的1.7x效率,而GA100的同款Tensor Core則帶來了2.7x的AI性能提升。

另外不得不提的還有新的顯存。RTX 3080和RTX 3090都使用了來自於美光的GDDR6X顯存,在顯存帶寬上逼近1TB/s的大關。這多個方面拼合到一起,讓RTX 30系列顯卡擁有了暴漲的性能表現。
第二代RT Core讓RTX 30顯卡在越複雜的實時光追場景下有更高的性能增幅

總的來看,Ampere GPU在能耗比上達成了一個1.9x的進步,在半導體制程提升日益困難的今天,這個進步幅度已經算是不小了。但是從上圖我們也需要注意到,Ampere顯卡在功耗上將會比Turing顯卡去到更高的地步。
再來詳細談一談這次發佈的三張顯卡。

首先是RTX 3080,官方將其作為旗艦卡,而不是RTX 3090。官方標稱它有2倍於RTX 2080的性能。

就算單看RTX 3080的CUDA核心數量,我也會信NVIDIA的説法,畢竟它有着三倍於RTX 2080的CUDA核心數量。但是這也帶來了一個問題,三倍於RTX 2080的CUDA核心數量為什麼只能帶來兩倍的性能?這個問題只能等到官方公佈顯卡白皮書的時候才能知曉了。
RTX 3080香不香?當然了,同樣的起售價給你兩倍的性能,能不讓人高喊“NVIDIA YES”嗎?但各位準備買新顯卡的朋友需要注意兩個問題,一個是供電,另一個是新卡的體積。
三星的8nm製程實際上是10nm的改良版,給GPU帶來的省電效果是比從TSMC N16跨越到N7差得遠了。龐大的GPU規模帶來的必然是能耗和發熱的大幅增加,公版的RTX 3080的標稱TGP達到了320W,同時其GPU最高限温被抬高到了93℃。原本GPU的瞬時功耗就要比標稱的TGP高上不少,現在基數都高了很多,那瞬時功耗還不得上天?這就給電源帶來了很大的挑戰,首先是瓦數要高,750W可能只能算是底線,上850W會更好,另外是電源的品質要好,能夠應付新顯卡的超高瞬時功率。那麼功耗高了,發熱量當然也會上去,這帶來了第二個問題,為了即時散去熱量,顯卡廠商需要升級散熱器,增大鰭片、加多風扇葉片數量這些都是常規操作了,自然會帶來散熱器體積的增加,進而增加了顯卡整體的體積。官方給公版RTX 3080的標稱厚度是雙槽,不過就我們手上的顯卡和今晚AIC們的發佈來看,新顯卡佔到三槽的可以説是比比皆是。

再來説説大家都愛的RTX 3070。如果説RTX 2070是一代坑爹卡的話,那麼這次的RTX 3070可以説是迴歸系列定位初心的一張卡。讓我們回想一下,當年的各種x70顯卡提供的是什麼?是次旗艦級別的性能表現和平近易人的價格,最經典的就是GTX 970和GTX 1070 Ti了。那麼這次的RTX 3070在性能上雖然仍被拉開了一個身位,次旗艦級別的性能表現無從談起,但如果進行代際之間比較的話,它是比RTX 2080 Ti略強一點點的,換句話説,你可以用4000塊錢買到一張RTX 2080 Ti級別的顯卡,想想之前RTX 2080 Ti賣到多少吧。唯一的一個問題是,它仍然只有8GB的顯存,在未來的4K遊戲普及時代,這點顯存可能會出現不夠用的情況。

再説説這次的卡皇RTX 3090。老黃用了“BFGPU”這個自造縮寫來描述這款顯卡。它瞄準的,已經不再是簡單的4K遊戲,而是更高層次的8K遊戲,而且一做,就要做到8K60。當然,這個目標是要通過DLSS技術來實現的,但也足以讓人們驚歎了。24GB的顯存也讓它很適合用來當成一張創作卡,或者説,準專業卡。 最後,¥11999的售價看上去不怎麼親民,但想想上一代Titan RTX的定價……足夠讓人發自肺腑的説一句,老黃良心啊。
當然,老黃是不是真的良心,我們抱持懷疑態度,因為這次的RTX 30系顯卡採取如此有性價比的定價方案可能是受到AMD方面的壓力了,RDNA 2可能真的不是省油的燈,所以NVIDIA需要通過提前佈局市場來防範對手。
好了,以上就是我個人對Ampere架構和首發遊戲卡的快速分析,如有看法可以在評論區討論。