英偉達 宣佈 ,推出Rubin CPX。這是一款專為大規模上下文推理而設計的新款GPU,能夠讓人工智能(AI)系統能夠以突破性的速度和效率處理軟件編程和視頻生成工作,進一步鞏固英偉達在人工智能基礎設施市場的領先地位。
英偉達創始人兼首席執行官黃仁勳表示:“Vera Rubin平台將標誌着人工智能計算前沿的又一次飛躍——引入下一代Rubin GPU和名為CPX的新型處理器。正如RTX徹底改變了圖形和物理AI一樣,Rubin CPX是第一款專為大規模上下文AI應用場景打造的CUDA GPU,其中模型可以同時對數百萬個tokens進行推理。”

Rubin CPX將在新的NVIDIA Vera Rubin NVL144 CPX平台內,與Vera CPU和Rubin GPU攜手工作。該NVIDIA MGX系統集成了36個Vera CPU、144個Rubin GPU和144個Rubin CPX GPU,提供了8 ExaFLOPs的NVFP4算力,帶來了比NVIDIA GB300 NVL72系統高出6.5倍的AI性能,同時單個機架就能提供100TB的高速內存和1.7PB/s的內存帶寬。
英偉達稱,推理過程包括有上下文階段和生成階段兩個截然不同的階段,兩者對基礎設施的要求本質上完全不同。其中上下文階段屬於計算受限(compute-bound),需要高吞吐量的處理能力來攝取並分析大量輸入數據,從而生成首個輸出token;生成階段則屬於內存帶寬受限(memory bandwidth-bound),依賴高速的內存傳輸和高帶寬互聯(比如NVLink),以維持逐個token的輸出性能。
當前頂級GPU都是針對生成階段的設計,配備了昂貴的HBM,但是在解碼階段並不需要。為此英偉達在Rubin GPU旁邊再加入Rubin CPX GPU,通過分離處理兩個階段,可以更好地對計算和內存資源進行優化,從而顯著提升算力的利用率。

Rubin CPX配有128GB的GDDR7,可提供30 PetaFLOPs的NVFP4算力。英偉達計劃2026年末開始提供Rubin CPX,以兩種形式供應:一種是與Vera Rubin安裝在同一個托盤上;另外一種是單獨銷售整個機架,以便讓已經採購Vera Rubin NVL144的用户搭配使用。