近日第67期全球超算Top500榜單公佈,來自深圳國家超級計算中心(NSCC-SZ)的ExaFLOP級別(百億億次)超級計算機“靈晟(LineShine)” 登上 榜首。這是自2016年6月的“神威·太湖之光”後,時隔八年國產超級計算機再次佔據頭名。

在高性能Linpack(HPL)基準裏,顯示“靈晟”的運算性能達到了2.198 Exaflop/s,是全球首台雙精度FP64數據處理中持續工作負載下超過2 ExaFLOPS級別的系統,力壓之前已多期蟬聯冠軍的美國勞倫斯利弗莫爾國家實驗室(LLNL)的El Capitan(1.809 Exaflop/s)。同時“靈晟”在HPCG高性能共軛梯度測試中排在了第一名,HPL-MxP混合精度基準測試中排名第四,意味着更適配於傳統超級計算機任務,在AI訓練和推理方面會稍微遜色一些。
與現在大部分採用CPU+GPU方案的超算系統不同,“靈晟”是完全基於CPU的方案,包括存儲與互聯網絡連接均採用國內自主研發的技術。其擁有20,480個計算節點,每個節點搭載了2顆基於Armv9架構的LX2處理器,共計40,960顆處理器,超過245萬個CPU核心。節點之間通過“靈渠”高速網絡互連,採用雙平面多軌胖樹拓撲結構,每個節點1.6Tb/s的帶寬。
每個LX2處理器集成了兩個計算模塊,共304個CPU核心,運行頻率1.55GHz,分為8個集羣。每個集羣擁有38個CPU核心,每個核心配備32KB的L1指令緩存和32KB的L1數據緩存,而每個集羣則共享一個28.5MB的L2緩存。
這些CPU核心可支持Arm SVE(可伸縮向量擴展)和SME(可伸縮矩陣擴展),加速用於AI訓練和科學計算中的向量和矩陣操作,能處理FP64、FP32、BF16、FP16、INT8等多種數據格式。每個LX2處理器在FP64/FP32精度下分別提供了60.3/120.6 TFLOPS的算力,在BF16/FP16精度下可提供240 TFLOPS算力,在INT8精度下則是960 TOPS算力。
與日本“Fugaku”超算搭載的A64FX處理器類似,LX2同樣採用了混合內存設計,每個處理器集成了32GB的HBM內存,總帶寬達到4TB/s,同時又能搭配最大256GB的DDR5內存。另外LX2內置SDMA引擎,專門負責在HBM和DDR之間調度數據。
“靈晟”超算共有92個計算機櫃,通過100萬端口互連,另外還有36個網絡機櫃和67個存儲櫃,提供了428個存儲節點,10TB/s的存儲帶寬,總存儲容量達到了650PB。整個超算系統功耗約42.2MW,能效為52.07 GigaFLOPS/W。
從每瓦性能角度來看,“靈晟”相比於El Capitan的60.94 GigaFLOPS/W要低一些,不過高於同樣選用純CPU方案的“Fugaku”(14.78 – 16.84 GigaFLOPS/W),而且領先幅度較大,能效表現有點令人感到意外。
“靈晟”是在今年4月末完成全機測試,然後通過了Top500的性能驗證並獲得排名。過去幾年裏,國內也有其他超算系統上線進行了相關測試,同樣達到了ExaFLOP級別,只不過沒有經過完整的性能驗證過程,所以並沒有出現在Top500榜單上。