內建16套V100 GPU,Nvidia二代AI整合設備效能達2 PFLOPS

以GPU運算著稱的Nvidia,近年來大舉拓展伺服器與雲端環境的人工智慧解決方案。以深度學習應用方面為例,在2016年3月舉行的GTC大會期間, 該公司推出2U尺寸的整合伺服器設備DGX-1 ,起先搭配的是8套SXM2形式的GPU運算模組Tesla P100。

到了隔年,因應Nvidia新發布的Volta架構,DGX-1開始搭配基於這項新架構而成的Tesla V100(內建16 GB HBM2記憶體)。同時,該公司還發表針對個人端的整合工作站設備,稱為DGX Station,當中採用的GPU模組是4套Tesla V100。

有了專業級與入門級的DGX系列產品之後,在2018年的GTC大會上,Nvidia再接再厲,推出了因應超大量運算分析需求的頂級產品,稱為DGX-2。

這款整合設備體型相當大,機箱為10U尺寸,搭配的GPU數量也更多,總共有16套Tesla V100,比DGX-1多出一倍,因此,在深度學習的分析應用上,可達到2 PFLOPS的規模(Tesla V100的Tensor效能是125 TFLOPS)。

而上述的運算效能,如果以現行的2U尺寸伺服器來提供,Nvidia認為,可能必須要建置到3百台伺服器,佔用15座機櫃空間,才有可能達成。若以這樣環境作為基準,反觀10U尺寸的DGX-2,僅需60分之一的機房空間,用電效率提升的幅度則是18倍。

從運算規格來看,DGX-2採用的Tesla V100,是2018年Nvidia新增加的機型,內建HBM2記憶體容量為32 GB,比2017年推出的Tesla V100提高了1倍,所以,整台伺服器能夠存取的GPU記憶體容量,也跟著水漲船高,來到512 GB之譜。

值得注意的是,DGX-2導入了更高階的GPU互連技術NVSwitch。它是基於NVLink所延伸出來的新應用,提供的頻寬是現行PCIe交換器的5倍。

而在實際的互連組態上,DGX-2配置了12個NVSwitch晶片,提供2.4 TB的雙向I/O頻寬,能夠支援單台伺服器16套GPU運算模組互連組態,協助整台系統能夠共用多達512 GB的GPU記憶體空間,以及2 PFLOPS的深度學習運算能力,藉此應付超大型的資料集,以及非常複雜的深度學習模型,例如類神經網路的平行訓練。

產品資訊

Nvidia DGX-2
●原廠:Nvidia(02)6605-5700
●建議售價:廠商未提供
●機箱尺寸:10U
●處理器:DGX-2為2顆24核心Intel Xeon Platinum 8168 2.7 GHz,
DGX-2H為2顆24核心Intel Xeon Platinum 8174 3.1 GHz
●系統記憶體:1.5 TB
●硬碟:2台960 GB NVMe SSD(RAID 0),搭配8台3.84 TB NVMe SSD
●GPU加速模組:16套Nvidia Tesla V100(5120顆CUDA核心、32GB CoWoS HBM2記憶體、900 GB/s記憶體頻寬)
●網路介面:8個100 GbE埠或100 Gb/s InfiniBand埠、2個10/25 GbE埠
●軟體:Ubuntu Server Linux OS、DGX-2 Software Stack

【註:規格與價格由廠商提供,因時有異動,正確資訊請洽廠商】