英特爾“Project Battlematrix”軟件更新:優化AI推理性能

英特爾在今年5月 發佈 了一款可擴展且易於存取的工作站級至強平台,代號“Project Battlematrix,”幫助AI開發者解決其所面臨的難題。其支持最多八塊鋭炫Pro B60 24GB顯卡,實現多卡並行,擁有高達192GB的顯存,可運行高達1500億參數的中等規模且精度高的AI模型。英特爾希望通過簡化設計,搭配經過優化的最新推理軟件,加速其GPU與AI戰略。

近日英特爾 分享 了LLM Scaler container 1.0版本的最新進展,對於早期客户的支持至關重要,其中包括:

vLLM優化

  • 針對長輸入長度(>4K)的TPOP性能優化 - 在32B KPI模型上,40K序列長度的效能提升高達1.8倍;在70B KPI模型上,40K序列長度的效能提升高達4.2倍。

  • 相比於上次發佈,進行了性能優化,8B-32B KPI模型的輸出吞吐量提升約10%。

  • 逐層在線量化,以減少所需的顯存。

  • vLLM中的PP(pipeline parallelism)支持(實驗性)。

  • torch.compile(實驗性)。

  • 推測譯碼(實驗性)。

  • 支持嵌入、重新排序模型。

  • 增強的多模態模型支持。

  • 最大長度自動檢測。

  • 數據平行支持。

OneCCL 基準測試工具啓用

XPU管理員

  • GPU功耗

  • GPU固件更新

  • GPU診斷

  • GPU顯存帶寬

英特爾計劃在今年第三季度末推出LLM Scaler的強化版本,並新增額外功能,預計第四季度發佈完整的功能集。