英特爾在今年5月 發佈 了一款可擴展且易於存取的工作站級至強平台,代號“Project Battlematrix,”幫助AI開發者解決其所面臨的難題。其支持最多八塊鋭炫Pro B60 24GB顯卡,實現多卡並行,擁有高達192GB的顯存,可運行高達1500億參數的中等規模且精度高的AI模型。英特爾希望通過簡化設計,搭配經過優化的最新推理軟件,加速其GPU與AI戰略。

近日英特爾 分享 了LLM Scaler container 1.0版本的最新進展,對於早期客户的支持至關重要,其中包括:
vLLM優化
針對長輸入長度(>4K)的TPOP性能優化 - 在32B KPI模型上,40K序列長度的效能提升高達1.8倍;在70B KPI模型上,40K序列長度的效能提升高達4.2倍。
相比於上次發佈,進行了性能優化,8B-32B KPI模型的輸出吞吐量提升約10%。
逐層在線量化,以減少所需的顯存。
vLLM中的PP(pipeline parallelism)支持(實驗性)。
torch.compile(實驗性)。
推測譯碼(實驗性)。
支持嵌入、重新排序模型。
增強的多模態模型支持。
最大長度自動檢測。
數據平行支持。
OneCCL 基準測試工具啓用
XPU管理員
GPU功耗
GPU固件更新
GPU診斷
GPU顯存帶寬
英特爾計劃在今年第三季度末推出LLM Scaler的強化版本,並新增額外功能,預計第四季度發佈完整的功能集。