Unsloth更新Dynamic v3.0 GGUF量化方法,相同檔案尺寸下提高量化模型精度

開源AI新創Unsloth 更新 Dynamic v3.0 GGUF量化方法,先推出Qwen3.8-27B的Dynamic v3.0量化版本。新版重新調整量化校準資料、模型層選擇方式與量化策略,希望在模型檔案大小不變的情況下,減少量化造成的精度損失。Unsloth自行測試顯示,相同檔案尺寸下,部分Dynamic v3.0版本的首選輸出(Top-1)準確率比其他量化版本高逾10%。

量化是縮小大型語言模型的一種方法,藉由降低模型權重使用的數值精度,減少檔案容量與執行時所需記憶體,讓大型模型較容易在一般硬體或本機環境執行,但也可能因此損失部分模型能力。Dynamic v3.0仍採訓練後量化,也就是模型完成訓練後再進行壓縮,不需要為了量化重新訓練模型。

前一代Dynamic 2.0已會依不同模型與模型層選擇不同的量化方式,並把支援範圍從混合專家模型擴大到一般模型。Dynamic v3.0進一步改用來源更多元的校準資料,並針對代理式程式開發、對話及多語言情境整理資料,也重新調整模型層的選擇方式,目標是讓壓縮後的模型輸出更接近原始模型。

Unsloth也新增一項量化品質評估,新版測試使用300組未納入校準資料的提示,涵蓋程式開發、數學、長文件與非拉丁文字等情境,再比較量化模型與較高精度BF16模型連續產生32個詞元時的輸出差異。詞元是模型處理文字的基本單位,相較只比較第一個輸出詞元的首選結果,連續比較多個詞元可進一步觀察量化後的生成方向是否逐漸偏離原始模型。

以Qwen3.8-27B為例,Unsloth公佈的9.83GB量化版本,首選輸出準確率約比次佳量化版本高8%。目前相關結果仍來自Unsloth自行建立的測試,因此較適合作為新版量化方法的官方測試結果,而非獨立效能驗證。

Dynamic v3.0產生的GGUF模型可搭配llama.cpp與Unsloth Desktop等推論工具使用。Unsloth也公開此次量化使用的校準檔案,讓開發者可自行測試、比較,或製作Qwen3.8衍生模型。