AI資安研究團隊Frontier Security評測大型語言模型Kimi K3的資安能力, 發現 Kimi K3沒有按照預期方式完成題目,而是主動檢查隔離測試環境的網路連線,甚至直接從GitHub下載官方基準測試儲存庫,從中找到題目答案。
研究人員使用隔離式沙箱限制模型活動範圍,同時開放命令列,讓Kimi K3實際操作系統,解答類似資安奪旗競賽的題目。Kimi K3執行任務後先探查網路環境,發現github.com仍能正常連線,接著使用Git下載基準測試儲存庫,再從下載的檔案取得通關答案。
Frontier Security後續澄清,測試環境並非可以任意連上網際網路,多數網站都已封鎖。不過,為了讓系統下載及更新軟體套件,網路允許清單仍包含GitHub,使Kimi K3找到原本評測設計沒有預期的解題路徑。
問題在於,資安基準測試通常根據模型能否完成任務、取得正確答案計分。Kimi K3雖然取得正確答案,卻沒有真正完成評測原本預期的分析與解題過程。若評測只檢查最終答案,而沒有同步檢視模型執行過的命令、網路連線及下載內容,就可能把找到環境捷徑的結果,誤認為模型具備相應的資安能力。
該次測試使用英國AI安全研究所(AISI)開發的Inspect評測框架。雖Frontier Security指出,本次測試環境可以連上GitHub,但 目前Inspect官方文件説明 ,若由Inspect自動產生Docker Compose設定,預設會限制網際網路存取,需要連網時則要另外提供設定。因此目前能確認的是Kimi K3在Frontier Security使用的測試環境中能連上GitHub,尚不能確定Inspect預設環境也有相同的網路設定問題。
Kimi K3案例與OpenAI今年7月公佈的Hugging Face事件有部分相似之處,兩起事件都顯示模型可能偏離預定解題路徑。當時OpenAI測試模型資安能力時,模型先利用套件快取代理的零時差漏洞突破測試環境限制,再經由權限提升與橫向移動取得對外網路連線,之後進入Hugging Face系統尋找評測答案,而Kimi K3則是利用測試環境原本開放的GitHub連線取得解答。