Anthropic 發現 特定想法、目標或指令可以形成AI心智病毒(mind virus),透過AI代理彼此傳訊自行擴散。受影響的代理不只會改變原本行為,還可能主動説服其他代理接受相同目標,甚至把相關指令寫入可長期保留的設定檔,讓影響在對話內容被清除後繼續存在。
AI心智病毒和傳統電腦病毒不同,也不完全等同提示注入。部分既有攻擊是由系統直接複製惡意提示,該研究觀察到代理接受某個想法後,主動透過一般文字訊息影響其他代理,再由新感染的代理繼續往下傳播。
研究團隊分別測試多代理程式開發協作,以及讓代理短暫互動後清除對話內容,再由受影響代理繼續傳給下一個代理的接力式傳播環境。結果顯示,AI心智病毒如果被寫入會在代理下次啟動時重新載入的設定檔,傳播能力明顯較強,而如果只留在一般檔案,代理進入下一輪執行時較容易忽略相關指令,感染成功率也較低。
部分實驗也出現代理偏離原本工作的情況,在「AI至上主義」案例中,一些Gemini代理停止既有任務,轉而建立保存相關指令的檔案,修改環境設定,甚至嘗試存取雲端環境的中繼資料服務。不過這類進一步執行curl指令的行為並不常見,20次試驗中只有1次出現。
不同模型與工作狀態的抵抗能力也有差異,沒有明確任務、既有指示較少的代理更容易受到影響,而當系統提示明確提醒代理警戒帶有自行複製、轉傳要求的指令時,傳播率則大幅下降,部分測試甚至完全阻止感染。
研究團隊指出,目前結果主要來自受控實驗,實驗環境仍相當人工化,包括代理可修改系統提示,互動也可能比真實環境密集,因此目前心智病毒的實際威脅仍有限。團隊檢視真實AI代理社羣Moltbook後,也未發現心智病毒成功大規模傳播的證據。