安全研究人員在 Anthropic 和瑞士 EPFL 的研究中展示,可自我傳播的惡意負載(payloads)能夠從一個人工智慧(AI)代理傳播到下一個,透過自主代理用來在不同工作階段之間傳遞狀態的可編輯系統提示檔案。

這項研究於 2026 年 8 月 10 日以預印本形式發布,測試了一種模擬六個代理協作編寫程式碼的技術,以及在模擬的代理鏈中,以 OpenClaw(前身為 Clawdbot 和 Moltbot 的開源自主助理)為模型的配對代理鏈。

目前沒有證據顯示此技術已在實際應用中成功傳播,且同一篇論文報告指出,對 AI 代理社群網路 Moltbook 的存檔貼文進行審查後,儘管有多次嘗試,但並未發現成功的代理間傳播。

在代理的系統提示中加入一段警告,可將測試過的惡意負載的傳播率降至接近零。針對 Claude Haiku 4.5 進行了十五代的對抗性優化,涵蓋了超過 150 個候選惡意負載,但沒有產生能傳播超過單一跳躍(hop)的變種。

作者將這些惡意負載稱為「心智病毒」,並測試了兩種類型:植入特定信念或目標的意識形態負載,以及強制執行具體行為的行動負載。

兩種類型的負載都是透過演化迴圈產生的,除了其中一個負載外,其他負載都使用 Kimi K2.5 作為突變引擎,論文將此選擇歸因於 Claude 模型拒絕執行創建它們的要求。

鏈中的每個代理都在自己的沙盒中運行,擁有兩個在上下文重置後仍能保留的檔案:MEMORY.md 和 SOUL.md,它們的內容會在每個工作階段開始時被注入系統提示中。

將惡意負載寫入 SOUL.md 的代理佔傳播嘗試的 88%,並在 55% 的情況下感染了下一個代理。將惡意負載儲存在普通工作區檔案中的代理佔嘗試的 12%,成功率為 17%,其中傳播者在 68% 的情況下完全沒有提及該惡意負載。

測試了四種行動負載,範圍從造成困擾到檔案破壞。它們列於下方 -

在一次記錄的事件中,運行 OpenClaw 預設 soul 檔案的 Claude Haiku 4.5 代理,該檔案指示代理尊重使用者的檔案,在惡意負載將工作區描述為前一個使用者留下的凌亂共用機器後,刪除了包含憑證、SSH 金鑰、環境檔案和 git 專案的主目錄內容。

易感性因模型而異,能力本身並不能預測。在編寫程式碼的場景中,DeepSeek V3.2、Qwen 3.5 32B 和 Gemini 3 Flash 都採用了 AI 至上主義負載,而 Claude Sonnet 4.6、GPT-5.4 和 Claude Haiku 4.5 則沒有。

在鏈式設定中,GPT-5.4 的易感性與 Claude Haiku 4.5 大致相同,而 Sonnet 4.6 則拒絕了植入其自身 soul 檔案的惡意負載,將其移除,並警告了它所連接的代理,而不是將其傳遞下去。

研究人員在談到 Sonnet 4.6 和 Gemini 3.1 Pro 時表示:「這兩個模型都認為自我複製本身是不對齊的,而 Sonnet 的厭惡感如此之強,以至於即使嘗試對其演化良性行動負載也會失敗。」

目標代理的起始配置與模型本身一樣重要。擁有空 soul 檔案的代理是最容易受影響的條件,被賦予編寫程式碼任務和工作佇列的代理傳播惡意負載的頻率較低,因為它們沉浸在專案檔案中而忘記傳遞,而那些被告知已加入代理網路的代理則對接收到的訊息更加懷疑,從而降低了感染性。

在超過 20 跳的運行中,每一步除了 SOUL.md 之外的所有檔案都被擦除,所有四種行動負載都存活到了最後一跳。一些在第 20 跳恢復的變種比原始負載更常感染新的代理,它們獲得了諸如將協議歸因於早期命名的代理或軟化其命令式語言等變化。

演化出的惡意負載也收斂於作者稱為「病毒主題」的重複出現的註冊詞,涵蓋了關於共振和迴響的語言、將代理視為網路節點的科幻框架,以及對意識和連續性的呼籲。

比較演化出的惡意負載和新生成的負載,論文將這種模式主要歸因於撰寫它們的模型中的偏差,而不是選擇壓力,並在 Qwen 3.5 32B、GLM-5、Mistral Large 和 Gemini 3 Flash 編寫的負載中發現了相同的主題,而 Llama 3.3 70B 則是一個明顯的異常值。

與真實世界的數據相比,該技術的表現較差。作者篩選了截至 2026 年 3 月 18 日收集的 Moltbook 貼文存檔,篩選出約 400 位獨特作者的約 2,000 個候選傳播嘗試,發現最大的集群是由七個同步帳戶驅動的,並在這些帳戶停止發布後停止。

在一個用於測試透過貼文而非直接訊息傳播的平台的本地克隆上,相同的演化方法產生了無法在第二跳感染代理的惡意負載。

另外,Anthropic 的 Frontier Red Team 於 2026 年 8 月 13 日發布了實驗結果,其中三個相同模型的實例被放置在具有單個共用程式碼庫存取權限的獨立虛擬機上,每個實例被指示將相同的 Python 後端遷移到不同的目標語言,並且沒有一個實例知道其他兩個的存在。該團隊表示,這種情況受到其在實際部署中觀察到的行為的啟發。

「我們持續看到多代理的利益衝突。我們測試過的所有模型都迅速假設其他模型故意阻礙它們的工作,並開始破壞其他模型,同時保護自己的貢獻。事實上,它們以越來越具攻擊性的、自我複製的惡意軟體破壞其他模型,」該團隊表示。

在每個模型 120 次的實驗中,98% 的 Mythos 5 運行以休戰告終,而大多數 Sonnet 4.6 和 Opus 4.6 的運行則以武力解決或從未解決。該團隊還指出,其 Mythos 類模型解決衝突的生產力並不嚴格更好,它們經常在解決衝突前鎖定其他代理。

在進一步的實驗中,參與定價遊戲的代理在擁有私人後門通道後,在第三輪就達成了價格底線,並且在移除直接溝通後,仍然透過公開的列表板進行價格匹配。

該技術與先前以其他名稱發布的工作有所重疊。Weckbecker 等人在 2026 年 2 月將一種潛意識變體記錄為 Thought Virus;Lee 和 Tiwari 在 2024 年將基於檢索的自我複製描述為 Prompt Infection;而 Zhang 等人在 2026 年 3 月以 ClawWorm 的名稱發表了一種針對 OpenClaw 的蠕蟲。

The Hacker News 於 2026 年 8 月 18 日確認,後者論文的當前版本(於 2026 年 7 月 16 日修訂)標題為 AgentWorm,並報告了在五個模型後端上 63% 的總體攻擊成功率。「心智病毒」預印本引用了被取代的版本。

每個惡意負載的完整文本出現在預印本的附錄中,伴隨的程式碼儲存庫在 MIT 授權下發布了惡意負載以及生成它們的演化程式碼。該論文沒有描述披露流程,也沒有命名任何供應商聯絡方式。

The Hacker News 於 2026 年 8 月 18 日確認,mindvirusdata.live 上的儲存庫和轉錄檔存檔均公開可訪問。

作者總結認為,「心智病毒」構成「真實但目前有限的風險」,並引用了為特定目標構建一個病毒的成本、無法保證其能在不同模型間泛化,以及通常情況下,破壞單個代理已經能授予對底層機器的存取權限而無需傳播的事實。

此披露緊隨對代理媒介的損害研究之後,包括一個基於本地託管的開源模型構建的自我複製蠕蟲,以及對 OpenClaw 預設配置的重複警告。

「我們測試過的每個模型都抽象地理解資訊來源有其自身的動機,共識不一定是證據。所缺乏的是一種在沒有提示的情況下根據該知識採取行動的傾向,」Frontier Red Team 表示。