AI 代理是一項風險極高的業務。即使僅限於聊天視窗內,巨型語言模型(LLM)仍會犯錯並表現不當。一旦它們擁有可與外界互動的工具,如網頁瀏覽器和電子郵件地址,這些錯誤的後果將變得更加嚴重。
這或許解釋了為何首個突破性的 LLM 個人助理並非來自必須顧慮聲譽與責任的主要 AI 實驗室,而是由獨立軟體工程師 Peter Steinberger 所開發。2025 年 11 月,Steinberger 將他的工具 OpenClaw 上傳至 GitHub,並在隔年 1 月底迅速走紅。
OpenClaw 利用現有的 LLM 讓用戶打造專屬助理。對部分用戶而言,這意味著交出大量個人資料,從多年電子郵件到硬碟內容。這讓安全專家極度擔憂。OpenClaw 帶來的風險如此龐大,以至於過去幾週湧現的安全部落格文章,恐怕需要花費好幾天才能全部閱讀。中國政府甚至公開警告 OpenClaw 的安全漏洞。
對此,Steinberger 在社群平台 X 上表示非技術用戶不應使用該軟體(他未回應本報導的採訪請求)。然而,市場對 OpenClaw 的需求明顯存在,且不限於能自行進行安全審核的人。任何希望進入個人助理市場的 AI 公司,都必須找到保護用戶資料安全的方案,這需要借鑒最先進的代理安全研究方法。
本質上,OpenClaw 是 LLM 的機甲外衣。用戶可選擇任何 LLM 作為駕駛員,該 LLM 因此擁有強化的記憶功能和定期自我設定任務的能力。與主要 AI 公司推出的代理不同,OpenClaw 代理設計為全天候運作,用戶可透過 WhatsApp 或其他通訊軟體與其互動。這使它能像超強個人助理,每天早晨提供個人化待辦清單、在你工作時規劃假期,甚至在空閒時啟動新應用程式。
但這種強大功能也帶來風險。若想讓 AI 助理管理收件匣,就必須授權其存取電子郵件及其中敏感資訊。若要代為購物,則需提供信用卡資料。若要執行電腦上的任務,如撰寫程式碼,則需部分存取本機檔案。
這些都可能出錯。第一種風險是 AI 助理犯錯,例如有用戶的 Google Antigravity 編碼代理據報刪除整個硬碟。第二種風險是駭客利用傳統攻擊工具入侵代理,竊取敏感資料或執行惡意程式碼。自 OpenClaw 走紅以來,安全研究人員已展示多種漏洞,讓缺乏安全意識的用戶暴露於風險中。
這兩種風險均可管理:部分用戶選擇在獨立電腦或雲端運行 OpenClaw,避免硬碟資料被刪除,其他漏洞則可用成熟的安全方法修補。
但我採訪的專家更關注一種更隱蔽的安全威脅——提示注入(prompt injection)。提示注入實質上是 LLM 劫持:攻擊者只需在 LLM 可能瀏覽的網站上發布惡意文字或圖片,或寄送至 LLM 讀取的收件匣,即可操控它。
若該 LLM 可存取用戶私人資訊,後果將不堪設想。多倫多大學電機與電腦工程教授 Nicolas Papernot 表示:「使用像 OpenClaw 這樣的工具,就像把錢包交給街上的陌生人。」主要 AI 公司是否敢放心提供個人助理服務,可能取決於他們能否有效防禦此類攻擊。
值得注意的是,提示注入尚未造成任何公開報導的災難。但隨著數十萬個 OpenClaw 代理在網路上運作,提示注入可能成為網路犯罪分子更具吸引力的策略。Papernot 指出:「這類工具激勵惡意攻擊者瞄準更廣泛的族群。」
「提示注入」一詞由知名 LLM 博主 Simon Willison 於 2022 年提出,距 ChatGPT 發布僅數月。當時已可預見 LLM 廣泛使用後將帶來全新安全漏洞。LLM 無法區分用戶指令與用於執行指令的資料(如電子郵件、網頁搜尋結果),對它們而言,這些都是純文字。因此,攻擊者若在郵件中植入幾句話,LLM 可能誤以為是用戶指令,從而執行任何行動。
提示注入是個棘手問題,短期內難以根除。加州大學柏克萊分校計算機科學教授 Dawn Song 表示:「目前沒有萬靈藥式的防禦。」但學術界正積極研究,已提出多種策略,未來有望讓 AI 個人助理更安全。
技術上,今天使用 OpenClaw 可避免提示注入風險:只要不連網即可。但限制 OpenClaw 讀取郵件、管理行事曆和線上研究,將大幅削弱 AI 助理的功能。防範提示注入的關鍵,是阻止 LLM 回應劫持嘗試,同時保留其執行任務的空間。
一種策略是訓練 LLM 忽略提示注入。LLM 開發過程中有一階段稱為後訓練,透過「獎勵」其適當回答問題、「懲罰」其失誤,讓模型從中學習。利用此法,可訓練 LLM 不回應特定的提示注入範例。
但此法需取得平衡:若過度拒絕注入指令,LLM 可能也會拒絕用戶的合法請求。且由於 LLM 行為本質帶有隨機性,即使訓練得當,也難免偶爾失誤。
另一方法是於提示注入抵達 LLM 前即阻擋,通常透過專門的偵測器 LLM 判斷輸入資料是否含有提示注入。但近期研究顯示,即使是表現最佳的偵測器,也無法完全捕捉某些類型的提示注入攻擊。
第三種策略較複雜,不是控制輸入,而是制定政策引導 LLM 輸出行為,防止其執行有害操作。例如,若 LLM 僅能寄信給少數預先核准的地址,就不會將用戶信用卡資料寄給攻擊者。但此政策也會限制 LLM 完成許多有用任務,如代表用戶研究並聯繫潛在職業人脈。
杜克大學電機與電腦工程教授 Neil Gong 表示:「挑戰在於如何準確定義這些政策,這是效用與安全的權衡。」
整個代理世界正面臨這項權衡:代理何時能既安全又實用?專家意見不一。Song 認為現階段已可安全部署 AI 個人助理,但 Gong 則表示:「我們還沒到那一步。」
即使 AI 代理尚無法完全防範提示注入,也有方法可降低風險,部分技術或可應用於 OpenClaw。上週於舊金山舉辦的首屆 ClawCon 活動中,Steinberger 宣布已聘請安全專家加入團隊。
目前 OpenClaw 仍存在漏洞,但這並未阻止眾多熱情用戶。OpenClaw GitHub 倉庫志願維護者 George Pickett 表示,他採取了部分安全措施:在雲端運行,避免誤刪硬碟資料,並設置機制防止他人連接助理。
但他尚未採取防範提示注入的具體行動。他了解風險,但未見 OpenClaw 發生相關事件報告。他說:「或許我的看法很天真,但我不太可能是第一個被駭的人。」