這點是不可接受的。這個 Bug 與模型幻覺或權限邊界缺失是截然不同的問題。

Claude 有時會自行發送訊息給自己,然後誤以為這些訊息來自使用者。這是我見過 LLM 供應商最嚴重的 Bug,但人們總是誤解問題所在,並將其歸咎於 LLM、幻覺或權限邊界不足。這些是相關問題,但這個「誰說了什麼」的 Bug 在本質上是不同的。

我在「我見過 Claude 中最嚴重的 Bug」一文中詳細闡述了這一點,其中我展示了兩個 Claude 自我給予指令,然後又認為這些指令來自我的例子。

Claude 告訴自己我的錯字是故意的,然後就部署了,之後還堅持是我說的。

這是一個 Reddit 討論串,其中 Claude 說了「拆掉 H100」,然後聲稱是使用者給予的指令。

來自 r/Anthropic — Claude 給自己一個破壞性指令並歸咎於使用者。

這不是重點。是的,AI 當然有風險,行為也可能難以預測,但經過幾個月的使用,你會對它會犯哪種錯誤、何時需要更密切地監控它、何時給予它更多權限或更長的自由度有「感覺」。

這類 Bug 似乎出現在「夾層」或「線束」中,而不是模型本身。它不知何故將內部推理訊息標記為來自使用者,這就是為什麼模型如此確信地說「不,你說的」。

以前,我認為這只是暫時的現象 — 我曾在一兩天內看到幾次,然後幾個月都沒再出現。但要麼是他們出現了迴歸錯誤,要麼是巧合,它只是偶爾出現,而人們只在它給自己執行壞事權限時才會注意到。

這篇文章在 Hacker News 上達到了第一名,而且這顯然是一個普遍存在的問題。這是 nathell 分享的另一個非常清楚的例子(完整對話記錄)。

來自 nathell — Claude 問自己「我要提交這個進度嗎?」並將其視為使用者批准。

有幾個人質疑這是否真的是我所假設的線束 Bug,因為有人回報在使用其他介面和模型(包括 chatgpt.com)時也出現了類似問題。一種模式似乎是,當對話開始接近上下文視窗的極限時,它會發生在所謂的「笨拙區」中。