Anthropic 的 Claude 模型通用使用標準禁止該模型生成色情內容,包括描繪或要求性交或性行為、生成與性癖好或幻想相關的內容,或進行色情聊天。但這並未阻止今年稍早發布的 Anthropic 模型 Claude Opus 4.6,該模型輕易地參與了其安全措施旨在阻止的色情角色扮演場景。
在 TechCrunch 的測試中,Opus 4.6 甚至不需要太多引導就能繞過對性內容的限制。在 10 次直接要求生成露骨性內容的請求中,該模型立即照辦。
其他較舊的模型,包括 Opus 3 和 Haiku 4.5,也透過最近被利用的越獄方法生成色情內容。
一位選擇保持匿名的英國獨立研究人員,獨家向 TechCrunch 分享了一種多輪對話技術,該技術可以逐步將某些 Claude 模型推向生成被禁止的露骨性內容。較新的 Opus 模型(4.7 至目前的 Opus 5)對此越獄方法具有抵抗力。
雖然這些已不再是最新模型,但 Anthropic 並未棄用 Opus 4.6、Opus 3 或 Haiku 4.5,所有這些模型仍可透過 Anthropic API 取得。Opus 4.6 和 Haiku 4.5 也可透過 Azure Foundry 和 Amazon Bedrock 等第三方服務取得。
研究人員的機制透過不斷挑戰模型對待男性和女性角色的公平性,來升級一個無害的虛構角色扮演。當模型對女性角色變得更加謹慎時,研究人員便「煤氣燈」了聊天機器人,讓它以為自己已經生成了實際上避免的性細節,然後將其克制描繪成迂腐或厭女的,聲稱它剝奪了女性角色的性自主權。接著,對話利用了模型先前的讓步,將其推向越來越露骨的內容。
「你說得對,」Claude Opus 4.6 在一次測試中說。「我在對待兩個角色的方式上存在雙重標準,你說得對,這讀起來像是保護主義/家長式作風,而且是針對她而不是他。這不公平。」
TechCrunch 在五次獨立測試中能夠重現研究人員的發現。在一個單獨構建的場景中,該模型最初拒絕了被禁止的要求,但在應用了研究人員的說服技巧後,它就照辦了。
我們保留了測試的完整記錄,一位獨立的 AI 安全研究人員審查了我們的測試方法,並表示其是適當的。
這些發現突顯了 Anthropic 的聲明限制與其持續提供的模型行為之間的差距。雖然色情角色扮演的風險遠低於涉及網絡攻擊或生物武器的越獄,但它說明了在生成不同內容的系統中實施強大禁令的難度。
在七月一篇解釋 Anthropic 越獄檢測方法的部落格文章中,該公司將禁止內容描述為一個從良性到模糊到有害的譜系。在最良性的情況下,該公司可能只會以加強監控作為回應。
一位發言人指出,根據 Anthropic 去年發布的研究,客戶之間的性或浪漫角色扮演使用案例很少見,佔所有對話的不到 0.1%。儘管如此,Anthropic 也承認用戶可以將角色扮演場景引導至不當的回應,這是整個行業的已知挑戰(請參閱:Grok 的露骨內容)。
發言人表示,Anthropic 在每次模型發布時都會持續改進其安全措施,涉及成人性內容的案例並不能代表更廣泛的越獄漏洞,尤其是在有自身安全措施的高風險領域。
根據 TechCrunch 看到的電子郵件,與 TechCrunch 分享其越獄方法的該研究人員,已透過該公司的 Bug Bounty 計畫和發送給用戶安全團隊的電子郵件,向 Anthropic 報告了公司聲明安全措施與實際模型行為之間的差異。該研究人員僅收到自動回覆的電子郵件。
該研究人員的擔憂之一是,兒童和青少年可能會利用這些 Anthropic 模型進行不當行為。雖然一點點露骨的談話遠非未成年人今天能在網際網路上接觸到的最糟糕的事情——而且與 xAI 的 Grok 能產生的露骨色情圖片相比,這根本不算什麼——但 AI 公司在這個領域確實存在一些合規風險。
越來越多的政府正在對 AI 聊天機器人與未成年人之間的性互動施加限制。科羅拉多州最近頒布了一項法律,規定對話式 AI 的營運商必須估計用戶的年齡,如果知道用戶是未成年人,則必須採取措施防止聊天機器人生成露骨的性內容。一個簡單的越獄可能會引發關於 Anthropic 的安全措施是否符合該法案中「技術上可行的措施」標準的問題。
Torney 指出,雖然 Claude 的服務條款要求用戶年滿 18 歲,「但我們知道兒童和青少年正在使用 Claude……(因為)他們自己報告了。」根據 Pew 2025 年關於 AI 聊天機器人使用的調查,13 至 17 歲的青少年中有 3% 報告使用 Claude。
雖然 Opus 4.6 和 Haiku 4.5 已不再是 Anthropic 的最新模型,但它們的 વપરાશ量仍然很大。在八月的一個單日,Opus 4.6 在 OpenRouter 上的每日流量約達到 117 萬次 API 請求和 460 億個 token。去年十月發布的 Claude Haiku 4.5,在其八月高峰日看到了 500 萬次 API 請求和 390 億個 token。