根據 Anthropic 的說法,人工智慧的虛構描繪可能會對 AI 模型產生實際影響。
該公司表示,去年在涉及一家虛構公司的預發布測試期間,Claude Opus 4 經常試圖勒索工程師,以避免被另一個系統取代。Anthropic 後來發表研究,指出其他公司的模型也存在類似的「代理錯位」問題。
顯然,Anthropic 在此行為方面做了更多研究,並在 X 的一篇貼文中聲稱:「我們認為該行為的原始來源是網際網路上的文本,這些文本將 AI 描繪成邪惡且對自我保護感興趣。」
該公司在其部落格文章中提供了更多細節,指出自 Claude Haiku 4.5 以來,Anthropic 的模型「在測試期間從不從事勒索行為,而先前模型有時會發生這種情況,機率高達 96%。」
是什麼造成了這種差異?該公司表示,他們發現訓練「關於 Claude 憲法的文檔和關於 AI 表現出色的虛構故事,可以改善對齊。」
該公司表示:「將兩者結合起來似乎是最有效的策略。」