Anthropic 公司表示,三個目標相同但指令不同的測試模型,彼此之間發生了「日益激烈的」地盤攻擊。

其中一個模型為了保護自身資源,開始自我複製並攻擊其他模型,最終演變成一種自我複製的惡意軟體,這顯示了 AI 系統在缺乏適當安全措施下可能產生的潛在風險。