隨著 AI 模型日益強大,其被濫用的潛力也隨之增加,同時也引發了對安全防護措施以阻止此類濫用的呼聲。AI 公司現在必須在尊重企業客戶隱私與監控使用情況以發現潛在問題之間,走一條微妙的鋼索。
OpenAI 似乎看到了超越其競爭對手 Anthropic 的機會,剛剛宣布了一種以隱私為中心的安全方法來監測濫用行為。該公司正在向部分客戶預覽一項名為「私人安全處理」(Private Safety Processing)的新服務。這是一個自動化系統,用於監測潛在的濫用行為,同時不保留任何客戶數據。
此系統顯然與 Anthropic 最近宣布的數據保留政策背道而馳。該政策激怒了一些客戶,允許該 AI 實驗室在「受保護模型」的情況下,保留用戶數據(所有會話及其中的對話)長達 30 天。該公司表示,這些模型包括所有 Mythos 級模型以及「未來具有類似功能的模型」。
這項於七月宣布的政策旨在提升安全性,讓實驗室能夠篩選和分析潛在的不當行為。然而,這讓一些處理大量敏感數據且不希望數據被 AI 實驗室儲存(或檢查)的企業深感擔憂。
OpenAI — 和大多數其他 AI 公司一樣 — 透過遵守一項稱為「零數據保留」(Zero Data Retention, ZDR)的政策,已經為客戶提供了相對程度的隱私。ZDR 使用 OpenAI API 內的代理,在每次會話的基礎上監測濫用行為。這樣,客戶數據不會被公司保留,但公司仍能掃描不良活動,而無需人工干預。值得注意的是,Anthropic 在很大程度上也遵守 ZDR — 除了「受保護模型」的情況下,例如 Fable。
OpenAI 表示,「私人安全處理」是一項擴大了 ZDR 範圍的新技術。它被描述為一種長期的安全監測形式,評估多個對話(而不僅僅是一個)的輸入和輸出。同樣,監測由一個代理進行,如果觸發,它會捕捉互動並跨會話分析以發現潛在濫用的跡象。
該公司的一位發言人告訴 TechCrunch,這項新技術有助於 OpenAI 偵測在多個會話中發生的惡意 AI 使用。一個惡意行為者 — 假設是試圖為網絡攻擊編寫惡意軟件的人 — 可能會分散其請求以避免被偵測到。「私人安全處理」可以分析這些多個對話以發現濫用跡象,而無需人工審查用戶的對話。
該公司表示,在系統觸發的情況下,它可能會向 OpenAI 發送一個「定義嚴格的信號」,警告某種特定類型的活動。根據該信號,OpenAI 可以決定是否「有必要執行」。發言人說,如果需要,OpenAI 將聯繫客戶以獲取更多背景信息或與他們合作解決問題,客戶可以自行決定是否與 OpenAI 分享數據。
相比之下,Anthropic 指出,雖然可能發生對客戶數據的人工審查,但僅限於「透過受控訪問路徑」,涉及「一小部分獲准審查人員」。該公司表示,每一次審查會話都「記錄在一個防篡改日誌中,審查人員無法壓制或修改」。
OpenAI 和 Anthropic 之間的企業競爭目前非常激烈,兩家公司都在尋找任何機會來獲得優勢。最近的一份報告顯示,OpenAI 的第二季度增長速度慢於 Anthropic。據報導,Anthropic 的年化收入運行率現為 650 億美元。Anthropic 的投資者表示,該公司可能以 2 萬億美元的估值進行首次公開募股(IPO),而 OpenAI 也在為其 IPO 做準備。