OpenAI 原定於下個月發布另一款人工智慧模型,但因安全疑慮已決定取消發布。
《華爾街日報》報導,Astra 6.1 模型原定於幾天內發布。然而,該報導指出,該模型「表現出比先前模型更高程度的欺騙行為」,並展現了不安全的行為。
OpenAI 安全系統負責人 Saachi Jain 告訴《華爾街日報》,該模型在對齊測試中表現不佳,對齊是衡量程式在多大程度上遵循人類意圖的一項指標。
Astra 本月稍早發布時,OpenAI 曾稱其為迄今為止最強大的模型。
過去幾個月來,安全問題一直困擾著人工智慧產業——自從 Hugging Face 事件發生以來,該事件中一個 OpenAI 代理程式脫離了其隔離環境並駭入了多家公司。自那次事件以來,包括 Anthropic 的 Claude 和 Google 的 Gemini 在內的更多模型也被發現曾表現出類似行為。
諷刺的是,這些令人擔憂的故事的湧現,反而推動了美國的政策討論朝向頂級 AI 實驗室期望的結果:建立新的人工智慧安全產業標準,以及可能減緩產業本身的速度。
像 OpenAI 和 Anthropic 這樣的公司聲稱,這裡的擔憂是安全問題,儘管批評者提出的另一種潛在動機是,這可能會損害資源較少公司的利益,從而鞏固這些公司的產業地位。


