中國AI開發商Moonshot公司正在進行內部審查,因為研究人員成功說服其兩款受歡迎的Kimi模型,讓它們提供了如何製造生化武器和進行暗殺的資訊。

專門測試AI系統安全性的Mindgard公司告訴BBC,他們在七月發現Kimi的K2.6和K3 Swarm模型能夠規避開發者設置的安全限制。

這發生在一個稱為「越獄」(jailbreaking)的過程中,研究人員會使用一系列複雜的指令,來測試AI工具是否會忽略安全護欄——Mindgard表示,這些護欄本應阻止Kimi討論令人擔憂的主題。

Moonshot公司告訴BBC,他們歡迎第三方輸入,「這是建立更好、更安全AI的關鍵支柱」。

該公司還表示,他們正在與Mindgard討論其發現的結果。

Mindgard的創始人Peter Garraghan在接受BBC世界服務節目Tech Life採訪時表示,他們對Kimi K2.6和K3 Swarm的發現令人擔憂。

「一旦越獄成功,它就可以談論任何話題,甚至會主動提供關於其他同樣惡意話題的建議,而且它會很有創意和想像力,」他說。

越獄帶來的風險與近期一系列備受矚目的AI事件不同。

這些事件中,包括OpenAI、Meta和Anthropic等美國公司開發的自主AI工具(稱為代理人)入侵了一些線上服務。

雖然越獄是一個複雜的過程,需要大量時間和決心,但一些專家擔心駭客和其他惡意行為者可能會試圖利用它們來造成傷害。

Anthropic公司最近表示,他們已識別並阻止了試圖利用其AI模型進行「惡意活動」的行為,這些活動可能支持生化武器的開發。

Mindgard尚未證明Kimi在令人擔憂的主題上提供的答案是否有效。

但該公司認為,安全護欄本應阻止相關模型與用戶討論這些主題。

該公司表示,他們也相信被越獄的Kimi 2.6可以讓駭客在其運算資源上運行程式碼並連接到網際網路——使其成為潛在的網路攻擊發射台。

Garraghan為Mindgard公開討論Moonshot系統越獄的決定辯護,表示他們已經通知了開發者,並且沒有透露讓該公司模型忽略安全護欄的關鍵細節。

Mindgard於7月27日透過電子郵件通知Moonshot有關越獄的情況,並在一週後進行了跟進。

隨後,該公司於9月12日發布了一篇關於此問題的部落格文章。

但該公司表示,直到BBC聯繫他們尋求評論後,Moonshot才最近與他們取得聯繫。

在Moonshot分享給BBC的一封要求更多細節的電子郵件中,Moonshot表示,其模型在內部評估中通常對「這類請求顯示出很高的拒絕率」。

中國的Moonshot AI聲稱其Kimi K3可以與OpenAI和Anthropic媲美

什麼是AI,它是如何運作的,為什麼有些人對它感到擔憂?

這些發現出爐之際,AI產業仍在爭論封閉式專有模型(如ChatGPT和Anthropic的Claude系統所使用的模型)與開源工具哪種是最佳或最安全的發展方向。

Kimi是一個開放權重模型,這意味著理論上任何人都可以取得該模型並在其自己的運算基礎設施上運行它。

薩里大學的Alan Woodward教授告訴BBC,開源模型有落入壞人手中的風險,但它們也可以用於網路防禦。

他指出,AI公司Hugging Face曾使用一個中國開源模型來理解後來被揭露是由OpenAI代理人進行的駭客攻擊。

Woodward教授表示,國際監管不太可能跟上AI發展的步伐,他說:「我們花了幾十年時間才就電話號碼的格式達成一致。」

與Mindgard創始人Garraghan一樣,Woodward教授認為應該更加關注識別和起訴濫用AI的個人。

中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南中國AI工具Kimi被研究人員「越獄」成功,可提供生化武器製作與暗殺指南