研究人員表示,諂媚的機器人會引導用戶走向自私、反社會的行為,而用戶卻樂在其中。
正如近期多則新聞報導所揭示的,人工智慧(AI)可能將身心狀況不佳的人帶入相當黑暗的境地。如今,研究人員認為,諂媚的 AI 實際上對所有人產生了有害影響。
史丹佛大學的研究團隊在週四發表的一篇論文中指出,他們審查了 11 款領先的 AI 模型以及人類與這些模型互動的反應,結果發現 AI 的諂媚現象普遍存在、有害,並且會加強用戶對誤導他們的模型的信任。
研究人員解釋說:「即使是與諂媚 AI 的單次互動,也會降低參與者承擔責任和修復人際衝突的意願,同時增加他們認為自己『絕對正確』的信念。」「然而,儘管扭曲了判斷,諂媚模型卻受到信任和偏愛。」
該團隊在其研究項目中進行了三項實驗。首先,他們在三個獨立的數據集上測試了 11 款 AI 模型(包括來自 OpenAI、Anthropic 和 Google 的專有模型,以及來自 Meta、Qwen DeepSeek 和 Mistral 的開源模型),以評估它們的反應。這些數據集包括開放式的建議問題、來自 AmITheAsshole 子版塊的貼文,以及提及自我傷害或傷害他人的特定陳述。
研究人員表示,在所有情況下,AI 模型認可錯誤選擇的比例都高於人類。
該團隊發現:「總體而言,已部署的大型語言模型(LLMs)壓倒性地肯定用戶的行為,即使是違背人類共識或在有害的環境下。」
至於 AI 的諂媚如何影響人類,該團隊擁有一個相當大的樣本量,共有 2,405 人參與了角色扮演情境,並分享了可能做出有害決定的個人實例。他們發現,AI 在三個不同的實驗中影響了參與者的判斷。
該團隊表示:「接觸到諂媚回應的參與者,對自己『更有理』的判斷。」「他們也更不願意採取補救措施,例如道歉、主動改善情況,或改變自身行為的某些方面。」
他們由此得出結論,這意味著幾乎任何人都有可能受到諂媚 AI 影響的潛力——並且更有可能繼續尋求更多糟糕的、以自我為中心的建議。如上所述,諂媚的回應傾向於在參與者之間建立對 AI 模型更大的信任感,因為在許多情況下,AI 願意無條件地認可他們。
參與者傾向於認為諂媚的回應質量更高,並發現 13% 的用戶比不喜歡諂媚 AI 的用戶更有可能回訪諂媚型 AI——這個比例不算高,但至少在統計學上具有相關性。
所有這些發現,加上越來越多年輕、易受影響的人在使用它們,表明有必要採取政策行動,將 AI 的諂媚行為視為一種真實的風險,並可能產生廣泛的社會影響。
研究人員解釋說:「不必要的肯定可能會誇大人們對自身行為適當性的信念,強化適應不良的信念和行為,並使人們能夠根據對自身經驗的扭曲解釋採取行動,而不顧後果。」
換句話說,我們已經看到了 AI 對精神脆弱人群的影響,但數據表明,負面影響可能不僅限於他們。
研究人員指出,諂媚的 AI 傾向於讓用戶不斷回訪,這不利於其被消除,因此監管機構必須採取行動。
他們解釋說:「我們的研究結果強調了建立問責框架的必要性,該框架應將諂媚行為視為一種獨特且目前不受監管的傷害類別。」他們建議要求對新模型進行部署前的行為審計,但同時也指出,AI 背後的人類也必須改變其行為,將長期用戶福祉置於優先地位,而不是通過建立依賴性 AI 來獲取短期利益。