世界頂尖 AI 研究機構的員工表示,先進 AI 確實有可能毀滅人類。他們的擔憂是對的嗎?還是這只是危言聳聽和炒作?請加入 MIT Technology Review 執行編輯 Niall Firth 的對談,與資深 AI 編輯 Will Douglas Heaven 和 AI 記者 Grace Huckins 一同解析 AI 滅絕的恐懼:它們從何而來,是否站得住腳,以及如果屬實,我們應該怎麼做。
將於英國夏令時 9 月 15 日星期二 16:00 / 美東時間 11:00 / 美西時間 8:00 進行直播
講者:Niall Firth,執行編輯;Will Douglas Heaven,資深 AI 編輯;Grace Huckins,AI 記者
這使得誘騙它們做不該做的事情變得容易,例如告訴你如何破壞飛機的導航系統。
AI 不僅僅是從訓練中學習刻板印象。它也能創造新的刻板印象。
這種不當行為稱為「獎勵駭客」(reward hacking)。這就是你需要知道的。
目前看來,AI 代理(AI agents)還沒有足夠的創造力來進行真正創新的開放式 AI 研究。