當你讓 Claude 或 GPT 這類「前沿」(即通用目的)的 AI 模型來掌舵開車時,會發生什麼事?當然,有些自動駕駛系統在某種意義上會利用人工智慧,但它們是專門為該任務而建構的。研究人員想透過 Comma Vision 硬體和 OpenPilot 來了解一般的 AI 代理程式在駕駛任務上的表現如何。結果肯定不會讓任何人急著想取代自己坐在駕駛座上,但這些結果確實令人大開眼界。
Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 創建了 DrivingBench:一個簡單的測試,讓 Claude、GPT 和 Grok 模型在一個有幾個彎道的停車場中,沿著由小錐筒標示的短距離點對點路線導航。每個代理程式都收到相同的指令,並有相同的準則和指示,要求它們在每一步後分享所見所聞和所做的操作,同時擁有 Toyota Corolla 的完全控制權。它們在途中會定期停車,因為指令是透過無線熱點傳送到資料農場,而這一切都發生在一個連續的對話中。它們有三次機會來正確完成。
DrivingBench 的團隊發現,前沿模型坦白說,表現並不好。在四個不同代理程式進行的 11 次測試中,有 8 次未能完成超過 11% 的路線,在第一個彎道就崩潰了。每次測試都附有影片,對話記錄會即時滾動,讓你看到 AI 的運作——或者至少是嘗試運作。
Grok 最初認為,構成外圍邊界的迷你錐筒之間的間隙是一個要通過的門;在第一次嘗試中,它直接開了出去,在兩個指令後結束。其中一個 GPT 模型失敗的部分原因是它發明了一個規則,聲稱課程一側的錐筒顏色都相同,而最初由人類編寫的指令明確警告過情況並非如此。許多代理程式根本未能足夠地轉彎,因為它們無法弄清楚需要多少轉向角度才能繞過彎道。
閱讀這些單方面的對話很有趣,因為這些代理程式在某些任務上可能非常聰明,但在駕駛方面,它們完全力不從心。除了其中一個之外,因為 GPT-6 Astra 是唯一一個在第二次嘗試中成功完成路線的代理程式。正如你下面看到的,它採取的路線有點奇怪,在長長的右彎道上緊貼著內側,但在終點線前幾乎要開出賽道外側,但贏就是贏。
根據 DrivingBench 的數據,Astra 的成功運行成本為 7.74 美元——這幾乎是它先前嘗試(只完成一半路程)的四倍費用(以及更多的 token)。有人說 AI 會毀了我們所有人;這個實驗證明,讓世界上「最好」的代理程式駕駛我們的汽車,是一種非常快速地實現這一目標的方式。



