Anthropic 和 OpenAI 在週四發布了基於相同概念建構的產品:使用者不再與單一 AI 助理對話,而是管理由 AI 代理組成的團隊,這些團隊能分工合作並平行執行任務。這兩家公司同步發布的產品,是 AI 產業從對話夥伴轉向委派式勞動力的漸進式轉變的一部分,而這項轉變正發生在一週內,據報導該概念已導致軟體股市值蒸發 2850 億美元。

這種監督模式在實務上是否有效,仍是個懸而未決的問題。目前的 AI 代理仍需要大量人工介入來捕捉錯誤,且尚未有獨立評估證實這些多代理工具能可靠地勝過單一開發者獨立作業。

即便如此,兩家公司仍在全力投入代理開發。Anthropic 的貢獻是 Claude Opus 4.6,這是其功能最強大的 AI 模型的新版本,並搭配 Claude Code 中的「代理團隊」功能。代理團隊讓開發者能夠啟動多個 AI 代理,將任務分解成獨立的部分,自主協調並同時執行。

在實務中,代理團隊看起來像是一個分割畫面的終端機環境:開發者可以使用 Shift+向上/向下鍵在子代理之間切換,直接接管其中任何一個,並觀察其他代理繼續工作。Anthropic 將此功能描述為最適合「可分解為獨立、以讀取為主的任務,例如程式碼庫審查」。此功能目前為研究預覽版。

同時,OpenAI 發布了 Frontier,這是一個企業平台,他們將其描述為「聘請 AI 協同工作者,承擔人們在電腦上已在執行的許多任務」的方式。Frontier 為每個 AI 代理分配其獨特的身份、權限和記憶體,並連接到現有的業務系統,如 CRM、票務工具和資料倉儲。「我們從根本上正在做的是將代理轉變為真正的 AI 協同工作者,」OpenAI 的企業對企業總經理 Barret Zoph 告訴 CNBC。

儘管有關於這些代理是協同工作者的炒作,但根據我們的經驗,這些代理如果被視為放大現有技能的工具,而不是行銷語言所暗示的自主協同工作者,效果會最好。它們能快速產生令人印象深刻的草稿,但仍需要持續的人工糾正。

Frontier 的發布,是在 OpenAI 發布其 AI 編碼工具 Codex 的新 macOS 桌面應用程式三天後。OpenAI 高層將其描述為「代理的指揮中心」。Codex 應用程式讓開發者能夠平行運行多個代理線程,每個線程透過 Git 工作樹處理程式碼庫的獨立副本。

OpenAI 週四還發布了 GPT-5.3-Codex,這是一個為 Codex 應用程式提供支援的新 AI 模型。OpenAI 聲稱,Codex 團隊使用 GPT-5.3-Codex 的早期版本來調試模型本身的訓練運行、管理部署並診斷測試結果,這與 OpenAI 在 12 月的採訪中告訴 Ars Technica 的情況類似。

「我們的團隊對 Codex 在加速自身開發方面的能力感到驚嘆,」該公司寫道。在代理編碼基準測試 Terminal-Bench 2.0 上,GPT-5.3-Codex 獲得了 77.3% 的分數,比 Anthropic 剛發布的 Opus 4.6 高出約 12 個百分點。

所有這些產品的共同點是使用者角色的轉變。開發者或知識工作者不再僅僅輸入提示並等待單一回應,而是更像一個監督者,分派任務、監控進度,並在代理需要指導時介入。

在這個願景中,開發者和知識工作者實際上成為了 AI 的中層管理者。也就是說,他們不是自己編寫程式碼或進行分析,而是委派任務、審查輸出,並希望他們之下的代理不會悄悄地破壞東西。這是否會實現(或者這是否真的是個好主意)仍然是一個廣泛爭論的問題。

Opus 4.6 是 Anthropic 旗艦模型的一次重大更新。它繼承了 Anthropic 在 11 月發布的 Claude Opus 4.5。作為 Opus 模型家族的首次亮相,它支援高達 100 萬個 token 的上下文窗口(測試版),這意味著它可以在單一會話中處理更大的文本或程式碼量。

在基準測試方面,Anthropic 表示 Opus 4.6 在多項評估中,包括 Terminal-Bench 2.0(代理編碼測試)、Humanity’s Last Exam(多學科推理測試)和 BrowseComp(尋找難以找到的線上資訊測試)中,均超越了 OpenAI 的 GPT-5.2(比今天發布的模型更早的版本)和 Google 的 Gemini 3 Pro。

儘管應該注意的是,同一天發布的 OpenAI 的 GPT-5.3-Codex,似乎在 Terminal-Bench 上重新奪回了領先地位。在 ARC AGI 2(旨在測試解決對人類而言容易但對 AI 模型而言困難的問題的能力)上,Opus 4.6 得分為 68.8%,而 Opus 4.5 為 37.6%,GPT-5.2 為 54.2%,Gemini 3 Pro 為 45.1%。

一如既往,對 AI 基準測試應持保留態度,因為客觀衡量 AI 模型能力是一門相對較新且尚未穩定的科學。

Anthropic 還表示,在一個名為 MRCR v2 的長上下文檢索基準測試中,Opus 4.6 在 100 萬 token 版本上得分 76%,而其 Sonnet 4.5 模型得分為 18.5%。這個差距對於代理團隊的使用案例很重要,因為處理大型程式碼庫的代理需要追蹤數十萬 token 的資訊而不會丟失線索。

API 的定價與 Opus 4.5 相同,輸入 token 每百萬 5 美元,輸出 token 每百萬 25 美元,對於超過 20 萬 token 的提示,則為每百萬 10 美元/37.50 美元。Opus 4.6 可在 claude.ai、Claude API 和所有主要雲平台上取得。

這些發布發生在一週內,軟體股出現了異常的波動。1 月 30 日,Anthropic 發布了其代理生產力工具 Cowork 的 11 個開源插件,Cowork 於 1 月 12 日推出。Cowork 本身是一個通用工具,讓 Claude 可以存取本地文件夾以執行工作任務,但這些插件將其擴展到特定的專業領域:法律合同審查、保密協議分類、合規工作流程、財務分析、銷售和市場行銷。

到了週二,據報導投資者對此發布做出了反應,抹去了軟體、金融服務和資產管理股票約 2850 億美元的市值。高盛的一籃子美國軟體股票當天下跌 6%,是自 4 月份關稅驅動的拋售以來單日跌幅最大的一次。湯森路透領跌 18%,痛苦蔓延至歐洲和亞洲市場。

投資者之間的擔憂據稱集中在 AI 模型公司將完整的workflows打包,與現有的軟體即服務(SaaS)供應商競爭,即使這些工具是否能實現這些任務的判決仍懸而未決。

無論這些協同工作應用程式是否真正達到其宣傳效果,這種匯聚是顯而易見的。Anthropic 的產品負責人(企業)Scott White 為這種做法起了一個可能會讓一些人皺眉的名字。「過去一年半,大家都看到了軟體工程領域發生的這種轉變,『vibe coding』開始作為一個概念出現,人們現在可以用他們的想法做事情,」White 告訴 CNBC。「我認為我們現在幾乎正在轉向『vibe working』。」