Claude Code 改變了我的工作方式,我從第一天起就是 Anthropic 創辦人研究的粉絲。過去一週經歷自己工作流程的惡化令人沮喪,這篇文章就是在這種沮喪中寫成的。我後來已修改內容,使其語氣更準確、公平,並刪除了我主張的細節。這篇文章目前在 Hacker News 上排名第一,否則我大概會直接刪掉。
Anthropic 正在對 Claude Code 進行 A/B 測試,這些測試正在積極地損害我的工作流程。我希望我能選擇退出。
我不認為 A/B 測試本身是錯誤的。我不認為 Anthropic 這樣做是為了故意損害任何人的體驗。他們顯然在試圖優化。但測試設計很重要,在不了解原因的情況下改變核心功能(如計畫模式)的可感知行為,會損害我的體驗。
我每月支付 200 美元購買 Claude Code。這是一個我用來完成工作的專業工具,我需要了解它的工作原理並能夠進行配置。我不希望應用程式的關鍵功能在未通知的情況下改變,也不希望在未經同意的情況下被納入破壞性測試。我們需要對如何引導這些工具(AI)負責,並且需要有能力這樣做。透明度是其中關鍵的一環。可配置性也是其中關鍵的一環。
工程師們每天都在抱怨 Claude Code 的退步。有時候你可能正在參與一項 A/B 測試卻不知道。
我的計畫開始變成簡潔的項目符號列表,沒有任何上下文。我問 Claude 為什麼它寫出這麼糟糕的計畫。它告訴我,它正在遵循特定的系統指令,將計畫硬性限制在 40 行,禁止上下文部分,並「刪除文字,而非檔案路徑」。
這感覺與透明度和負責任的 AI 部署/使用背道而馳。AI 工具需要更多的透明度,而不是更少。我需要能夠掌握我的流程,並在有人工介入的情況下引導 AI。
我不是部署 Claude Code 或其成本模型背後所需技術的專家。我認為這篇 Hacker News 的評論提供了值得考慮的見解:
據推測,Anthropic 在 Claude Code 的每個階段必須做出許多關於使用多少處理資源的選擇。如果他們將所有東西都最大化,他們每位用戶的損失會更大/利潤會更少。每月 200 美元的費用將會是每月 400 美元。對每個過程的每個部分進行 A/B 測試,以確定界線在哪裡(也許基於任務和用戶),似乎比任意選擇一個限制要好。
運行該測試的 Claude Code 工程師在討論串中回應道:
嗨,這就是我的測試!自 3.x 系列模型以來,計畫模式提示基本上沒有改變,現在 4.x 模型可以用更少的指導來成功。我的假設是,縮短計畫可以減少速率限制的命中次數,同時幫助人們仍然獲得相似的結果。我運行了幾個變體,作者(以及另外幾千人)獲得了最激進的版本,將計畫限制在 40 行。早期結果並未顯示對速率限制有太大影響,因此我已結束實驗。計畫有兩個目的:幫助模型保持正軌,以及幫助用戶對模型即將做的事情建立信心。這兩方面都很模糊、複雜且不明確!