一項來自蘇黎世聯邦理工學院(ETH Zurich)的最新研究指出,儘管業界普遍推薦使用 AGENTS.md 文件,但這類文件可能反而阻礙 AI 編碼代理的效能。研究團隊建議完全省略由大型語言模型(LLM)生成的上下文文件,並將人類撰寫的指示限制於無法推論的細節,例如高度特定的工具或自訂建置指令。

該研究團隊包括 Thibaud Gloaguen、Niels Mündler、Mark Müller、Veselin Raychev 與 Martin Vechev,指出目前約有 6 萬個開源倉庫包含 AGENTS.md 等上下文文件,且許多代理框架內建自動生成這類文件的指令,但尚無嚴謹的實證研究證明這些文件是否真的提升 AI 代理解決實際編碼任務的能力。

研究者建立了 AGENTbench,一個包含 138 個來自利基倉庫的真實 Python 任務的新資料集,避免了 AI 模型可能部分記憶的熱門基準測試偏差。團隊測試了四款代理(Claude 3.5 Sonnet、Codex GPT-5.2、GPT-5.1 mini 及 Qwen Code),在三種情境下進行比較:不使用上下文文件、使用 LLM 生成的文件,以及使用人類撰寫的文件。研究透過追蹤任務成功率(以倉庫單元測試判定)、代理步驟數及推理成本三項指標,評估倉庫層級指示的實際影響。所有利基倉庫均含有人類撰寫的上下文文件,前兩種情境則透過移除或替換這些文件來測試。

結果發現,LLM 生成的上下文文件反而降低效能,任務成功率平均下降約 3%,且代理步驟數增加,推理成本提升超過 20%。相較之下,人類撰寫的文件則帶來約 4% 的任務成功率提升,但同時步驟數也增加,成本上升最多達 19%。

在 AGENTS.md 文件中包含架構概述或倉庫結構說明,並未明顯縮短模型尋找相關檔案的時間。

為了解效能下降與成本增加的原因,作者深入分析代理的工具呼叫與推理模式。代理通常會遵循 AGENTS.md 文件中的指示,導致執行更多測試、閱讀更多檔案、進行更多搜尋及程式碼品質檢查。雖然這些行為更為詳盡,但往往對解決特定任務並非必要,顯示額外上下文使推理模型「思考」更久,卻未帶來更佳的最終修正結果。

作者強調研究結果與目前對 AI 編碼代理開發者的建議存在差距:

「我們發現所有上下文文件均會增加完成任務所需的步驟數。LLM 生成的上下文文件對任務成功率有輕微負面影響,而開發者撰寫的文件則帶來些微效能提升。

追蹤分析顯示,上下文文件中的指示通常會被遵循,導致更多測試與更廣泛的探索;但這些文件並未有效作為倉庫概覽。整體而言,我們的結果表明上下文文件對代理行為的影響有限,且可能僅在手動撰寫時才具價值。這凸顯了目前代理開發者建議與實際觀察結果之間的明顯差距,並促使未來研究尋找自動生成簡潔且與任務相關指導的原則方法。」

開發者對此研究反應熱烈。一位開發者指出,研究其實應促使開發者專注於撰寫有用的 AGENTS.md 文件:

「我讀過這項研究,我認為它的結論與作者建議相反——它實際上支持優質 AGENTS.md 文件的價值。AGENTS.md 文件最大的用途是提供模型無法即時推論的領域知識,這些知識是透過觀察代理因缺乏該知識而掙扎逐步累積的。這種情況在封閉源碼專案中非常常見,但在公開的 GitHub 專案中極為罕見,後者多為近期以大型語言模型為中心的小型專案。如果在這類專案中能看到 4% 的效能提升,那麼對於擁有高品質 .md 文件的大型專案,這些文件在與代理合作時是無價的。」

另一位開發者則認為上下文文件對開發者本身可能比對 AI 代理更有用:

「我在兩個專案中維護 CLAUDE.md 文件約三個月,改善效果明顯,但原因並非你預期的。實際提供的字元級上下文影響較小,反而是撰寫過程迫使你將原本只存在腦中的程式碼庫細節具體化,例如『我們因為 Y 的遺留限制而對 X 採用這種奇怪的模式』。一旦寫下來,代理能理解,團隊中新加入的人也能快速掌握。」

開發者可線上查閱該論文。AGENTS.md、CLAUDE.md 或 .cursorrules 等上下文文件的使用在 2025 年下半年逐漸普及,與 AI 編碼代理供應商的推廣活動同步增加。