更新:抱歉,一位評論者指出這可能只是基於最近修改時間的計數產生的偽影,而非原始提交日期。

使用原始提交日期(非最近修改日期)的數據

12/1 至 12/31 的數據為:2022 年:800 篇;2023 年:811 篇;2024 年:815 篇;2025 年:855 篇。

1/1 至 2/1 的數據為:2022 年:510 篇;2023 年:490 篇;2024 年:501 篇;2025 年:544 篇;2026 年:617 篇。

2/1 至 2/15 的數據為:2022 年:255 篇;2023 年:221 篇;2024 年:280 篇;2025 年:276 篇;2026 年:311 篇。

這些數據確實顯示了過去幾個月以來逐年顯著的增長,但並未達到其他數據所顯示的近乎翻倍的程度。hep-th arXiv 的末日尚未到來。

一段時間以來,我一直在猜測,當 AI 代理能夠撰寫出與長期以來令人沮喪的 hep-th 領域論文質量相當的論文時,會發生什麼。Sabine Hossenfelder 今天發表了文章《AI 正在帶來「理論的終結」》,她在文中提出了她悲觀的看法,認為過去由獲得補助金的首席研究員(PI)利用研究生/博士後撰寫大量以 PI 署名的平庸論文的體系即將發生劇變。一旦 AI 代理能夠比研究生/博士後更快地產出平庸論文,那麼任何人都可以參與進來,我們將被這些論文淹沒,不僅僅是那些 PI,而是所有人。

我決定查看 arXiv 的 hep-th 投稿,並通過使用 https://arxiv.org/search/advanced 進行簡單搜索,找出各個時間範圍內的 hep-th 投稿,快速生成了以下數據。

12/1 至 12/31 的數據為:2022 年:634 篇;2023 年:684 篇;2024 年:780 篇;2025 年:1192 篇。

1/1 至 2/1 的數據為:2022 年:583 篇;2023 年:531 篇;2024 年:626 篇;2025 年:659 篇;2026 年:1137 篇。

2/1 至 2/15 的數據為:2022 年:299 篇;2023 年:266 篇;2024 年:271 篇;2025 年:333 篇;2026 年:581 篇。

從這些非常有限的數據來看,過去幾個月的投稿數量相較於前幾年的穩定數字幾乎翻了一番。

我曾考慮花費我沒有的時間來深入研究此事,然後意識到「這是 AI 的工作!」當然,AI 代理在收集數據、弄清楚如何識別 AI 代理論文以及撰寫詳細分析方面,可以做得比我好得多。我仍然在抵制學習如何使用 AI 代理,所以這需要別人來做。

我對這裡的評論的主要問題之一是,越來越難以區分人類和 AI 生成的評論。在這種情況下,也許 AI 生成的評論會比來自真實世界的評論更好。因此,除非你有什麼真正實質性的內容(例如解釋為什麼這些數字不像看起來那樣,或者知道 arXiv 在對此做什麼),否則請克制評論。我會審核評論的相關性和幻覺,但不會僅僅因為評論是非人類生成的就刪除它們。

許多論文由於各種原因未能準備好並提交給期刊,包括提高質量到 PI 滿意提交所需的時間。我想這是否反映了積壓的突破以及來自傳統學術界和廣大公眾的更高的新基線?

SB,這與 arXiv 的投稿有關,與論文的處理方式關係不大。而且,我們談論的是文學規模的逐年翻倍,論文的數量太少不足以造成這種情況。

說真的,我希望有人能讓 AI 代理來比較 2025 年之前的文獻和當前文獻,獲取一些關於發生了什麼變化的實際數據,以便了解驅動這些變化的影響因素。

hep-ph 領域也出現了類似的快速增長(一月份,504 -> 601 -> 667 -> 1007)。有趣的是,直到你指出這一點,我才意識到論文數量的增加;相反,我注意到的是有趣論文的急劇減少。我們本地的期刊俱樂部在尋找值得討論的新論文方面遇到了很多困難。似乎出現了越來越多增量式的論文,計算隨機模型中的隨機事物,或者一次又一次地將技術 X 應用於數據集 Y。

為了獲得更完整的樣本,我確實會嘗試至少瀏覽我所屬的 hep-ph 小子領域中出現的所有論文。在 2024 年末,我注意到了第一篇明顯質量低劣的 AI 生成論文。它是一種奇怪的組合,夾雜著宏大的聲稱和完全瑣碎的內容(「這是一個 e^(-x) 的 Python 圖,所以你知道它看起來像什麼!」)。方程式都是來自物理學不同領域的標準方程式,但它們之間沒有任何實際聯繫。作者們在一個月內生成了 4 篇這樣的論文,都屬於不同的領域。

在 2025 年全年,我所在小子領域的論文發表速度從每月一篇加速到每周一篇。(我為它們保留了一個文件夾!)通過瀏覽這麼多論文,我發現了一些模式。例如,作者們通常是一群沒有經驗的學生,或者是一位很久沒有帶學生的老教授。此外,雖然論文對其新穎之處的重要性進行了越來越連貫的解釋,但在中間的關鍵部分,即新穎之處應該得到證實的地方,邏輯卻突然消失了。到了 2026 年,我停止了追蹤。

AI 將使物理學民主化的普遍說法顯然是錯誤的。優秀的物理學家可以將 AI 作為工具來撰寫優秀的論文,通過給予它好的問題和頻繁的反饋。其他人則可以通過給予它增量式(但至少定義明確)的問題和頻繁的反饋來產出平庸的論文。非物理學家根本無法提供有意義的反饋。他們只是用胡言亂語(「增加更多的拓撲分形複雜性和以太渦動力學」)污染大型語言模型,產生了 r/LLMPhysics 上的內容。也許會有一個 AI 不再需要高質量輸入的時代,但絕不會有一個 AI 從低質量輸入中受益的時代。

從社會學角度來看,人們將退回到私人渠道,如 Slack 或 Discord,或者在期刊俱樂部或咖啡機旁交談。當我還是個年輕學生時,資深人士鼓勵我每天查看 arXiv 來學習,但現在我遇到一些資深人士聲稱他們不再閱讀 arXiv 了。這絕不是第一次一個公開的在線論壇被毀掉。

如果你使用原始提交日期而不是最近提交日期進行正確搜索,那麼這種影響就會消失。通過使用最近提交日期,你的分析是有偏差的,因為我們非常接近 2026 年的開始,所以我們當然會看到一個高峰,這只是人們最近修改了他們的提交。

Jerry Ling,感謝你指出這一點。我已經發布了使用原始提交日期的數據。今年確實有所增長(約 13%),但遠小於我通過計算最近提交日期所看到的翻倍情況。

我和 Jerry 正在討論這個問題。以下是你一直在尋找的 AI 驅動的分析:https://github.com/sgnoohc/arxiv-submission-analysis

Philip Chang,謝謝,這太棒了!我仍然對為什麼修訂/替換數量有如此大的變化感到困惑。

查看一月份和二月份的數據,我確實看到了原始提交數量較去年同期有較大的增長(約 13%)。

我們的想法是,因為每當有新的修訂版本出現時,日期就會與最新的日期關聯起來,所以紅色(最近提交)一直在「向未來轉移並堆積在近期」,隨著時間的推移。

這可能意味著在過去,紅色積分應該低於藍色積分,雖然不是很清楚,但確實顯示藍色尖峰高於紅色。cs.AI 領域更為清晰,紅色始終較低,然後最近的修訂堆積在「今天」的時間附近。

由於 arXiv 的認可和審核規則發生了很大變化,解釋 arXiv 投稿統計數據變得相當困難。你還必須考慮到,在過去一個世紀左右的時間裡,科學家數量呈指數級增長,論文數量也隨之增長。然後還有一個問題是,世界某些地區(尤其是中國)的科學家數量急劇增加。

總而言之,如何解釋這些數字是一個棘手的問題。通常預期隨著投稿的增加(無論是在線存儲庫還是期刊),快速拒稿也會增加,所以我們很可能只看到了問題的一小部分。

你需要一個統計模型並運行模擬來了解正在發生的事情。我有一個理論:典型的模式是,你提交一篇論文(v1),大約一周後提交一個修訂版本以納入錯字和參考請求(v2),然後在期刊審核和接受後一段時間提交最終版本到 arXiv(v3)。

這可能會導致任何給定時間點的修訂版本出現高峰,因為當前月份有 v2 和 v3 的修訂版本。v2 修訂版本在 v3 修訂版本的基礎上產生了高峰。再過 12 個月,那些產生高峰的 v2 修訂版本將被 v3 修訂版本取代,並在審核過程中隨時間分散開來。

不過我對此不太確定,並希望進行模擬 🙂 我會這樣做:

* 每月新投稿 ~ Poisson(某個速率) * 其中每篇都在同一個月修訂 * 其中每篇都在 d ~ Poisson(審核時間月數) 個月後再次修訂

Sabine,如果 AI 代理確實達到了能夠撰寫與當前論文無法區分的 hep-th 論文的程度,人們應該開始看到投稿數量增加的明顯信號。還有很多其他因素在起作用(例如,中國科學家數量的增長),但我認為這些因素的影響將是長期的。

我還沒有看到任何試圖這樣做(使用 AI 代理撰寫 hep-th 論文)的報告,除了最近廣為宣傳的振幅結果。數學研究人員出現了很多報告,例如 Daniel Litt 在這裡 https://www.daniellitt.com/blog/2026/2/20/mathematics-in-the-library-of-babel。這些似乎表明,目前的 AI 代理有時是一個有用的工具,但還不能獨立完成一篇可發表的作品。在數學領域,問題有些不同,因為需要的是嚴謹的證明,可以由人類專家檢查或在 Lean 中形式化。

這似乎在幾乎所有科學領域都出現了同樣的問題。如果你相信新世界熱衷者所說的一半內容,我們應該很快就會看到確鑿的證據。過去一兩個月投稿量比去年增加了約 13%,在我看來是一個 2-3 西格瑪的信號。到年底,如果這是真的,應該是 5 西格瑪……

請注意,在過去一年中的某個時候,arXiv 開始列出 hep-th 的修訂版本及其完整摘要。這增加了論文在修訂後的曝光度,並可能產生額外的修訂動力。

https://andrewfowlie.github.io/blog/curious-trends-in-arxiv-submission-data.html

結果正如我所料。最近幾個月尚未被替換(未來將被替換)的事實,在當前月份產生了激增。

有些出現在 hep-th 領域的論文顯然是 AI 生成的,例如今天的 https://arxiv.org/abs/2602.22503 隨機挑選一段,一個在線 Chat-GPT 檢測器顯示 84% 的概率是 AI 生成的。這篇論文已經發表在 Nuclear Physics B 上 https://www.sciencedirect.com/science/article/pii/S0550321326000635

Peter,這篇文章和你的最後一點提出了有趣的觀察。首先,總的來說,明顯糟糕的 AI 寫作論文通常根本不會發布到 arXiv 上。然而,它們會被提交給合法的期刊,而期刊在過去一兩年裡看到了低質量投稿的巨大激增。其次,arXiv 可能會根據其標準將文章推遲審核甚至拒稿。然而,如果論文發表在聲譽良好的期刊上,這將會被重新考慮。因此,低質量的、AI 生成的垃圾投稿有動機提交給期刊,因為如果被接受,它可能會被發布到 arXiv 上。一旦作者在 arXiv 上發布,我認為後續的投稿也更有可能被接受(但可能仍然存在一些二次審核)。

我注意到了這篇論文(「預印本」在已發表於聲譽良好的期刊後提交給 arXiv)的情況。這很容易被 arXiv 拒稿(而且應該被拒稿……),如果期刊已經接受了,arXiv 就很難拒稿了。也許我們會看到傳統系統的顛倒,預印本比已發表文章更不可靠,期刊通過發表明顯的 AI 生成的垃圾內容來賺錢,而 arXiv 的審核員有時能夠阻止它。

我剛才嘗試用 AI 檢測器測試了另一段。它說有 87% 的概率是 AI 生成的。

在類別理論社區服務器上,我花了很多社交媒體時間在那裡,有些人正在追蹤 arXiv 上出現的、似乎是 AI 生成的或由不理解類別理論的人藉助 AI 寫作的新論文。一些候選論文:

Homotopical observables and the Langlands program via infinity-topoi, https://arxiv.org/abs/2505.22558

Recursive difference categories and topos-theoretic universality, https://arxiv.org/abs/2505.22931

Tunnel geometry and proliferation logic: a strict categorical equivalence, https://arxiv.org/abs/2601.00803

一些這樣的論文被 arXiv 審核員移至 math.GM(一般數學),但並非全部。

AI 檢測器很可能給出另一個無關的結果,因為許多作者使用 AI 來改善語法。例如,我停止寫 trough 而不是 through。

我看到的問題是,arXiv 的 hep 論文變得冗長而乏味。