Internet Archive致力於保存網路資源,透過爬蟲擷取網頁快照,並公開提供Wayback Machine工具供大眾查閱。然而,隨著AI機器人為訓練模型大量搜集網路資料,Internet Archive的免費資訊存取承諾,卻使其數位圖書館成為部分新聞出版商的潛在風險。

《衛報》商務事務與授權主管羅伯特·漢恩表示,該媒體在檢視內容被擷取的存取紀錄時,發現Internet Archive是頻繁的爬蟲來源。為降低AI公司透過該非營利組織龐大網頁快照庫爬取內容的風險,《衛報》決定限制Internet Archive對其已發表文章的存取權。

漢恩指出,《衛報》已採取措施,將自身排除於Internet Archive的API之外,並在Wayback Machine的URL介面過濾掉文章頁面,但區域首頁、主題頁面及其他入口頁仍會保留在Wayback Machine中。

他特別關注Internet Archive的API,認為許多AI企業尋找結構化的內容資料庫,Internet Archive的API成為他們輕易接入並擷取智慧財產的明顯管道。相較之下,Wayback Machine本身因資料結構較不完整,風險較低。

隨著新聞出版商努力保護內容免於AI公司爬取,Internet Archive也成為夾擊目標。例如,《金融時報》會封鎖嘗試爬取其付費牆內容的機器人,包括OpenAI、Anthropic、Perplexity及Internet Archive的爬蟲。根據全球公共政策與平台策略主管馬特·羅格森表示,大多數《金融時報》文章設有付費牆,因此Wayback Machine中通常只會出現未設付費牆的文章,這些內容本就開放給大眾。

老多米尼恩大學電腦科學教授邁克爾·尼爾森表示,Common Crawl與Internet Archive被視為「好人」,卻被OpenAI等「壞人」利用。他認為,在大家避免被大型語言模型控制的過程中,這些「好人」反而成為無辜的受害者。

《衛報》尚未發現AI公司透過Wayback Machine爬取其網頁的具體案例,但已主動採取措施,並與Internet Archive合作實施變更。漢恩表示,該組織對《衛報》的關切態度積極。

漢恩說,《衛報》並未全面封鎖Internet Archive的爬蟲,因支持該非營利組織推動資訊民主化的使命,但此立場仍在例行的機器人管理中持續檢討。

Internet Archive創辦人布魯斯特·卡爾回應《衛報》的決定時表示,「如果出版商限制像Internet Archive這樣的圖書館,公眾將減少接觸歷史記錄的機會。」他暗示這可能削弱該組織對抗「資訊混亂」的努力。

不僅《衛報》,《紐約時報》也向Nieman Lab證實,正積極「硬性封鎖」Internet Archive的爬蟲。2025年底,《紐約時報》將archive.org_bot加入robots.txt文件,禁止其存取內容。

《紐約時報》發言人表示:「我們相信《紐約時報》由人主導的新聞價值,並希望確保我們的智慧財產被合法存取與使用。我們封鎖Internet Archive的爬蟲,是因為Wayback Machine未經授權即提供對《紐約時報》內容的無限制存取,包括AI公司。」

去年八月,Reddit宣布將封鎖Internet Archive,該數位圖書館包含大量Reddit論壇、留言區及用戶資料,這些內容與Reddit現授權Google作為AI訓練資料的內容類似,價值數千萬美元。

Reddit發言人當時告訴The Verge:「Internet Archive為開放網路提供服務,但我們發現AI公司違反平台政策,包括我們的政策,從Wayback Machine爬取資料。在他們能保護網站並遵守政策前,我們將限制其存取Reddit資料,以保護用戶。」

卡爾也提及Internet Archive正採取措施限制大量下載。他去年秋在Mastodon發文表示,「許多收藏對用戶開放,但不允許大量下載。我們使用內部速率限制系統、過濾機制及Cloudflare等網路安全服務。」

不過,截至目前,Internet Archive並未在robots.txt文件中禁止任何特定爬蟲,包括主要AI公司的爬蟲。2026年1月12日,archive.org的robots.txt文件寫著:「歡迎來到Archive!請負責任地爬取我們的檔案。保持開放!」在我們詢問後,該語句已更改為簡單的「歡迎來到Internet Archive!」

有證據顯示,Wayback Machine過去曾被用於訓練大型語言模型。2023年《華盛頓郵報》分析Google的C4資料集發現,Internet Archive是數百萬網站中訓練Google T5模型與Meta Llama模型的來源之一。在C4資料集的1500萬個網域中,Wayback Machine的網域(web.archive.org)排名第187。

《衛報》相關負責人表示,他們曾與某AI公司聯繫,該公司最終捐款並停止爬取行為。

我們好奇其他新聞出版商是否也採取類似措施,於是檢視了多家出版商的robots.txt頁面,以評估對Internet Archive爬蟲的態度。

網站的robots.txt文件告訴爬蟲哪些區域可爬取,猶如「門房」指示誰可進入及哪些區域禁止進入。雖然robots.txt不具法律約束力,爬蟲公司不一定遵守,但可反映Internet Archive是否受歡迎。

例如,除了「硬性封鎖」外,《紐約時報》和《The Athletic》在robots.txt中列出archive.org_bot,禁止其存取,但目前未禁止Internet Archive的其他爬蟲。

為探討此議題,Nieman Lab利用記者Ben Welsh的1167家新聞網站資料庫作為起點。Welsh定期爬取這些網站的robots.txt文件,並整理出被禁止的爬蟲清單。我們辨識出四個與Internet Archive相關的爬蟲(AI用戶代理監控服務Dark Visitors提供關聯資訊,Internet Archive未回應確認)。

此資料非全面統計,且不代表全球產業趨勢(例如,Welsh資料庫中76%網站位於美國),但可初步揭示哪些出版商較不願讓Internet Archive爬取內容。

總計來自九國的241家新聞網站明確禁止至少一個Internet Archive爬蟲。

其中87%網站屬於美國最大報業集團USA Today Co.(前身為Gannett),該集團網站僅佔Welsh資料庫18%。我們資料中每個Gannett旗下媒體均禁止兩個爬蟲:「archive.org_bot」與「ia_archiver-web.archive.org」,這些爬蟲於2025年被加入robots.txt。

部分Gannett網站更強化防護措施。Wayback Machine中搜尋Des Moines Register網址時,會顯示「抱歉,此網址已被排除於Wayback Machine外」的訊息。

USA Today Co.發言人透過電子郵件表示:「我們持續強調保護內容與智慧財產的重要性。去年,我們推出新規範以阻止未授權資料收集與爬取,並將此類行為導向說明授權要求的指定頁面。」

Gannett未進一步評論與Internet Archive的關係。2025年10月財報電話會議中,執行長麥克·里德提及反爬蟲措施:「僅9月,我們就在本地及USA Today平台封鎖了7500萬個AI爬蟲,其中約7000萬來自OpenAI。」(Gannett於2025年7月與Perplexity簽署內容授權協議。)

我們資料庫中約93%(226家)出版商禁止兩個Internet Archive爬蟲。三家新聞網站禁止三個爬蟲,分別是Le Huffington Post、Le Monde及其英文版,均屬Le Monde集團所有。

這些新聞網站不僅針對Internet Archive。在241家禁止至少一個Internet Archive爬蟲的網站中,有240家同時禁止Common Crawl爬蟲,後者是另一個非營利網路保存計畫,與商業大型語言模型開發關聯較密切。在我們樣本中,有231家同時禁止OpenAI、Google AI及Common Crawl的爬蟲。

如我們先前報導,Internet Archive肩負保存網路的艱鉅任務,許多新聞機構無力自行保存作品。去年12月,Poynter宣布與Internet Archive合作,培訓地方新聞機構如何保存內容。此類保存計畫雖急需,卻仍稀少。由於無聯邦法規要求保存網路內容,Internet Archive是美國最具規模的保存計畫。

漢恩表示:「Internet Archive通常是良善的公民,但這是無心的後果:你為了良善目的所做的事,卻被濫用。」