Cloudflare 的更新與改進。

編輯:此文章已編輯,以釐清有關網站指南的爬取行為。

現在您可以使用瀏覽器渲染(Browser Rendering)的全新 `/crawl` 端點,透過單一 API 呼叫來爬取整個網站,該端點目前處於開放測試階段。提交一個起始 URL,網頁將被自動發現、在無頭瀏覽器中渲染,並以多種格式回傳,包括 HTML、Markdown 和結構化 JSON。該端點是一個經過驗證的機器人(中介代理),預設遵守 robots.txt 和 AI Crawl Control ↗,讓開發者輕鬆遵守網站規則,並降低爬蟲忽略網站擁有者指南的可能性。這對於訓練模型、建置 RAG 管道,以及研究或監控網站內容非常有幫助。

爬取作業是異步執行的。您提交一個 URL,收到一個作業 ID,然後在網頁處理完成後檢查結果。

可在 Workers 免費方案和付費方案中使用。

注意:`/crawl` 端點無法繞過 Cloudflare 的機器人偵測或驗證碼,並且會自我識別為機器人。

若要開始使用,請參閱爬取端點文件。如果您正在設定自己的網站以供爬取,請查閱 robots.txt 和網站地圖的最佳實踐。