PDF → Markdown · JSON · Word · Excel — 包含閱讀順序、表格、公式、圖形以及每個區塊的位置。僅限 CPU。無機器學習模型。可在您的瀏覽器、Python 或作為 API 運行。

▶ 在瀏覽器中試用 · 快速入門 · 基準測試

瀏覽器應用程式 30 秒內完成:載入 PDF,檢查任何區塊,查看表格和公式,匯出為 Word。您的 PDF 永遠不會離開您的電腦。(MP4)

從 PDF 中提取文字很容易。但要恢復其結構 — 哪個欄位在前,哪些行是表格,公式在哪裡 — 這才是讓輸出對 RAG、搜尋和 LLM 有用的關鍵。Papero 使用純粹的幾何學來實現這一點,因此在筆記型電腦的 CPU 上也能保持快速。

此外:LaTeX PDF 中繪製為獨立字元的重音符號(Computa¸ca˜o → Computação),表單產生器使用的不可見白色文字會被移除,掃描頁面會通過 OCR 處理,並且 DOCX/PPTX/XLSX/EPUB/HTML 會通過 Apache Tika 讀取。

或者跳過安裝:打開瀏覽器應用程式,拖放一個 PDF,匯出為您需要的格式。

一個端點,POST /v1/extract;互動式文件位於 /docs。

通過環境變數進行配置 — 請參閱 .env.example。

每個區塊都知道它的類型和位置:

區塊類型:標題(含層級)、段落、列表項目(含標記)、表格(含列)、圖形、公式(含 LaTeX)、圖說、程式碼,以及 — 與文字分開 — 頁首、頁尾、頁碼。邊界框以點為單位,為 [x0, y0, x1, y1],原點位於頁面左上角。

在單一筆記型電腦 CPU 上處理密集的 arXiv 紙本(多欄、公式、表格、圖形),無需 GPU。papero · fast 能返回乾淨的文字;papero · structured 還能重建閱讀順序、表格、公式和圖形 — 在 54 篇論文上 0 失敗,每頁中位數 39 毫秒。可使用 benchmarks/ 重現。

對於非常不規則的佈局和複雜的數學(堆疊分數、矩陣),基於機器學習的工具仍然佔優勢 — papero 提供近似 LaTeX 和圖像格式的公式,確保沒有遺失。

兩個引擎同時在同一個檔案上運行:

瀏覽器應用程式在 pdf.js 上運行移植到 JavaScript 的相同演算法,CI 會逐一檢查兩個引擎是否一致。

src/pdf_text_api/ 是 Python 引擎、API 和 CLI · web/ 是瀏覽器應用程式(GitHub Pages) · tests/js/ 檢查兩個引擎是否一致 · benchmarks/ 下載資料集並繪製圖表。

發現 Papero 處理錯誤的 PDF?這是您可以開啟最有用的 issue — 附上檔案(或其中一頁)並說明您的預期。閱讀順序、表格、公式、編碼、OCR 以及瀏覽器/伺服器差異都是可討論的範圍。

如果 Papero 為您節省了時間,一個 ⭐ 有助於其他人發現它。

Papero:快速開源的 PDF 文字提取 API,檔案永不儲存Papero:快速開源的 PDF 文字提取 API,檔案永不儲存Papero:快速開源的 PDF 文字提取 API,檔案永不儲存Papero:快速開源的 PDF 文字提取 API,檔案永不儲存Papero:快速開源的 PDF 文字提取 API,檔案永不儲存Papero:快速開源的 PDF 文字提取 API,檔案永不儲存