一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

README 公開 200 份 PDF benchmark,聲稱整體 0.875、順序處理 0.470 秒,但該測試停用 OCR

Rust · ⭐ 17,320 · 🍴 1,197 · 🔥今日 +199

中文摘要

Firecrawl 的 pdf-inspector 是 Rust PDF 分類與文字擷取工具,能區分文字、掃描、圖片與混合頁面,依頁選擇 OCR,並輸出多欄、表格與 Markdown。README 公開 200 份 PDF benchmark,聲稱整體 0.875、順序處理 0.470 秒,但該測試停用 OCR。

一龍馬判讀

它適合在昂貴 OCR 前先做路由,能明顯降低文件管線成本。評估時要用自己的中文、表格與掃描資料,並把外部 OCR runtime 一起計入。

原文節錄

firecrawl/pdf-inspector

Fast Rust library for PDF classification and text extraction.

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

收錄日期
2026-09-01
來源
github.com/trending
抓取時間
2026/09/01 05:50(台北)
來源資料
Rust · ⭐ 17,320 · 🍴 1,197 · 🔥今日 +199