一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

它預設不做 OCR,原生環境可只把必要頁面送入本機 PP-OCRv6 Small,藉此避開不必要的 OCR 成本;PDFium、ONNX Runtime 與模型檔也維持外部依賴

Rust · ⭐ 18,453 · 🍴 1,245 · 🔥今日 +589

中文摘要

Firecrawl 的 pdf-inspector 是 Rust PDF 分類與文字擷取函式庫,可判斷文字型、掃描型、影像型或混合 PDF,保留位置資訊並轉成含標題、表格、清單與多欄閱讀順序的 Markdown;另提供 Python、Node.js、瀏覽器 WebAssembly 與 CLI 介面。它預設不做 OCR,原生環境可只把必要頁面送入本機 PP-OCRv6 Small,藉此避開不必要的 OCR 成本;PDFium、ONNX Runtime 與模型檔也維持外部依賴。README 所列 200 份文件、關閉 OCR 的專案方基準中,版本 0.2.6 整體分數為 0.875、完整處理時間為 0.470 秒,但該比較只涵蓋本機非模型式解析器,結果並非所有 PDF 工作負載的通用結論。

一龍馬判讀

文件檢索、發票、研究報告與法律資料管線可先快速分流原生文字和需 OCR 的頁面,減少延遲與外部服務支出,同時保留較完整的版面結構。掃描品質、破損字型編碼及複雜版面仍可能迫使系統回退至 OCR,而且效能與準確度數字來自專案公布的特定語料、硬體與設定,部署前應用自家文件重測。

原文節錄

firecrawl/pdf-inspector

# pdf-inspector [![Crates.io](https://img.shields.io/crates/v/pdf-inspector.svg)](https://crates.io/crates/pdf-inspector) [![npm](https://img.shields.io/npm/v/@

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

收錄日期
2026-09-03
來源
github.com/trending
抓取時間
2026/09/03 05:50(台北)
來源資料
Rust · ⭐ 18,453 · 🍴 1,245 · 🔥今日 +589