一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

它預設不跑 OCR,而是逐頁判斷是否需要 OCR;原生環境可選擇只處理必要頁面,藉此避開不必要的模型與服務成本

Rust · ⭐ 17,872 · 🍴 1,218 · 🔥今日 +545

中文摘要

Firecrawl 的 pdf-inspector 是 Rust PDF 分類與文字擷取函式庫,可辨識文字型、掃描型、影像型與混合型文件,保留文字位置並轉成結構化 Markdown,也提供 Python、Node.js、CLI 與瀏覽器 WebAssembly 介面。它預設不跑 OCR,而是逐頁判斷是否需要 OCR;原生環境可選擇只處理必要頁面,藉此避開不必要的模型與服務成本。README 公布的 200 份 PDF 測試中,其整體分數為 0.875、完整語料處理時間為 0.470 秒,但這是專案方在 Apple M4 Pro、停用 OCR及指定版本下產生的結果,且標示更新日期為 2026 年 7 月 31 日,應以可重現分支自行驗證。

一龍馬判讀

RAG、文件搜尋與財務或法律資料管線可以先快速分流 PDF,只對真正需要的頁面啟用 OCR,降低延遲與基礎設施負擔。它最適合原生文字 PDF;掃描品質、破損字型編碼及複雜版面仍可能迫使系統回退到 OCR。

原文節錄

firecrawl/pdf-inspector

# pdf-inspector [![Crates.io](https://img.shields.io/crates/v/pdf-inspector.svg)](https://crates.io/crates/pdf-inspector) [![npm](https://img.shields.io/npm/v/@

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

收錄日期
2026-09-02
來源
github.com/trending
抓取時間
2026/09/02 05:50(台北)
來源資料
Rust · ⭐ 17,872 · 🍴 1,218 · 🔥今日 +545