一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

NeoMME 是一組 2.6 億與 8 億參數的多語、多模態編碼器,以同一個雙向 Transformer 處理文字 token 與原始影像區塊,不依賴獨立視覺塔或因果語言模型

中文摘要

團隊表示,兩種尺寸都位於 ViDoRe v3 的 nDCG@10/模型大小 Pareto 前緣;其中 2.6 億參數版在 L40S、2048×2048 輸入下每秒可編碼約 51 頁。分層 token pooling 與非對稱量化則把晚期互動索引由每頁約 1.5 MB 壓至 6 kB,同時保留超過 95% 的基準 nDCG@10;模型權重已以 Apache 2.0 釋出並納入 Transformers。

一龍馬判讀

這套設計把視覺文件檢索的運算與儲存成本往下推,對大量 PDF、掃描文件與視覺 RAG 系統特別實用。效能數據仍出自發布團隊且集中於 ViDoRe v3,導入前應以自身語言、版面與硬體重新測試。

原文節錄

Hugging Face

NeoMME: an efficient Multimodal-native and Multilingual Encoder Hugging Face Models Datasets Spaces Buckets new Docs Enterprise Pricing Website Tasks HuggingCha

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

NeoMME: an efficient Multimodal-native and Multilingual Encoder

收錄日期
2026-09-04
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/04 06:00(台北)
來源資料
官方來源