一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

官方稱訓練使用約 34T tokens,視覺資料量比前代多 4 倍,並把 tokenizer 詞彙擴到 128K 以支援非拉丁文字

中文摘要

Liquid AI 在 Hugging Face 發布 LFM2.5-VL-3B,定位為可在自有硬體上執行的 3.1B 視覺語言模型,主打文件、螢幕 UI、物件 grounding、多圖輸入與 function calling。官方稱訓練使用約 34T tokens,視覺資料量比前代多 4 倍,並把 tokenizer 詞彙擴到 128K 以支援非拉丁文字。其基準表顯示,LFM2.5-VL-3B 在多項真實影像、OCR、螢幕理解與 grounding 任務上較 LFM2-VL-3B 明顯進步,但在部分項目仍落後較大或同級競品。

一龍馬判讀

需要端側或自架部署的產品團隊,可把它視為小模型視覺理解與工具呼叫的候選;但成績來自官方評測設定,實際延遲、記憶體占用與特定語言/介面表現仍要自行驗證。

原文節錄

Hugging Face

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge Hugging Face Models Datasets Spaces Buckets new Docs Enterprise Pricing Website Tasks…

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

收錄日期
2026-08-13
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/13 06:00(台北)
來源資料
官方來源