一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

LiquidAI 在 Hugging Face 發布 LFM2.5 系列的 DSpark draft model checkpoints

中文摘要

涵蓋 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 與 LFM2.5-8B-A1B,主打用 speculative decoding 在輸出品質不變的前提下降低解碼延遲。官方數據稱,在單張 H100 上最高吞吐提升 3.18 倍、M4 Max MacBook Pro 端側最高 2.87 倍;以 LFM2.5-2.6B 平均來看,H100 從 323 tok/s 到 864 tok/s,M4 Max 從 61 tok/s 到 139 tok/s。它也宣稱 function-calling 延遲平均降低 57%,並已支援 llama.cpp 與 SGLang,但測試條件是 batch size 1、temperature 0、最多 256 輸出 token,不能直接外推到所有服務情境。

一龍馬判讀

這把小模型與端側部署的瓶頸從「模型能不能跑」推向「互動延遲能不能接受」,對本機助理與代理式應用有實際工程價值。限制在於數據由官方提供,且加速效果受資料分布與接受率影響,部署者仍要用自己的工作負載重測。

原文節錄

Hugging Face

Up to 3.2x Faster Inference with LFM2.5-DSpark Hugging Face Models Datasets Spaces Buckets new Docs Enterprise Pricing Website Tasks HuggingChat Collections…

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Up to 3.2x Faster Inference with LFM2.5-DSpark

收錄日期
2026-08-21
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/21 06:00(台北)
來源資料
官方來源