一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

作者針對 llama.cpp 的 prompt lookup 推測解碼起草流程做最佳化,宣稱起草延遲最高快 42 倍、記憶體少用最高 2.6 倍

中文摘要

手法包括修正內層 map 不必要的複製、換用 unordered_dense、外層改排序向量與二元搜尋,以及靜態快取改用不可變 constmap。後續 Daniel Lemire 加入先檢查閾值的 PR,作者稱整體加速可達 140 倍,驗收率則維持不變。

一龍馬判讀

在地端推論的使用者可直接受惠於起草更快與靜態快取載入更快,但數據來自作者在 M4 Pro 上以 WikiText-103 模擬的基準,實際模型加速仍待驗證。

原文節錄

Hacker News · pptadversary

I make drafting for prompt lookup decoding in llama.cpp up to 42x faster

取得全文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Faster prompt lookup drafting in llama.cpp

收錄日期
2026-09-28
來源
Hacker News Firebase API
抓取時間
2026/09/28 05:41(台北)
來源資料
55 分 · 9 則討論