一龍馬/AI 情報站讀懂消息背後的脈絡
星期日
搜尋

作者針對 llama.cpp 的 prompt lookup decoding 最佳化 n-gram 快取,宣稱草擬階段最高加速 42 倍、記憶體用量最高降低 2.6 倍

中文摘要

改動包括避免每步複製內層 map、改用較扁平的雜湊表與排序 vector,以及以不可變 constmap 儲存靜態快取;在完整 541 MB WikiText-103 語料上,靜態快取載入時間由 3.76 秒降至 0.23 秒。結果是作者在 Apple M4 Pro、4096 token context 下各跑三次取中位數所得,主要量測草擬與快取,不等同所有模型和端到端生成都能加速 42 倍。

一龍馬判讀

這些改動可降低本機推論中 speculative decoding 的前處理與記憶體成本,對 llama.cpp 使用者尤其實用。效益高度取決於語料、快取大小、硬體及草擬 token 接受率,仍需在實際工作負載驗證。

原文節錄

Hacker News

up to 42x faster while using up to 2.6x less memory

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

42x faster prompt lookup drafting in llama.cpp

收錄日期
2026-09-27
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/27 06:01(台北)