一龍馬/AI 情報站讀懂消息背後的脈絡
星期日
搜尋

專案提供冷啟動重現指令、提交結果與模擬器實作,成熟度較接近可重現的研究原型,不是可直接部署的快取系統

中文摘要

這個 MIT 授權的研究型儲存庫以區塊粒度 prefix-cache 模擬器,重播 393 個 Claude Code 工作階段的 68,266 筆請求及 23,608 筆 Mooncake 請求,測試能否擊敗 radix-leaf LRU。作者加入存活機率、重算成本與工作階段整體淘汰三種機制後,結果全部比 LRU 差;在其容量受限設定中,10 秒內返回的請求占全部重算 token 的 33.1%,超過五分鐘者占 17.5%,而 300 秒 TTL 從未成為實際限制。專案提供冷啟動重現指令、提交結果與模擬器實作,成熟度較接近可重現的研究原型,不是可直接部署的快取系統。README 也明列模擬未涵蓋 GPU 執行、AgentX 到達時間為合成資料,且 Mooncake 命中率仍有無法解釋的 4 至 6 個百分點落差。

一龍馬判讀

對容量受限的代理式 LLM 服務,優先方向可能是壓縮、分層儲存、准入控制與工作集排程,而不是預測閒置工作階段何時回來。這項負面結果不能套用到由五分鐘 TTL 主導的供應商快取,也尚未證明其他真實工作負載無法勝過 LRU。

原文節錄

Hacker News · gauravapiscean

TTL-300s produced byte-identical results to LRU-leaf in every single run.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

LRU is harder to beat than the KV-cache papers suggest

收錄日期
2026-09-13
來源
Hacker News Firebase API
抓取時間
2026/09/13 05:40(台北)
來源資料
86 分 · 40 則討論