一龍馬/AI 情報站讀懂消息背後的脈絡
星期日
搜尋

HN 最醒目的回饋不是功能清單,而是使用者回報新模型與高併發下曾出現亂碼、重複 token 或卡死,維運者因此強調 A/B 部署與端到端測試

中文摘要

vLLM 0.28.0 聚焦 Kimi-K3、DeepSeek V4、推測解碼、Model Runner V2、分層 KV cache offload,以及更多 NVIDIA、AMD、Intel 與 CPU 路徑,並帶來多項預設值和破壞性變更。HN 最醒目的回饋不是功能清單,而是使用者回報新模型與高併發下曾出現亂碼、重複 token 或卡死,維運者因此強調 A/B 部署與端到端測試。

一龍馬判讀

推論框架的支援矩陣越廣,回歸面積就越大;升級應鎖定映像與模型組合,用真實提示集做正確性和長時間穩定性驗證,不能只看吞吐。

原文節錄

Hacker News · mrrrcs

This release features 584 commits from 270 contributors (76 new)!

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

vLLM v0.28.0

收錄日期
2026-08-30
來源
Hacker News Firebase API
抓取時間
2026/08/30 05:40(台北)
來源資料
48 分 · 16 則討論