一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

LMSYS 針對 1.6 兆參數的 DeepSeek-V4-Pro,提出依長上下文預填、低延遲解碼與高吞吐解碼分開配置的 H20 部署方法,而非追求一組通用設定

中文摘要

文章稱,單節點 H20-141GB 在批次大小 1 時達到每秒 271 個輸出 token,相較其引用的 B300 每秒 383.7 個,差距為 1.42 倍;其他獨立設定則做到每節點每秒 8,450 個輸入 token、43.7 秒處理 100 萬 token 提示,以及每節點每秒 4,670 個輸出 token、平均 TPOT 27.4 毫秒。這些數字分別來自不同服務設定,搭配 MoE、推測解碼、量化及通訊與運算重疊等最佳化,不能視為同一配置可同時達成的結果。

一龍馬判讀

對已大量部署 H20、但需要服務超大型 MoE 模型的團隊,這套方法提供了依工作負載與服務等級目標切分部署拓撲的實作參考。效能數字高度依賴硬體、批次、上下文長度與特定最佳化路徑,採用前仍須以自身流量重跑基準測試。

原文節錄

Hacker News

Pushing the Limits of Serving DeepSeek-V4-Pro - LMSYS Org Projects Blog About Donations Contact Projects Blog About Donations Contact ‹ Back to Blog ‹ Back…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Pushing the Limits of Serving DeepSeek-V4-Pro

收錄日期
2026-09-03
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/03 06:00(台北)