一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

公司稱相較 GB300 NVL72,Vera Rubin 每百萬瓦吞吐量最高可達 30 倍,token 成本最高可降低 35 倍

中文摘要

NVIDIA 宣稱首次公布 Vera Rubin 在實際晶片上的 agent 工作負載效能,並以 SemiAnalysis 的 AgentX 工作負載、DeepSeek V4 Pro 模型進行測量。公司稱相較 GB300 NVL72,Vera Rubin 每百萬瓦吞吐量最高可達 30 倍,token 成本最高可降低 35 倍。NVIDIA 強調 agentic session 不同於聊天或摘要,因為上下文會在數百步中成長到數十萬 token;不過來源沒有提供完整測試方法、價格假設與可重現資料。

一龍馬判讀

如果這類 agent 工作負載成為資料中心主流,晶片評比會從單次推論速度轉向長上下文、多步驟、成本/能源效率;但廠商自測數據需要第三方驗證,尤其是成本模型與工作負載代表性。

原文節錄

NVIDIA · @NVIDIA

📢 First ever on-silicon NVIDIA Vera Rubin performance measured on how agents actually run.…

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

📢 First ever on-silicon NVIDIA Vera Rubin performance measured on how agents actually run. ⚡ Up to 30x more throughput per megawatt and up to 35x lower token cost than GB300 NVL72. Agentic sessions are nothing like chat or summarization workloads. Context grows across hundreds of steps and can reach hundreds of thousands of tokens. NVIDIA measured Vera Rubin performance on @SemiAnalysis_ AgentX workload consisting of real-world agentic coding trajectories using DeepSeek V4 Pro model.

收錄日期
2026-08-25
來源
Nitter RSS(公開貼文)
抓取時間
2026/08/25 06:11(台北)