一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

README列出RTX 5070產生回答每秒約53至94 tokens,讀入提示則逾千tokens;64GB記憶體是能裝下表列各種量化版本,並非未量化的完整尺寸

中文摘要

開源專案Strata的README聲稱在一般遊戲電腦上跑1250億參數的Qwen3.8-Flash-Next,做法是把專家模型拆給顯示卡、記憶體、處理器與硬碟分工,不必連上網路送到伺服器。README列出RTX 5070產生回答每秒約53至94 tokens,讀入提示則逾千tokens;64GB記憶體是能裝下表列各種量化版本,並非未量化的完整尺寸。HN使用者snehesht回報自家RTX 4090加128GB記憶體達每秒124 tokens,屬單一回報,未經獨立驗證。

一龍馬判讀

對想在本地跑大型模型的玩家與開發者而言,門檻可降到高階桌機,但代價是記憶體與硬碟需求大,且量化與速度取捨仍看硬體組合。

原文節錄

Hacker News · snehesht

Strata runs Qwen3.8-Flash-Next on a normal PC.

取得全文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

收錄日期
2026-10-05
來源
Hacker News Firebase API
抓取時間
2026/10/05 05:40(台北)
來源資料
495 分 · 249 則討論