一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

Strata 讓一般電競電腦在本機執行 1250 億參數等級的 Qwen3.8-Flash-Next,做法是把專家模型分散在 GPU、記憶體與 SSD 協同運算

中文摘要

README 給出 RTX 5070 搭配 64GB 記憶體的實測數據,並明列各壓縮版本所需的記憶體、安裝流程與 OpenAI 相容介面。限制是單次只處理一個請求,啟動時需載入數十 GB 且可能短暫卡頓,AMD 支援仍屬實驗性質。

一龍馬判讀

它降低了在大模型本地部署的硬體門檻,適合在意資料留存本地的開發者,但安裝體積約 70GB 且除錯仰賴社群文件,導入前要評估維護成本。

原文節錄

Hacker News

It writes its answers at 60-95 tokens per second

取得全文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Strata: Run a 125B-parameter AI model on a normal gaming PC

收錄日期
2026-10-01
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/10/01 06:00(台北)