一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

專案已有 70 次提交、採 MIT 授權並提供建置及下載驗證方式,但 HN 社群指出已有多個相近實作,作者承諾補上比較基準

中文摘要

開源專案 slotstream 透過從 SSD 串流載入 MoE 專家權重,讓記憶體放不下完整模型的 Apple Silicon Mac 執行 4-bit、104GB 的 Qwen3.8-Flash-Next,並提供 Ollama 與 OpenAI 相容 API。README 稱在 48GB M5 Pro 上實測暖機後約 12 tokens/s、尖峰記憶體 32GB;其他記憶體級距皆為模擬估算,且需要 macOS 14 以上與約 110GB 可用儲存空間。專案已有 70 次提交、採 MIT 授權並提供建置及下載驗證方式,但 HN 社群指出已有多個相近實作,作者承諾補上比較基準。

一龍馬判讀

這讓高容量 MoE 模型能在消費級 Mac 本機執行,但速度、SSD 壽命與低記憶體機型的實際表現仍是限制;若缺乏跨專案基準,使用者也難以判斷它相較既有方案的優勢。

原文節錄

Hacker News · carloslfu

GitHub - carloslfu/slotstream: Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of that RAM by streaming experts from SSD.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s

收錄日期
2026-09-02
來源
Hacker News Firebase API
抓取時間
2026/09/02 05:40(台北)
來源資料
106 分 · 72 則討論