一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

oMLX 是面向 Apple Silicon 的本機 LLM 推論伺服器,主打 continuous batching、分層 KV cache,以及可從 macOS 選單列管理

Python · ⭐ 18,951 · 🍴 1,644 · 🔥今日 +96

中文摘要

它提供 macOS App、Homebrew 與原始碼安裝,伺服器可讓 OpenAI-compatible client 連到 `http://localhost:8000/v1`,也有內建 `/admin/chat` 與管理儀表板。README 寫明需求是 macOS 15.0+、Python 3.11–3.13 與 M1/M2/M3/M4;部分 GLM-5.2、MiniMax M3、Qwen3.5 的原生 custom kernels 需要額外建置或使用官方 DMG。

一龍馬判讀

對 Mac 使用者來說,oMLX把本機模型常見的啟停、模型管理、快取與客戶端整合收進同一套服務。限制也很清楚:它鎖定 Apple Silicon 與新版 macOS,且某些模型若沒有 custom kernels 會退回較慢路徑,README 舉 GLM-5.2 在 M3 Ultra 上 fused DSA prefill 約 845 tok/s 對 fallback 約 29 tok/s。

原文節錄

jundot/omlx

oMLX LLM inference, optimized for your Mac Continuous batching and tiered KV caching, managed directly from your menu bar.

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

收錄日期
2026-08-18
來源
github.com/trending
抓取時間
2026/08/18 05:50(台北)
來源資料
Python · ⭐ 18,951 · 🍴 1,644 · 🔥今日 +96