一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

jundot/omlx 是針對 Apple Silicon 的本機 LLM 推論伺服器

Python · ⭐ 19,365 · 🍴 1,668 · 🔥今日 +366

中文摘要

強調 continuous batching、分層 KV cache,並可由 macOS 選單列管理。README 說明它可透過 DMG、Homebrew 或原始碼安裝,支援 OpenAI-compatible API、本機管理介面、CLI、背景服務,並能自動發現 LLM、VLM、embedding 與 reranker 模型;管理介面提供模型管理、聊天、benchmark 與多語系,且 CDN 相依項已 vendored 以利離線操作。限制同樣具體:需要 macOS 15.0+、Python 3.11–3.13 與 Apple Silicon;部分模型家族的原生 custom kernels 若未建置會退回較慢路徑,README 引用 GLM-5.2 在 M3 Ultra 上 fused DSA prefill 約 845 tok/s 對比約 29 tok/s 的測量。

一龍馬判讀

對使用 Mac 跑本機模型與程式代理工具的人,oMLX 把伺服器、快取、模型管理與 OpenAI API 相容性整合在同一套流程;但效能高度依賴硬體、macOS 版本與是否取得預編譯或自行建置的 Metal kernels。

原文節錄

jundot/omlx

oMLX LLM inference, optimized for your Mac Continuous batching and tiered KV caching, managed directly from your menu bar.

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

收錄日期
2026-08-19
來源
github.com/trending
抓取時間
2026/08/19 05:50(台北)
來源資料
Python · ⭐ 19,365 · 🍴 1,668 · 🔥今日 +366