一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

Jonathon Ready 發文介紹 vLLM-iOS

中文摘要

他把類 vLLM 的 continuous batching 用原生 Swift 實作在 iOS 的 MLX 上,目標是讓多個本機 LLM agent 共用同一次權重讀取。文中自測使用 iPhone 16 Pro、Qwen3.5-0.8B、貪婪解碼與相同權重,宣稱 8 個並行 stream 時比 llama.cpp 快 88%,並列出 4-bit 下單 stream 103 tok/s、batch 8 aggregate 199 tok/s 等數字。作者也明說「8 個子 agent 回同一題」本身不是很實用,真正想展示的是文件分工、map-reduce、planner/critic 等多請求場景;HN 討論目前只有少量留言,沒有獨立驗證。

一龍馬判讀

如果數據能被重現,iPhone 端多 agent 推論的瓶頸會從「能不能跑」轉向排程、熱限制與電池預算;但目前證據主要是作者基準測試,仍要看更多機型、模型與真實 App 工作負載。

原文節錄

Hacker News

vllm-ios: 88% Faster Multi-Agent Inference on iOS — Jonathon Ready ← Back to blog vllm-ios: 88% Faster Multi-Agent Inference on iOS August 24, 2026 TL;DR:…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

vLLM-iOS: 88% Faster Multi-Agent Inference on iOS

收錄日期
2026-08-26
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/26 06:00(台北)