一龍馬/AI 情報站讀懂消息背後的脈絡
星期六
搜尋

HN 討論裡,原貼文作者補充 GitHub 連結與 34 ms p95 TTFA at 10 RPS 的說法,其他人則追問冷啟動、消費級硬體、語音品質與能否在手機端達成

中文摘要

Nari Labs 發文說明他們如何把 Qwen3-TTS 1.7B CustomVoice 的串流文字轉語音服務,調到單張 NVIDIA H100 SXM 上 10 RPS 時 p95 time-to-first-audio 低於 50 ms,並維持即時播放;文中稱在 20 RPS 時 p95 TTFA 仍低於 100 ms。團隊用 Poisson open-loop traffic 跑 5 分鐘基準測試,比較自家實作、vLLM-Omni、SGLang-Omni、VoxServe 與 M*,並指出他們開源實作與 benchmark;最佳化包含移除前導靜音、調整 codec frame 累積,以及把 Talker、Code Predictor、Codec 等異質工作納入同一排程思路。HN 討論裡,原貼文作者補充 GitHub 連結與 34 ms p95 TTFA at 10 RPS 的說法,其他人則追問冷啟動、消費級硬體、語音品質與能否在手機端達成。

一龍馬判讀

語音助理與即時對話產品的體感延遲,很大一部分卡在第一個可聽音訊;若開源 TTS 服務能把 TTFA 壓到這個區間,雲端部署成本與互動感都會改變。文章的成績建立在 H100 SXM 與特定模型、測試條件上,社群也提醒品質、暖機狀態與端側運行才是落地時的硬限制。

原文節錄

Hacker News · toebee

Pushing the Speed-Cost Frontier for Qwen3-TTS | Nari Labs NEW POST: PUSHING THE SPEED-COST FRONTIER FOR QWEN3-TTS Nari Labs Blog 20k+ Research Pushing the Speed

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

How we made a text-to-speech model respond in sub-50 ms

收錄日期
2026-08-22
來源
Hacker News Firebase API
抓取時間
2026/08/22 05:40(台北)
來源資料
71 分 · 13 則討論