一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

服務適用免費試用與隨用隨付方案,但受速率與價格限制;更高吞吐量、保留容量及正式環境 SLA 需使用專用端點

中文摘要

Cerebras 公開端點新增 Qwen 3.8 27B,文件標示模型有 270 億參數,免費與付費方案的上下文長度分別為 64k、128k,推論速度約每秒 1,500 個 token。官方稱公開端點使用原始未剪枝模型,只在儲存權重時選擇性採用 16、8 或 4 位元量化,敏感層維持完整精度,運算時解量化,activation、attention 與 KV cache 也不量化。服務適用免費試用與隨用隨付方案,但受速率與價格限制;更高吞吐量、保留容量及正式環境 SLA 需使用專用端點。

一龍馬判讀

每秒約 1,500 個 token 可讓互動式代理、程式輔助與即時產品介面大幅縮短等待時間,但這是官方約值,不能等同端到端延遲或穩定吞吐量。團隊仍須把輸入輸出計價、速率限制、快取是否省錢及專用端點成本納入評估。

原文節錄

Hacker News · altertable

Model Catalog - Cerebras Inference Documentation Index Fetch the complete documentation index at: /llms.txt Use this file to discover all available pages before

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

收錄日期
2026-09-04
來源
Hacker News Firebase API
抓取時間
2026/09/04 05:40(台北)
來源資料
328 分 · 107 則討論