一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

作者提出 BITCOS,以密集存在位圖搭配壓縮符號向量,成本為 2-z bits/weight;它在 29 個模型中的 26 個更緊湊,最低達 1.485 bits/weight

中文摘要

這篇 arXiv 預印本指出,三元 LLM 的 {-1,0,+1} 權重並非等機率;在 29 個模型中,零權重最高達 51.5%,因此常用的五個 trit 壓入一個 byte、實際占 1.625 bits/weight 的格式未必最省。作者提出 BITCOS,以密集存在位圖搭配壓縮符號向量,成本為 2-z bits/weight;它在 29 個模型中的 26 個更緊湊,最低達 1.485 bits/weight。摘要報告矩陣向量乘法最高加速 1.28 倍,端到端解碼在 CPU 最高 1.18 倍、GPU 最高 1.27 倍,但只測試五種平台及特定 AVX、Intel Xe2 實作。

一龍馬判讀

對端側與伺服器推論團隊而言,這種布局可能同時降低模型儲存與解碼成本,但收益高度取決於零權重密度、解包核心及硬體架構,不能把最高加速數字套用到所有三元模型。

原文節錄

Hacker News · matt_d

BITCOS stores weights more compactly than the five-trit packing

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Breaking the 1.58-bit Barrier for Ternary LLMs

收錄日期
2026-09-17
來源
Hacker News Firebase API
抓取時間
2026/09/17 05:40(台北)
來源資料
28 分 · 0 則討論