一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

Mostik 宣稱以額外訓練的小型「橋接器」直接傳送兩個模型的隱藏狀態,兩端模型權重維持凍結,讓大型模型負責讀取問題、小型模型負責逐字生成

中文摘要

公司以 GLM-5.2 753B 傳給 Qwen-3.5 4B 的實驗表示,小模型補回與大模型差距的 50%、自身準確率提高 25%,並稱能以較少運算量達到中型模型的相近分數。這些數字出自公司自己的發布頁面,摘錄未提供完整任務清單與外部重現結果;把橋接器用於可觀測性也被團隊明確列為尚未證實的可能用途。

一龍馬判讀

若能重現,模型路由、顧問模型與子代理可不再只靠文字交接,降低昂貴模型的解碼成本;不過方法需要存取內部狀態,現階段較適合可自行部署的開放權重模型,也增加新的訓練、相容性與安全審查工作。

原文節錄

Hacker News

With the bridge attached, the small model closes 50% of that distance, which lifts its own accuracy by 25%.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Mostik.ai – latent communication between AI models

收錄日期
2026-09-07
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/07 06:00(台北)