一龍馬/AI 情報站讀懂消息背後的脈絡
星期六
搜尋

改以每項任務等權計算後,Fable 成本高 1%且差異不明確,DeepSeek 平均高 17%;Fable 幾乎所有節省又集中在單一任務

中文摘要

Quesma 的 Terminal-Bench 2.1 測試認為,RTK 壓縮終端輸出不等於降低 AI 程式開發費用:1,740 次嘗試中,Fable 的總成本下降 5%,DeepSeek 卻上升 5%,兩者通過率分別少 1 與 2 個百分點。改以每項任務等權計算後,Fable 成本高 1%且差異不明確,DeepSeek 平均高 17%;Fable 幾乎所有節省又集中在單一任務。測試使用 RTK 0.45.0,且作者記錄到一項後續版本已修正的錯誤,因此結論適用於所列模型、工具版本與基準,不代表所有工作流程。

一龍馬判讀

採用這類壓縮工具的團隊應衡量整項任務成本、成功率與代理程式回合數,而不是把刪掉的輸出位元組直接當成帳單節省。額外回合或工具相容性錯誤,可能抵銷甚至反轉壓縮效益。

原文節錄

Hacker News · michalwarda

Large reported token savings did not mean cheaper tasks.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

RTK reports token savings, but our cost benchmarks disagree

收錄日期
2026-09-12
來源
Hacker News Firebase API
抓取時間
2026/09/12 05:40(台北)
來源資料
133 分 · 64 則討論