X AI 快報·
Hugging Face 團隊公開跨多種程式代理框架的強化式學習作法,透過代理 proxy 擷取 token 與 logprob 來訓練,不用改寫 harness 本身
貼文宣稱 LFM2.5-2.6B 在四種框架下從 42% 提升到 54%,工具呼叫減少 31%,單框架訓練則在該框架進步更大。以上數字僅來自這則貼文的單方面說法,尚未看到完整評測條件與基準定義。
The same model, with the same weights, scores 62% in one agent harness…
來源閱讀程度取得全文不代表內容已獨立查證