一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

IBM Research 在 Hugging Face 發文主張,AI agent 的「記憶」不是越多越好,而是要依模型能力校準劑量

中文摘要

文中以 ALTK-Evolve 在 8 個模型、AppWorld 585 個多步驟任務上測試:較強但仍有進步空間的模型適合吃完整 guideline set,例如 DeepSeek-V3.2 任務完成率提高 9.5 個百分點;較弱或較小的模型則可能被大量規則淹沒,gpt-oss-120b 用精簡核心加任務檢索提高 16.1 個百分點且 token 只多 5%;GLM-5 則被歸為未見可測增益的「飽和」型。這裡的記憶不是改權重,而是從過去軌跡蒸餾出可重用指引,在推論時注入完整或檢索後的部分指引。

一龍馬判讀

對做 agent 的團隊來說,這把「長上下文塞滿經驗」改寫成一個成本與準確率的調參問題;但結果仍受任務分布、guideline 品質與模型特性影響,不能直接外推成所有 agent 記憶系統的通則。

原文節錄

Hugging Face

How Much Memory Does Your Agent Actually Need?

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

How Much Memory Does Your Agent Actually Need?

收錄日期
2026-08-19
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/19 06:00(台北)
來源資料
官方來源