一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

論文在 ALFWorld、Qwen3‑8B 上報告 96.9% success,並觀察到 harness calls 隨訓練變得更選擇性

中文摘要

EvoHarness-RL 把 Belief、Progress、Experience 暴露為可學習的外部 harness state,先用 supervised fine-tuning 教 action space,再以 cost-aware GRPO 學何時讀寫與壓縮狀態。論文在 ALFWorld、Qwen3‑8B 上報告 96.9% success,並觀察到 harness calls 隨訓練變得更選擇性。

一龍馬判讀

它把 memory/progress 管理從手寫 prompt 變成 policy learning,但證據目前集中在單一模擬環境。能否跨真實 coding、網路與錯誤工具保持穩定,是下一個關鍵。

原文節錄

Hacker News

Abstract page for arXiv paper 2608.05446: EvoHarness RL: Learning Self Evolving Runtime Harness for Long Horizon LLM Agents Long horizon LLM agents increasingly

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

EvoHarnessRL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

收錄日期
2026-08-11
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/11 06:00(台北)