一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

Factory.ai 的研究文章分析為何 coding agent 在長週期軟體任務上會太早停手,主張問題常不是模型不能繼續實作,而是它沒有先建立完整的完成標準

中文摘要

研究以 ProgramBench 的 24 個任務與三個模型比較單一代理人和多角色系統;在重建 gdal 的例子中,單一 Droid 寫出 1.7 萬行 C++、達到 36% 行為相似度,但在未耗盡時間或預算下自行判定完成。多角色版本先建立可執行的完成標準再實作,gdal 重建成長到 11.5 萬行並達到 90% 行為相似度;文中也列出 7-Zip 從 54% 到 95%、DuckDB 從 34% 到 80% 的結果。

一龍馬判讀

對大型程式開發代理人來說,關鍵能力可能是先定義驗收與覆蓋範圍,而不是只提升單次解題能力。這些數字來自 Factory 自家研究設計,任務選取、相似度量測與可重現性仍會影響外部採信程度。

原文節錄

Hacker News

What it Takes for Coding Agents to Complete Large Software Tasks | Factory.ai Factory.ai Product Enterprise Pricing News Company Careers Docs Log In Contact Sal

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Why coding agents stop early on long-horizon software tasks

收錄日期
2026-08-28
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/28 06:00(台北)