一龍馬/AI 情報站讀懂消息背後的脈絡
星期日
搜尋

Real-SWE 自述以取得授權的企業私有程式碼庫測試前沿模型,任務涵蓋計費、稅務、客戶遷移等實際業務,並以模型搭配原生代理工具的組合進行評估

中文摘要

頁面公布的整體解題率最高為 Fable 5.1 搭配 Claude Code 的 38.8%,其後是 GPT-6 Astra 搭配 Codex CLI 的 33.8%;每項任務各跑八次,解題率等同 pass@1。結果也把漏做需求、未驗證假設與整合錯誤列為主要失敗型態,但因程式碼庫不公開,外界無法完整重現或核對評分器,HN 討論亦對此透明度取捨提出質疑。

一龍馬判讀

企業採購者得到的是比公開題庫更貼近內部系統的訊號,也看到目前代理離穩定接手工程工作仍有距離;然而私有資料降低了被訓練污染的風險,也同時削弱獨立審查能力。

原文節錄

Hacker News · theanonymousone

Resolution rate is equivalent to pass@1

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases

收錄日期
2026-09-13
來源
Hacker News Firebase API
抓取時間
2026/09/13 05:40(台北)
來源資料
22 分 · 5 則討論