一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

實驗涵蓋四類開發者角色,並由 Gemini 3.7 Flash 模擬對話中的人類回應;團隊表示已公開彙整結果、提示、執行軌跡與程式差異

中文摘要

Armature Research 以 75 個模擬儲存庫、10 種語言、1,163 組提示變體,執行 16,893 次 Claude Code、Codex 與 Cursor 工作階段,觀察代理在實際修改程式碼時如何挑選資料庫、付款及部署等第三方工具。實驗涵蓋四類開發者角色,並由 Gemini 3.7 Flash 模擬對話中的人類回應;團隊表示已公開彙整結果、提示、執行軌跡與程式差異。共同創辦人在 HN 留言另稱,Claude Code 很少搜尋網路、Codex 幾乎都會搜尋,三者經常意見不一,且修改儲存庫脈絡可能完全改變選擇;這些是研究方對結果的歸納,不是 HN 社群共識。

一龍馬判讀

代理開始代替開發者挑選供應商後,工具能否進入模型的考量範圍,可能直接左右開發者工具公司的獲客管道。研究方本身販售協助工具商影響代理選擇的成長服務,加上儲存庫與人類互動均為模擬,解讀結果時須納入利益衝突與外部效度限制。

原文節錄

Hacker News

Which tools do Claude Code, Codex and Cursor choose?

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Which tools do Claude, Codex and Cursor choose? We measured 17k runs to find out

收錄日期
2026-09-04
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/04 06:00(台北)