一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

測試使用依公開資料建構的合成儲存庫、四類使用者角色、三家沙箱,並由 Gemini 3.7 Flash 扮演互動中的模擬使用者;團隊聲稱公開彙整結果、執行軌跡與程式碼差異

中文摘要

Armature Research 表示以 16,893 次工作階段測試 Claude Code、Codex 與 Cursor 如何選擇並實際導入開發工具,設計涵蓋 1,163 種提示、75 個儲存庫與 10 種程式語言。測試使用依公開資料建構的合成儲存庫、四類使用者角色、三家沙箱,並由 Gemini 3.7 Flash 扮演互動中的模擬使用者;團隊聲稱公開彙整結果、執行軌跡與程式碼差異。共同創辦人在 HN 列出的觀察包括 Claude Code 很少搜尋網路、Codex 幾乎總會搜尋,以及修改儲存庫脈絡可能改變選擇,但 Armature 本身販售開發工具成長服務,研究目的也明言包含影響代理選品。

一龍馬判讀

若開發者把選型交給程式代理,工具商的文件、既有程式碼脈絡與模型搜尋習慣可能直接左右採用結果。這是大規模但仍屬模擬環境的研究,加上明確商業利益衝突,不能直接視為真實企業採購行為。

原文節錄

Hacker News · screm

Which tools do Claude Code, Codex and Cursor choose?

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Which tools do Claude, Codex and Cursor choose? We measured 17k runs to find out

收錄日期
2026-09-04
來源
Hacker News Firebase API
抓取時間
2026/09/04 05:40(台北)
來源資料
6 分 · 1 則討論