一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

Cognition 將改善歸因於單次強化學習同時訓練多種推理強度、線性成本懲罰、更多訓練環境及推測解碼等做法;不過附錄表明評測混用公開成績與內部框架,並採各推理強度的最佳分數

中文摘要

Cognition 發表 SWE-2,這款程式開發模型以 2.8T 參數的 Kimi K3 為基底後訓練;公司宣稱它在 FrontierCode 1.1 Main 得分 50.0%,距 Fable 5.1 的 50.9% 不到一個百分點,成本則低 64%。成績並不全面領先:SWE-2 在 Terminal-Bench 2.1 得到 92.8%,但 Terminal-Bench 4 僅 27.3%,低於 Fable 5.1 的 55.8% 與 GPT-6 Astra 的 57.9%。Cognition 將改善歸因於單次強化學習同時訓練多種推理強度、線性成本懲罰、更多訓練環境及推測解碼等做法;不過附錄表明評測混用公開成績與內部框架,並採各推理強度的最佳分數。HN 摘錄中有留言質疑基準選擇與表現起伏,但這只是部分社群意見,並非獨立驗證或整體共識。

一龍馬判讀

SWE-2 已進入 Devin Desktop 與 CLI,若成本與步驟縮減能在真實專案重現,將直接影響使用 Devin 的開發團隊;現階段比較數據主要來自廠商自評,採購前仍需用自家程式庫與任務驗證。

原文節錄

Hacker News · seelos

SWE-2 is available starting today in Devin Desktop and CLI .

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

收錄日期
2026-09-11
來源
Hacker News Firebase API
抓取時間
2026/09/11 05:40(台北)
來源資料
298 分 · 125 則討論