一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

相較之下,它在較長程代理工作取向的 Terminal-Bench 4.0 只有 27.3,明顯落後頁面所列的兩個前沿模型,顯示單一高分不能代表全面能力

中文摘要

Tokenstead 頁面稱,Cognition 的專有 MoE 程式開發模型 SWE-2 共有 2.8 兆參數、每個 token 啟用 1040 億參數,並在 Terminal-Bench 2.1 得到 92.8、FrontierCode 1.1 Main 得到 50.0。相較之下,它在較長程代理工作取向的 Terminal-Bench 4.0 只有 27.3,明顯落後頁面所列的兩個前沿模型,顯示單一高分不能代表全面能力。所有成績與成本比較均由 Cognition 自行提供、尚待獨立重現;權重未公開,也沒有可核對的每百萬 token API 定價。

一龍馬判讀

若數據成立,SWE-2 可能讓 Devin 使用者以更少步驟與成本完成程式任務,但採購或模型評估不能只依賴 Terminal-Bench 2.1。封閉權重、缺少標準費率及未經第三方驗證,都限制了外部稽核與橫向比較。

原文節錄

Hacker News · cdnsteve

Every figure here is Cognition’s own number, pending independent replication.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

收錄日期
2026-09-11
來源
Hacker News Firebase API
抓取時間
2026/09/11 05:40(台北)
來源資料
42 分 · 19 則討論