一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

Artificial Analysis 對 Grok 4.6 的獨立分析給出 Intelligence Index 61 分

中文摘要

稱其與 GPT-5.6 Sol 同級,低於 Claude Opus 5 max 的 63 與 Claude Fable 5 max with fallback 的 62。文章指出 Grok 4.6 在代理式任務表現特別強:GDPval-AA v2 Elo 1753、𝜏³-Banking 50.7%、Terminal-Bench v2.1 88.4%,並稱其在長時程知識工作 AA-Briefcase 上為 Fable 5-tier。成本面,文章列出價格維持 $2/$6 每 100 萬 input/output tokens,測得每任務 $0.84,且平均約 53 turns、約 0.5B input tokens,低於文中比較的 Claude Opus 5 max 約 103 turns、約 2.0B input tokens。

一龍馬判讀

若這些測試能反映實務,Grok 4.6 會把高階代理工作從「只比模型分數」轉向「分數、token 用量、每任務成本」一起競爭,採購與工程團隊都要重新算預算。限制是 AA-Briefcase 為私有 benchmark,外部無法完整重跑,企業導入仍要用自己的資料、工具鏈與錯誤成本測試。

原文節錄

Hacker News · wertyk

Grok 4.6 returns SpaceXAI to the intelligence frontier and leads on cost efficiency Artificial Analysis K Artificial Analysis Models Coding Agents Speech,…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index

收錄日期
2026-08-13
來源
Hacker News Firebase API
抓取時間
2026/08/13 05:40(台北)
來源資料
270 分 · 260 則討論