一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

Quesma Blog 重新跑 Baba Is Bench

中文摘要

主張 2026 年 8 月的新模型如 Gemini 3.7 Flash、Grok 4.6、DeepSeek V4 Pro 0813 與 GLM-5.3 已進入前沿水準,且在《Baba Is You》解謎任務上有明顯差異。作者說測試會檢查劇透,未看到模型事先知道解法的跡象,並提醒 Artificial Analysis 的 Intelligence Index 來自 Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond 等基準,不等同這類抽象解謎能力。表格中 Gemini 3.7 Flash 在 Intro 階段 pass@1/pass@3 都是 100%,成本標為 5.38 美元;Grok 4.6 為 96%/100%、DeepSeek V4 Pro 0813 為 75%/88%,但來源節錄沒有完整呈現 Lake 階段與方法細節。

一龍馬判讀

這類遊戲型基準把「會不會規劃、修正規則、探索狀態」拉出一般考題之外,對代理式工作流更有參考價值;限制是目前只看到部落格節錄與部分表格,不能把它當成全面模型排名。

原文節錄

Hacker News

Gemini 3.7 Flash, Grok 4.6, GLM-5.3 and DeepSeek V4 Pro joined the frontier - Quesma Blog Skip to main content How it works Benchmarks Blog…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Gemini 3.7 Flash, Grok 4.6, GLM-5.3 and DeepSeek V4 Pro joined the frontier

收錄日期
2026-08-24
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/24 06:00(台北)