一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

OpenAI 宣稱 GPT-6 Astra 在 FrontierMath Tier 4、ARC-AGI 3 與 TerminalBench-4.0 達到當前最佳表現

中文摘要

並稱其在 Terminal-Bench Science 0.1 和 HealthBench Pro 也居領先地位。官方據此將模型描述為科學發現能力的一大進展,但貼文沒有提供分數、對照模型、測試設定或第三方驗證,無法判斷領先幅度與泛化程度。

一龍馬判讀

若成績可重現,數學推理、代理式終端操作、科學與健康應用的能力上限可能提高;但基準領先不等於真實工作可靠,尤其健康相關用途仍須經專業驗證與風險控管。

原文節錄

OpenAI · @OpenAI

R to @OpenAI: GPT-6 Astra is state-of-the-art on FrontierMath Tier 4, ARC-AGI 3, and TerminalBench-4.0.…

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

R to @OpenAI: GPT-6 Astra is state-of-the-art on FrontierMath Tier 4, ARC-AGI 3, and TerminalBench-4.0. GPT‑6 Astra is also a major advance for scientific discovery, with state-of-the-art performance on Terminal-Bench Science 0.1 and HealthBench Pro.

收錄日期
2026-09-04
來源
Nitter RSS(公開貼文)
抓取時間
2026/09/04 06:14(台北)