一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

該基準要求代理在無明確指示的抽象回合制環境中探索、推斷目標、建立世界模型並規劃行動;主辦方稱 Astra 在 96% 關卡使用的動作數少於受測人類中位數,但人類可解出全部環境

中文摘要

ARC Prize 報告稱,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 測試中,使用標準執行框架得到 62.7%、成本約 2.61 萬美元;改用可保留不透明推理狀態並壓縮長對話的 Provider Adapter 後,最高達 99.9%、成本約 1.88 萬美元。該基準要求代理在無明確指示的抽象回合制環境中探索、推斷目標、建立世界模型並規劃行動;主辦方稱 Astra 在 96% 關卡使用的動作數少於受測人類中位數,但人類可解出全部環境。測試回放顯示模型會把陌生機制整理成邏輯規則與自創簡記,而較高推理強度有時因減少失敗重試,反而降低總成本。

一龍馬判讀

標準框架與供應商專用框架相差逾 37 個百分點,說明代理能力評估高度依賴狀態保存、上下文管理與測試介面,不能把 99.9% 單純歸功於基礎模型。這項結果也不能單獨證明已達通用人工智慧,因為它仍是特定半私有基準,且完整測試成本達數萬美元。

原文節錄

Hacker News · vignesh_warar

OpenAI's GPT-6 Astra on ARC-AGI-3 | ARC Prize View brand kit Copy logo image Copy logo SVG Explain with ChatGPT Foundation Donate About History Jobs

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

OpenAI's GPT-6 Astra on ARC-AGI-3

收錄日期
2026-09-04
來源
Hacker News Firebase API
抓取時間
2026/09/04 05:40(台北)
來源資料
93 分 · 44 則討論