一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

他稱模型能即時建立符號化世界模型,甚至自創描述遊戲狀態的簡寫 DSL;在該客製框架下,幾乎所有關卡的動作效率都超過其人類基準

中文摘要

François Chollet 表示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 標準測試框架取得 66%,搭配持續對話框架與自訂內容壓縮後接近 100%,但每局成本約 360 美元。他稱模型能即時建立符號化世界模型,甚至自創描述遊戲狀態的簡寫 DSL;在該客製框架下,幾乎所有關卡的動作效率都超過其人類基準。Chollet 隨後明確補充,通過或逼近飽和 ARC-AGI-3 並不能證明已達 AGI;目前證據仍限於基準成績與其團隊對推理軌跡的觀察。

一龍馬判讀

結果把焦點從單次問答能力推向長程互動、記憶壓縮與即時建模,但標準框架和客製框架落差甚大,且成本高昂;採購者與研究者不應把經高度調校的單一基準表現直接外推到通用工作。

原文節錄

Hacker News

François Chollet on X: "GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

GPT-6 Astra represents a step-function change in interactive reasoning

收錄日期
2026-09-04
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/09/04 06:00(台北)