一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

這篇 arXiv 預印本重新檢驗六個常用物理基準,聚焦有可驗證最終答案的純文字題,並由相關領域教師與研究生複核題目、參考解答及模型回覆

中文摘要

摘要稱,多數原先判錯案例其實源於評分器、參考解答錯誤,或題目含糊不完整;修正後,GPT-5.6-Sol 在 HLE-Physics 的 mean@4 從 47.3% 升至 78.7%,CMT-Benchmark 則從 61.0% 升至 87.2%。這些成績是依專家審查後保留的子集計算,不能直接外推成模型已具備開放式物理研究能力。

一龍馬判讀

若結果可重現,基準品質已成為衡量前沿模型科學推理能力的主要瓶頸,研究機構與模型供應商需要投入專家驗題,而非只追逐總分。HN 對訓練資料污染與題目物理假設仍有分歧,但這只是部分社群意見,論文摘要未消除所有疑慮。

原文節錄

Hacker News · qt31415926

Most audited cases initially evaluated as incorrect reflect these benchmarking issues

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

How good are frontier models at physics?

收錄日期
2026-09-17
來源
Hacker News Firebase API
抓取時間
2026/09/17 05:40(台北)
來源資料
40 分 · 13 則討論