一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

Ethan Mollick在回覆中主張,METR長期任務與GDPval等少數同類評測已在今年稍早飽和,因為AI已能高品質完成長達數天的工作

中文摘要

這是缺少主串的片段評論,未附數據或對照基準。是否全面飽和仍需看原始評測報告。

一龍馬判讀

若評測真的飽和,模型能力評估與採購決策就需要更難的新基準,但單憑此句不宜直接推論進展幅度。

原文節錄

Ethan Mollick · @emollick

all became saturated earlier this year…

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

R to @emollick: The few attempts to measure similar things (METR Long Tasks, GDPval) all became saturated earlier this year as AIs began to do days of work at a high quality level.

收錄日期
2026-10-09
來源
Nitter RSS(公開貼文)
抓取時間
2026/10/09 06:55(台北)