一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

原文主張,近代模型正在把參數與每 token 計算從「記住更多事實」轉向「更會推理」,因此在數學、程式碼等可驗證任務上分數上升,但在無工具的事實回憶上仍很弱

中文摘要

作者舉 GLM-5.2、Qwen3.5、DeepSeek V4-Flash 的 active parameters 與 AIME 成績作為例子,也引用 SimpleQA 與 Artificial Analysis 的知識幻覺率,說明小模型在不知道時會編造答案。HN 討論裡有人接受這個方向,但提醒 SimpleQA Bench 已在 2025 年 9 月停止量測,也有人質疑「工具與代理」並不是多數使用者的主要用途。

一龍馬判讀

如果這個判讀成立,產品設計重點會從「模型本身知道一切」移到檢索、文件、網路搜尋與工具呼叫的 harness;做企業 AI、程式碼代理或本機模型的人都要把資料來源與驗證流程當成核心。限制是原文使用的部分 benchmark 時效被社群質疑,不能把它直接當成所有模型能力退化的定論。

原文節錄

Hacker News · hruvhwe

Models Are Getting Dumber on Purpose - Walter van der Giessen Skip to content W4G1 2026-08-17 Models Are Getting Dumber on Purpose Walter van der

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Models Are Getting Dumber on Purpose

收錄日期
2026-08-17
來源
Hacker News Firebase API
抓取時間
2026/08/17 05:40(台北)
來源資料
169 分 · 106 則討論