一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

它也展示例子,例如 Gemini 3.7 Flash 在椅子計數題答 37、正解 54,卻給 70% 信心;Grok 4.6 答 7、正解 6,給 85% 信心

中文摘要

Integrity Bench 主打衡量大型語言模型的「信心錯誤」:它要求模型回答問題時同時給出 0–100% 信心,再用 Brier score 計算校準程度,並把 Integrity Score 定義為 100 − 400 × Brier。頁面聲稱前沿 AI 普遍對自身能力過度自信,榜單中 Muse Spark 1.2 以 28.1±3.2 排第一,Claude Opus 5 為 16.1±3.8,GPT-5.5 為 -11.5±4.5,GPT-4o 則為 -213.9±4.5;同時另列整體準確率。它也展示例子,例如 Gemini 3.7 Flash 在椅子計數題答 37、正解 54,卻給 70% 信心;Grok 4.6 答 7、正解 6,給 85% 信心。頁面說 benchmark 有 10 個領域、題目盡量保密,只公開少量例題,因此外部無法完整複核題庫代表性。

一龍馬判讀

這類評測把焦點從「答對多少」拉到「錯的時候知不知道自己可能錯」,對客服、醫療、法務等高風險部署更貼近實務風險。限制是題庫私有且分數為自訂指標,採購或研究時不能只看排名,仍要看任務相似度與可重現性。

原文節錄

Hacker News

IntegrityBench Integrity Bench Frontier AI seems broadly overconfident about its own ability.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Integrity Bench – Measuring LLM confidence errors

收錄日期
2026-08-28
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/28 06:00(台北)