一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

官方說法強調外部評測題目被限制在「cryptographic box」內,不能被模型後續拿去最佳化;摘錄未揭露完整方法、評測集內容或結果

中文摘要

Google DeepMind 宣布試辦其稱為全球首個針對專有前沿模型的雙盲 AI 評測,目標是降低 benchmark contamination,也就是模型事先看過測驗題而讓分數失真的問題。Google 將與 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,把 Gemini Flash Lite 放進隱私保護、加密安全的環境中,對機密 benchmark 測試。官方說法強調外部評測題目被限制在「cryptographic box」內,不能被模型後續拿去最佳化;摘錄未揭露完整方法、評測集內容或結果。

一龍馬判讀

如果流程可被獨立審查,會讓專有模型評測比單純公布榜單更可信;限制是目前仍在試辦階段,且可信度取決於第三方能否驗證環境與程序。

原文節錄

Google DeepMind

Piloting the world's first double-blind AI evaluations — Google DeepMind Skip to main content Explore our next generation AI systems Explore models Gemini Gemin

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Piloting the world's first double-blind AI evaluations

收錄日期
2026-08-28
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/28 06:00(台北)
來源資料
官方來源