一龍馬/AI 情報站讀懂消息背後的脈絡
星期三
搜尋

README 自稱在未見過的測試集與 JevBench 公開題上優於 Kev-9B 與 Jev,但 MMLU 與 MMLU-Pro 等知識題仍落後 Jev

中文摘要

PostHog 發布的 Jeeves 是會先推理再給機率的 Jev 相容決策模型,基於 Qwen3.5-9B 加 LoRA 與 pointer head,並以 SFT 加 CISPO 訓練。README 自稱在未見過的測試集與 JevBench 公開題上優於 Kev-9B 與 Jev,但 MMLU 與 MMLU-Pro 等知識題仍落後 Jev。HN 討論集中在 noul 命名與推理是否犧牲單次前向推論的便宜校準優勢,僅為部分留言觀點。

一龍馬判讀

想沿用 Jev 介面又要更高準確率的團隊可直接試用,但需承擔 H100 上推理中位數 3.3 秒與長尾延遲,以及 Hopper 與 CUDA 的硬體限制。

原文節錄

Hacker News · nicowaltz

Beats Kev-9B and Jev on test data it was never trained on

取得全文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Jeeves. Reasoning improves Jev-like decision models

收錄日期
2026-09-30
來源
Hacker News Firebase API
抓取時間
2026/09/30 05:40(台北)
來源資料
212 分 · 85 則討論