一龍馬/AI 情報站讀懂消息背後的脈絡
星期日
搜尋

Heretic 以 directional ablation 搭配 Optuna 參數最佳化,自動降低語言模型的拒答,同時用 KL divergence 約束與原模型的偏離

Python · ⭐ 28,647 · 🍴 3,155 · 🔥今日 +150

中文摘要

它支援多數 dense、若干 MoE、混合與多模態模型,但純 state-space 與部分研究架構尚未直接支援。README 要求 Python 3.10+ 與 PyTorch 2.2+,也提醒數值會依硬體與平台變動,自動基準不能取代人工評估。

一龍馬判讀

這把移除安全對齊從手工模型研究變成一般 CLI 工作流,確實降低實驗門檻,也同步放大誤用與治理風險;採用者不能只看拒答率,還要評估能力破壞與使用邊界。

原文節錄

p-e-w/heretic

Pure state-space models and certain other research architectures are not yet supported out of the box.

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Fully automatic censorship removal for language models

收錄日期
2026-08-30
來源
github.com/trending
抓取時間
2026/08/30 05:50(台北)
來源資料
Python · ⭐ 28,647 · 🍴 3,155 · 🔥今日 +150