一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

README 將用途直接定位為解除審查,授權為 AGPL

Python · ⭐ 29,118 · 🍴 3,199 · 🔥今日 +485

中文摘要

Heretic 以 directional ablation 搭配 Optuna,自動尋找並移除語言模型的拒答與安全行為,支援 dense、多模態與 MoE 架構,但不支援純 state-space 模型。README 將用途直接定位為解除審查,授權為 AGPL。

一龍馬判讀

這項技術同時可用於研究對齊機制,也會降低模型防止濫用的能力。任何實驗都應在隔離環境、受控模型與明確評估下進行;把處理後模型直接公開或接上工具會放大安全與責任風險。

原文節錄

p-e-w/heretic

Fully automatic censorship removal for language models

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Fully automatic censorship removal for language models

收錄日期
2026-08-31
來源
github.com/trending
抓取時間
2026/08/31 05:50(台北)
來源資料
Python · ⭐ 29,118 · 🍴 3,199 · 🔥今日 +485