開發生態
自動化解除模型審查工具 Heretic 登上 GitHub Trending,社群已用其發布逾 5000 個模型
GitHub Trending (python)單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
自動化解除模型審查(abliteration)工具 Heretic 首度登上 GitHub Trending,目前社群已使用該工具建立並發布超過 5000 個無審查模型。Heretic 結合方向性消融(directional ablation)與基於 TPE 的 Optuna 參數最佳化器,透過共同最小化拒絕次數與原始模型的 KL 散度,全自動尋找消融參數,無需進行昂貴的訓練後微調。
該工具支援多數 dense 模型(含多模態)、多種 MoE 架構及 Qwen3.5 等混合模型,但暫不支援純狀態空間模型(SSM)。官方以 `google/gemma-3-12b-it` 實測,原始模型對有害提示拒絕率為 97/100;Heretic 生成的版本拒絕率降至 3/100,且對無害提示的 KL 散度僅 0.16,顯著優於社群現有手動消融版本(如 mlabonne 的 1.04 與 huihui-ai 的 0.45),顯示對模型原始能力的破壞更小。
在硬體需求方面,於 RTX 3090 上處理 `Qwen3-4B-Instruct-2507` 約需 20 至 30 分鐘,並支援 bitsandbytes 4-bit 量化以降低 VRAM 需求。此外,Heretic 提供 `research` 附加套件,支援模型內部語意(可解釋性)研究,包含計算殘差向量與 PaCMAP 投影等功能。
讀原始報導背景
在人工智慧領域,「消融(ablation)」是指移除系統中的特定組件,藉此分析該組件對整體效能的貢獻。而 Optuna 則是由日本新創公司 Preferred Networks 於 2018 年推出的開源 Python 函式庫,專門用於機器學習模型的自動超參數調校。