研究與評測
開發者提出 Dynamic Abliteration 技術,以 Engram 架構在 Qwen3-4B 實測非破壞性拒絕抑制
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Hacker News 討論的一篇技術文章探討,開發者提出名為「Dynamic Abliteration」的非破壞性拒絕抑制技術,並以 Qwen3-4B 模型進行概念驗證。傳統權重消除會永久改變模型權重並可能降低非拒絕任務的效能,新方法則透過 PyTorch forward hooks 在執行時攔截中間殘差流,使基礎模型權重保持 100% 凍結。實測顯示單層干預(如第 14 層)會被下游層重建拒絕行為,因此需在多層(第 12、14、16、18、20 層)提取對比差異向量。為解決靜態向量無條件注入導致的效能下降與手動縮放問題,該方法引入源自 DeepSeek 的 Engram 條件記憶架構。其機制包含動態 Sigmoid 脈絡閘門(僅在遇到拒絕觸發詞時介入)、O(1) 常數時間 N-Gram 雜湊核心,以及透過反向傳播訓練的特定層投影頭。訓練時使用 PKU-Alignment/PKU-SafeRLHF 資料集的 2,000 個乾淨樣本,凍結 Qwen3-4B 骨幹,僅最佳化多層 Engram 模組。
讀原始報導