研究與評測
Apple 發表 DSAS 模型引導框架:動態調整介入強度,改善毒性抑制與效能折衷
Apple ML一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Apple ML 發表名為 Dynamically Scaled Activation Steering (DSAS) 的研究,旨在解決傳統 Activation steering(啟動引導)因統一套用於所有輸入,導致在不需引導時降低模型效能的問題。
DSAS 是一種與具體方法無關(method-agnostic)的框架,將「何時引導」與「如何引導」解耦。在生成階段,DSAS 會計算依賴上下文的縮放因子,動態調節各層與輸入的引導強度,僅在偵測到不良行為時才進行強烈介入。
研究指出,DSAS 可與現有引導函數進行端到端(end-to-end)聯合最佳化。與現有方法結合時,能穩定改善 Pareto 前緣,在抑制毒性與維持模型實用性之間取得更好的折衷。
此外,研究團隊將 DSAS 應用於文字生成圖片的擴散模型,證明其具備通用性,能透過自適應引導來調節特定概念。該框架引入的運算開銷極小,並能精確指出哪些 token 需要引導及其程度,進而提升模型可解釋性。相關程式碼將於 GitHub 開源。
讀原始報導