跳到主要內容
2026-08-21 日報
研究與評測

MIT 研究發現擴散模型「歸因衰減」現象:訓練資料達 5 萬件時,移除特定原作仍可生成相似圖像

科技新報 AI單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,麻省理工學院(MIT)CSAIL 團隊即將於《Nature Communications》發表題為《Outputs of Generative Diffusion Models are Often Unattributable》的研究,指出生成式擴散模型在規模擴大後,存在「歸因衰減」(attribution decay)現象。 研究作者 Zheng Dai 與 David K. Gifford 透過消融實驗發現,當模型訓練資料量越大,其輸出內容越難對應到特定的原始資料。數據顯示,當模型僅以 1,336 件藝術品訓練時,若從資料庫中移除與生成結果最接近的原作作者所有作品,AI 生成的圖像會發生顯著改變;但當訓練資料擴增至 50,000 件時,即使徹底刪除達文西的全部作品或《蒙娜麗莎》等代表性名畫,模型依然能生成極為相似的圖像或藝術風格。 研究指出,此現象將使外界難以追查 Midjourney、Stable Diffusion 等模型的輸出是否構成對原作的實質複製,進而影響機器遺忘(machine unlearning)、資料投毒防範及模型可解釋性等領域的應用。康乃爾大學法學教授 James Grimmelmann 對此表示,若大型模型的歸因技術失效,未來的技術界與法院將必須尋找全新的方式,來評估 AI 是否涉及實質的複製與侵權行為。
讀原始報導

背景

機器遺忘旨在使 AI 模型「遺忘」特定訓練資料,源於隱私保護與「被遺忘權」的需求,目標是在不重新訓練模型的情況下消除特定資料的影響。資料投毒則是透過惡意內容誤導 AI 模型的攻擊手法。

來源

本期分類