安全與監管
紐時訴訟解封文件揭露:微軟高層私下稱 AI 爬蟲為「人類史上最大竊盜」,承認 Copilot 致紐時點擊率暴跌 93%
TechCrunch AI綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

《紐約時報》控告 OpenAI 與微軟的版權訴訟中,最新解封的法庭文件揭露了兩家公司高層的內部通訊,顯示其私下言論與公開主張的「合理使用(fair use)」辯護存在嚴重分歧。微軟應用科學總監 Brent Hecht 在 2023 年 1 月的備忘錄中,將 AI 爬蟲稱為「史無前例的驚人竊盜」與「人類史上最大規模的勞力竊盜」。
文件揭露了 AI 產品對新聞業的具體衝擊。Hecht 在 2024 年 1 月的內部簡報指出,微軟 Copilot 導致《紐約時報》網域的點擊率較傳統 Bing 搜尋暴跌高達 93%,並警告這將引發同時傷害模型效能與整個網路的「毀滅迴圈(doom loop)」。微軟執行長 Satya Nadella 在今年稍早作證時也承認,聊天機器人已取代用戶前往原始網站獲取資訊的需求;他並表示,若早知 OpenAI 爬取付費牆內容,會動用權力要求 OpenAI 重新訓練模型。
OpenAI 高層同樣意識到此問題。ChatGPT 負責人 Nick Turley 在內部通訊中坦承,聊天機器人具高度替代性,對出版商構成「生存威脅」。當研究員 Nick Ryder 告知總裁 Greg Brockman 找到「繞過紐時付費牆的駭客方法」時,Brockman 僅回覆「ah nice」。
在資料獲取規模與手段方面,文件顯示 OpenAI 的中期訓練資料集包含逾 9.1 萬份《紐約時報》等媒體的副本,源自 Common Crawl 的資料集更包含逾 200 萬份紐時文件。微軟也透過 Project Taxi 與 Project Mango 提供訓練資料給 OpenAI,其中包含至少 16 萬份新聞出版商作品。此外,OpenAI 員工被指控刻意從訓練資料中移除版權聲明,以避免模型在回覆用戶時輸出相關資訊。
讀原始報導來源
- Ars Technica AIarstechnica.com