安全與監管
Amazon 遭 AirTag 追蹤揭露:大量收購並切除書脊銷毀珍稀書籍,以訓練 Nova 模型
TechCrunch AI綜合 4 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

外媒 404 Media 透過在書商約 1,000 本的大宗訂單中藏入 Apple AirTag,追蹤發現 Amazon 正大量收購珍稀紙本書籍,並在掃描後銷毀原書以訓練其 Nova 模型。
追蹤訊號最終抵達 Amazon 位於拉斯維加斯的 VGT3 倉庫,該掃描團隊的標誌為一隻手拿書本的暴龍。員工透露,為了提高掃描效率,他們會先切除書脊,導致原書在處理過程中被毀。Amazon 發言人對此回應,公司是透過正常商業管道採購書籍以改進產品。
書商懷疑,AI 公司正嘗試按 ISBN 系統性地逐本掃描已出版書籍。紙本書具備極高的訓練價值,除了許多內容從未在網路上公開,更關鍵的是 2022 年前出版的書籍保證不含 AI 生成內容,能避免模型攝入過多 AI 文本而導致「模型崩潰」(Model Collapse)。
這種極端的資料獲取手段並非首例。Anthropic 先前也被披露內部有類似的「巴拿馬計畫」(Project Panama),同樣透過電商購書並切除書脊數位化。審理該案的法官裁定此類掃描屬於「合理使用」,其核心依據正是紙本原件已被銷毀,因此不存在複製後再出售的侵權問題。
此舉引發強烈爭議,因部分被毀的珍稀書籍可能根本無法替代,原本能留在公共書架上的知識,最終僅被封存於單一公司的封閉 AI 模型內部。
讀原始報導背景
模型崩潰(Model collapse)是指機器學習模型因為使用未經篩選的合成資料,或訓練自其他模型的輸出結果,而導致效能退化的現象。此現象在人工智慧領域又常被稱為「AI 近親繁殖」或「模型自噬症候群」(MAD)。
社群討論
社群質疑報導缺乏亞馬遜銷毀「稀有書籍」的證據,並指出每年本就有高達 64 萬噸二手書因滯銷被銷毀。針對銷毀動機,部分網友認為是為了規避版權法(避免掃描後轉售實體書)的保守做法,但也有人反駁 AI 訓練是否等同非法複製仍待法院釐清。
來源
- Ars Technica AIarstechnica.com
- Simon Willisonsimonwillison.net
- Hacker Newstechcrunch.com
- Hacker News404media.co
- iThomeithome.com
- en.wikipedia.org