Amazon 為了訓練 AI 正在銷毀稀有書籍——從書商到焚書者,這段轉變讓人不舒服

圖書館員花了幾十年把一本 1800 年代的航海日誌數位化存檔,Amazon 的採購團隊可能只需要幾百美元就把同一本書買走、掃描完、然後處理掉。這不是科幻小說的情節——這是 2026 年正在發生的事。
TechCrunch 在 2026 年 8 月 17 日的報導揭露,Amazon 正系統性地收購稀有書籍,掃描內容以訓練大型語言模型,書本在流程結束後被銷毀或丟棄。這家公司的起家點,就是靠賣書起來的。
稀有書籍為什麼這麼值錢——對 AI 來說
白話講就是:越老的書,越不可能出現在網路上。
LLM 的訓練資料大量來自 Common Crawl、Wikipedia、GitHub 這些公開網路資源,但這些來源的時間跨度大多只到 2000 年代以後。18、19 世紀的文學、科學論文、地方史誌、手稿翻譯?幾乎是空白地帶。
你可以把稀有書籍想成模型的「盲點補丁」——填進去能讓模型在語言風格多樣性、歷史語境理解、低頻詞彙覆蓋率上有實質提升。對 Amazon 旗下的 AI 業務(包括 AWS Bedrock 的基礎模型以及 Alexa 的下一代架構)來說,這些資料的邊際價值極高,但取得成本相對其他方式又很低。一本專業古董書商賣幾千美元的書,放到 AI 訓練資料的規模裡,可能是划算的買賣。
問題不只是「書被毀掉了」
表面上看起來是一個單純的資源決策——Amazon 用錢換資料,書商賣書換現金,市場行為,沒問題。但細看會發現這個邏輯有幾個裂縫。
第一,稀有書籍的價值是不可複製的。 某些版本的書本身就是歷史文物,書頁的磨損、批注、裝訂方式都是考據的一部分。一旦實體被銷毀,你永遠只剩下掃描圖像,而且那個掃描檔只有 Amazon 有。
第二,這些資料的去向沒有透明度。 圖書館把書數位化,是為了讓所有人都能存取。Amazon 把書掃描完,是為了讓自己的 AI 更強。這兩件事形式上很像,本質上完全相反。
第三,這個行為有加速效應。 當 Amazon 這樣的資金量級玩家開始系統性收購稀有書籍,市場上的這類書籍會快速流向私人資本,而不是圖書館或研究機構。這不只是一本兩本書的問題,是整個文化保存生態的扭曲。
當科技公司的數據飢渴沒有邊界
這件事讓我想到一個更大的模式:AI 訓練資料的取得邏輯,已經開始挑戰很多我們原本覺得「理所當然不會碰」的東西。
過去幾年,OpenAI 和 Google 被起訴過爬取版權內容;藝術家集體控告 Midjourney 和 Stability AI;作家工會跟各家模型公司談授權金。這些衝突有一個共同點:科技公司在訓練階段的「數據收割」行為,走在法律和倫理共識的前面。
Amazon 的這個動作特別諷刺,是因為它的歷史形象。Bezos 當年是靠「書讓知識流通」這個理念建立了一個帝國,現在這個帝國正在物理上消滅稀有知識的載體,為的是讓自己的模型更聰明。說是「知識轉移」有點太美化了——更像是把公共財產的邊緣地帶圍起來私有化。
如果你對 AI 巨頭的資料策略有長期觀察,你可能對這種行為模式不陌生。去年 Zuckerberg 那篇 6500 字的 AI 宣言,讀完讓人更不安而非更放心,核心原因也是類似的——科技公司在談 AI 的未來時,那個「公共利益」的論述包裝,跟實際的資源控制行為之間有明顯落差。
這件事應該讓誰不舒服?
如果你是研究者、圖書館員、或者任何在乎文化保存的人,你應該很不舒服。
如果你是 AI 從業者,我覺得你也應該認真想一下:模型能力的提升,如果是建立在不可逆的文化損失上,這個代價算進去了嗎?
目前沒有任何法規明確規範稀有書籍的「AI 訓練用途銷毀」行為。書本買賣是私人交易,買方怎麼使用是買方的事。但「合法」跟「沒問題」中間,有時候差很遠。
現在 AI 的競爭賽道上,資料品質比資料量更重要——這個趨勢在 2026 年已經相當明確。各家模型在指令遵循和語言理解上的差距越來越取決於訓練資料的多樣性和深度,而不只是參數量。這讓稀有書籍這類「長尾資料」的戰略價值只會越來越高,也讓這類行為只會越來越常見。
帶走一個想法
有一種說法是:數位化本身就是保存,書的內容還在,只是換了形式。
但你要問的問題是:保存給誰用?誰有存取權?這個知識是進入公共領域、還是進入某家公司的私有資料庫?
Amazon 當年改變了書的流通方式,讓更多人買得到書。這次它正在做的,方向恰好相反——讓更少人能存取那些知識,而且是以一種不可逆的方式。
這不只是一個關於 AI 的故事,也是一個關於誰擁有人類知識的問題。而這個問題,現在沒有人認真在回答。
參考來源
分享這篇


