從賣書到燒書:Amazon 用稀有典籍餵養 AI,這筆交換值得嗎?

有一個畫面讓我想了很久:一本 18 世紀的植物學手稿,可能只剩三本存世,其中一本的紙張被工業級掃描器壓平,文字擷取完成之後——書本被歸入廢棄流程。不是送回圖書館,不是捐給博物館,而是銷毀。
這不是反烏托邦小說的情節。根據 TechCrunch 於 2026 年 8 月的報導,Amazon 正在這樣處理它收購或取得的稀有書籍,目的是為了訓練旗下的大型語言模型。
稀有文本為什麼變成 AI 的香餑餑
白話講就是:網路文字已經被 LLM 吃得差不多了。
2026 年的模型訓練面臨一個很現實的問題——高品質的新文字資料愈來愈難找。Reddit、Wikipedia、新聞網站、GitHub,這些來源都已經被前幾代模型消化過一輪甚至幾輪。要讓下一代模型在語言理解、推理深度、跨領域知識上再上一層樓,訓練資料的品質和多樣性必須同步提升。
稀有書籍恰好踩在這個需求點上。幾百年前的文字風格、論述邏輯、知識結構,和現代網路文字的語感完全不同。這種多樣性對模型的語言理解能力有實質幫助——你可以把它想成:模型讀過的語言「型態」越多,它在面對罕見句型或複雜推論時就越不容易卡住。
這也解釋了為什麼 Amazon 願意花力氣取得這些原本難以數位化的實體文獻。問題是,取得之後怎麼處理這些書,才是讓人皺眉的地方。
「掃完就丟」的邏輯,誰能接受?
我理解商業邏輯:保存實體書有成本,倉儲、氣候控制、長期管理,一本稀有書籍的維護費用並不低。從純粹的資產管理角度看,「取出數位內容、處理掉實體」有其財務理性。
但這裡有個根本性的錯誤假設——書的價值只在它的文字內容。
一本手稿的裝訂方式、紙張的化學成分、頁邊的批注筆跡、甚至書封磨損的痕跡,這些都是資訊。對歷史學家、材料學家、文化研究者來說,這些「非文字」的物理細節有時比文字本身更有研究價值。掃描器捕捉到的,只是書的一個截面。
更直白說:這些書一旦銷毀,就是真的消失了。沒有備份,沒有復原。Amazon 用一份數位文字檔換走了一個不可逆的實體文化物件。
這讓我想到一個更大的問題
之前我寫過 Amazon 銷毀稀有書籍的倫理背景,當時聚焦的是「科技貪婪」這個框架——企業用知識財產餵養商業模型,卻不一定對知識的來源負責。這篇我想多走一步。
問題不只是 Amazon 這一家公司的道德選擇,而是整個 AI 產業的資料取得邏輯,正在把「可以被轉換成訓練資料」當作一切事物的最終用途。
書可以被數位化然後銷毀。人的創作可以被爬取然後納入模型權重。藝術家、作家、學者的畢生積累,在這套邏輯下都變成了「訓練素材」。這種把世界上所有知識都視為待開採資源的思維方式,某種程度上比任何單一的不道德行為都更值得警惕。
你可以把它想成:這不是一個壞人做了一件壞事,而是一整套激勵結構在系統性地推動某種結果。只要訓練資料的取得成本夠低、法律灰色地帶夠大、外部壓力夠小,這件事就會一直發生。
我們沒辦法假裝不知道選擇的存在
Amazon 不是沒有其他選項。掃描完成後,這些書可以捐給大學圖書館、國家檔案館、或是有能力維護它們的非營利機構。多走這一步,成本不是零,但也不是天文數字。
更關鍵的是:如果這個選擇從來沒被認真討論過,那才是真正的問題所在。
講到這裡,順帶一提——這件事和 Zuckerberg 那 6500 字 AI 宣言 讓人不安的原因有點像。不是因為科技公司在說謊,而是因為他們在做選擇的時候,從來不把「非商業價值」放進考量。當利潤、效率、模型性能是唯一的優化目標,其他東西就只剩被犧牲的份。
帶走這個問題
我不是說 AI 的進步不值得追求。但「為了訓練更好的模型」不應該成為可以覆蓋一切的萬用理由。
每一本被銷毀的稀有書籍,都是一個我們無法回頭的決定。問題是,這些決定現在是由誰來做、根據什麼標準來做。
如果答案是「一家科技公司的內部流程」,那這個對話早就應該走出公司內部,在更公開的地方發生了。
幾個值得記住的點:
- 稀有文本是 2026 年 LLM 訓練最搶手的資料來源之一,因為網路文字已近飽和
- 物理書的價值不只是文字內容,銷毀等於永久抹除無法數位化的資訊層
- 這不是個案行為,而是整個產業「知識即資源」思維的系統性結果
- Amazon 有能力做出不同的選擇,但需要外部壓力才有動機這麼做
參考來源
分享這篇



