事件總覽:從一枚藏在珍稀書籍夾層中的蘋果AirTag出發,跨州定位到亞馬遜內華達州秘密倉庫「LAS8」,揭開科技巨頭為餵養AI大語言模型,大規模破壞性掃描實體書、再將紙本殘骸直接銷毀的驚人產業鏈。
說真的,當我第一眼看到404 Media這篇調查報導時,心裡其實沒有太多震驚,反而有種「果然如此」的複雜情緒。這幾年我們看著AI生成內容從驚豔到氾濫,從ChatGPT橫空出世到現在各大模型產出的文字越來越「油」,背後的原因早就不是祕密——網路上能用的高品質文字快被爬光了。但親眼看到實體書被切斷書脊、像工廠流水線一樣高速掃描後直接丟棄的畫面,還是讓人心頭一緊。
先說這場堪稱「AI版尋寶記」的調查是怎麼進行的。404 Media與一位珍稀書籍賣家合作,在一批高達1,000本珍貴藏書的採購訂單中,把一枚蘋果AirTag追蹤器巧妙地藏在其中一本書的夾層裡。接下來幾週,他們就盯著這枚追蹤器的訊號,看著這批書從加州出發,經過密爾瓦基、科羅拉多州的大章克申,最後抵達內華達州拉斯維加斯東北部、代號為「LAS8」的亞馬遜大型物流倉庫。
有趣的是,這座「LAS8」倉庫在亞馬遜的公開業務中,登記的是按需印刷(Print-on-Demand)服務——顧名思義,應該是接到訂單才印書、裝訂、出貨的地方。但調查團隊發現,倉庫內有個標記為「VGT3」的管制區域,裡面做的完全是相反的事:拆書,而不是做書。
📅 拆書流水線的殘酷日常
根據調查揭露的標準作業流程,這些珍稀書籍進了VGT3之後,工讀生或技術人員會先用專業切紙設備直接切斷書脊——這個步驟叫做「Debinding」——把一本完整的書瞬間解體成散裝的紙頁。接下來送入工業級高速進紙掃描儀,全自動光學掃描,文字被快速轉換成純文字數據。整個過程像極了高度自動化的文件數位化產線,只是這些書不是什麼企業報表或公文,而是可能已經絕版、市面上再也找不到的珍稀文獻。
更令人不安的是下一步。這些被數位化的內容既不會上架供大眾借閱,也不會做成PDF或電子書版本販售。它們的唯一下場就是作為「預訓練演算法的專屬飼料」,灌進大語言模型的底層資料集。一旦文字被榨乾,殘存的碎紙和封皮就直接當廢棄物丟掉——物理毀滅,徹底從世界上消失。
話說回來,科技巨頭為什麼要搞到這步田地?這背後其實是一場正在加速的「資料荒」危機。
📅 AI的「近親繁殖」困境
過去一兩年,網路上充斥著大量AI生成的合成內容。新聞、文章、社群貼文、甚至維基百科的編輯紀錄,都開始被AI產出的文字滲透。這對AI開發商來說是致命的:當你用其他AI生成的資料來訓練新的AI,就像近親繁殖一樣,會引發所謂的「模型崩潰」(Model Collapse)效應。
具體來說,模型會越來越同質化、平庸化,失去多樣性和邏輯推理能力。更慘的是,合成資料會把AI的「幻覺」問題放大——錯誤資訊在遞迴訓練中被反覆強化,最後變成模型認定的事實基準。你有沒有發現某些AI回答問題時,明明講得頭頭是道,細節卻錯得離譜?那就是幻覺被放大的結果。
所以,為了突破這個瓶頸,開發商需要真正乾淨、未經AI污染過的人類原創內容。而尚未被數位化的實體書籍,尤其是那些古老、稀有、從未出現在網路上的藏書,就變成了最頂級的「未污染黃金礦脈」。從商業角度來看,亞馬遜做這件事邏輯完全說得通,只是代價是實體書的物理滅絕。
編輯觀點:從產業面來看,這起事件其實暴露了AI競賽中一個殘酷的結構性矛盾。科技公司一方面高舉「保存人類知識」的大旗,另一方面卻用最破壞性的方式消耗這些知識的實體載體。法院目前傾向將此類操作認定為「合理使用」,因為這些數位化副本沒有公開發行或轉售。但說真的,法律上的合法與文化上的正當,從來就是兩回事。當一本只有五本存世的絕版地方誌被拆解、掃描、銷毀之後,就算它的文字永遠活在模型的參數裡,人類也永遠失去了那本書作為物件的歷史痕跡。這不是保存,這是提煉——而且是不可逆的那種。
其實,亞馬遜不是唯一這麼做的公司。報導中也提到,知名AI獨角獸Anthropic在內的多數大型商業AI研發機構,早就加入搶購實體書籍進行內部訓練的行列。這已經不是單一企業的個案,而是整個AI產業的集體行為。
然而,法律的許可並未能平息文化界的巨大焦慮。專家與文史學者提出沉痛的警告:實體書籍的存量是有限的。隨著這些巨頭無止境地消耗,部分存世量極少的絕版書與地方文獻,很有可能在這場「先拆書、後銷毀」的AI軍備競賽中徹底絕跡。你說這叫「數位保存」?我倒覺得更像是「數位盜採」。
至今影響與未來展望
這枚AirTag追蹤到的不只是一個倉庫的位置,它追出了整個AI產業在資料取得上的道德灰色地帶。從短期來看,類似LAS8這樣的「毀書基地」只會越來越多,因為各大模型還在持續競爭更高階的評測分數,對原始資料的渴求不會停止。但中長期來看,如果文化界、出版界與科技界不能找到一個兼顧知識保存與AI發展的平衡點,我們可能會在擁有史上最強大AI的同時,失去實體書時代最後的實體遺產。
這不是危言聳聽。你可以想像,再過二十年,當我們想翻閱某本日治時期的地方紀實或某個小眾詩人的絕版詩集,圖書館的架上已經沒有了,數位檔案庫裡也只剩下一組被模型訓練過的參數——而且你還不一定有權限讀取它。這真的是我們想要的未來嗎?
我們可以做什麼?至少,下次當你看到某個平台宣稱「我們用數百萬本實體書訓練了這個模型」時,請多問一句:那些書現在在哪裡?它們還存在嗎?消費者的關注與提問,或許是唯一能讓這些巨頭停下來想一想的力量。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
亞馬遜為什麼要破壞性掃描實體書?
為了獲取未被AI生成內容污染的純人類原創文字,用來訓練大語言模型,避免「模型崩潰」導致的內容平庸化與幻覺放大問題。
什麼是「模型崩潰」(Model Collapse)?
指AI反覆使用其他AI生成的合成資料進行訓練後,輸出內容逐漸同質化、喪失多樣性與邏輯推理能力的惡性循環現象。
這種拆書掃描的行為合法嗎?
目前美國法院的司法判例傾向將此類操作認定在「合理使用」範疇內,前提是企業沒有將數位化副本公開發行或轉售牟利。
除了亞馬遜,還有哪些公司這樣做?
報導指出,包括知名AI獨角獸Anthropic在內的多數大型商業AI研發機構,都已加入搶購實體書進行內部訓練的行列。
珍稀書籍被掃描後,實體書會怎麼處理?
一旦文字數據被萃取完成,殘存的碎紙與封皮會直接當作廢棄物丟棄銷毀,實體書在物理世界完全消失。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。