📰 重點摘要
亞馬遜近日被爆出正在大量收購稀有書籍,拆解書脊並掃描內文,用作AI模型訓練資料。這項調查來自404 Media,記者在一本稀有書籍中植入追蹤裝置,結果追蹤到書籍最終送進亞馬遜位於拉斯維加斯的一處設施。該設施代號為VGT3,以「恐龍爪子抓著一本書」的圖案作為識別標誌。對此亞馬遜回應404 Media表示,公司「透過商業管道購買書籍,以改善顧客使用的產品與服務」。像亞馬遜這類公司訓練大型語言模型(LLM)需要極其龐大的文字資料量,而網路上能取得的文本已幾乎被榨乾(Anthropic甚至曾被指控非法盜用海盜版書籍)。稀有書籍,尤其是絕版或網路上根本找不到的版本,因此成為新的搶手訓練資料來源。這類文本特別珍貴的原因在於,2022年之前出版的內容不可能是LLM生成的產物。當LLM用AI生成的文字訓練自己時,可能引發「模型崩潰」(model collapse)問題——也就是當輸出內容吸收過多AI生成文本後,品質會逐漸劣化。
💬 JudyAI Lab 觀點
根據原文摘要,亞馬遜VGT3設施拆解稀有書籍掃描為AI訓練資料一事,反映出優質文字資料正在快速枯竭。
我們觀察到,這個案例點出LLM訓練資料來源正在經歷結構性轉變。當網路上可取得的文字已被大量模型反覆訓練過,2022年前出版、從未上網的稀有書籍就成了稀缺資產,原因在於這類內容能保證不含AI生成文字,可避免訓練資料被AI產出內容汙染而導致的「模型崩潰」問題。這也說明資料品質正逐漸取代資料數量,成為模型競賽下一階段的關鍵瓶頸,連亞馬遜這樣的巨頭都得回頭找實體書籍補洞。
對AI builder而言,這提醒我們:評估任何模型或資料集時,不妨多問一句訓練資料的來源與時間點,這往往比引數規模更能反映品質。
📅 原文資訊
- 發布時間:2026-08-17T16:38
- 來源原文:https://techcrunch.com/2026/08/17/amazon-once-an-online-bookseller-is-destroying-rare-books-to-train-ai-models/