AI 開始按噸買書:當人類知識被掃描保存,實體書卻可能正在消失
30秒摘要
日本古書市場近期出現異常大量訂單,有店家單日銷售達平時約 5 倍,哲學、歷史、醫學、法律與江戶文化等冷門專業書也被大量購入。另一條調查線索則顯示,日本書籍已有累計超過 50 噸出口至美國。雖然目前仍無法證明這些神祕古書訂單全部流向同一家 AI 公司,但 Anthropic、Amazon 等相關案例已證實,AI 產業確實正在大規模購買、裁切、掃描實體書。當一本書被轉換成 OCR、tokens 與 training corpus,我們究竟保存了知識,還是只保存了知識的一部分?
重點摘要
- 01日本多家古書店自 2026 年 8 月起出現異常大量訂單,部分店家單日營收曾達平常約 5 倍。
- 02被大量購入的不只是暢銷書,而包含哲學、歷史、醫學、法律與江戶文化等冷門專業出版物。
- 03日媒另外發現日本書籍累計超過 50 噸出口美國的紀錄,但不能證明與岡山古書訂單是同一批貨。
- 04Anthropic 的法院文件與 404 Media 對 Amazon 設施的調查,都證明 AI 產業已實際使用破壞式掃描取得紙本資料。
- 05AI 生成內容大量進入網路後,具有明確出版年代的紙本可能成為珍貴的 Pre-AI Data。
- 06數位化可以保存文字內容,但不能自動保存紙張、版次、裝訂、讀者註記與其他物質文化資訊。
一場看起來很棒的古書市場榮景
2026 年夏末,日本一些古書店突然遇到一件原本應該值得開香檳慶祝的事:書開始瘋狂賣出去。
根據日本電視台 NTV 的調查,自 8 月左右開始,日本各地透過大型線上市集販售書籍的古書店陸續收到異常大量訂單。
有店家表示,一天可以賣出約 100 本書;有些日子的營業額甚至達到平常約 5 倍。另一家關東地區古書店累計售出的書籍已超過 1000 本。
但很快地,店家發現事情有點奇怪。
這些訂單並不是漫畫、暢銷小說或熱門寫真集。
被大量買走的反而包括:
- 哲學
- 歷史
- 醫學
- 法律
- 江戶時代生活與文化
- 數十年前的日本政治與政界資料
- 各種原本銷售速度非常慢的專業書籍
甚至有古書店形容,這些書的選擇看起來幾乎「沒有脈絡」。
更奇怪的是,部分訂單透過不同帳號規律出現,收件地址卻集中指向岡山縣的一處物流中心。
有店家因此懷疑,這不像普通讀者正在建立私人藏書室,更像是一套自動化採購系統正在按照某種資料清單掃描整個二手書市場。
東京都古書籍商業協同組合也向日媒表示,業界已經注意到類似現象,而其中流傳最廣的推測就是:
這些書可能正在被收集作為生成式 AI 的學習資料。
但這裡必須先畫下一條非常重要的證據界線。
截至目前,岡山物流中心背後的最終買家並未公開,相關企業也沒有證實這批日本古書就是替某一家 AI 公司採購。
所以目前可以確認的是「大量訂單存在」,而「AI 是最終買家」仍屬於高度受到關注、但尚未完全被證實的推論。
另一條線索:超過 50 噸日本書籍正在前往美國
NTV 的調查還找到另一組更加驚人的資料。
透過進出口紀錄分析,日本某出版流通相關企業的集團公司,自 2025 年以來曾以 JAPANESE BOOKS 的名義,向美國出口累計超過 50 噸書籍。
50 噸是什麼概念?
如果非常粗略地假設一本較重的書約 500 公克,50 噸大約相當於 10 萬本書的重量級別。
但這個數字不能和岡山古書事件直接畫上等號。
目前公開資料並沒有證明:
日本古書店大量訂單 → 岡山物流中心 → 這 50 噸出口貨物
是一條完整且相同的物流鏈。
兩者是日媒在追查 AI 書籍資料供應鏈時找到的兩組相關線索。
這個區分很重要,因為英文媒體後續轉述時,很容易把故事壓縮成「AI 公司一次從日本買了 50 噸古書」。
現階段,更準確的說法應該是:
日本古書市場確實出現異常大量採購,而另一批進出口資料則確認有累計 50 噸以上日本書籍流向美國;兩者是否屬於同一採購網路,目前尚無公開證據可以證實。
可是事情到這裡並沒有因此變得比較普通。
因為我們已經知道另一件事:
AI 公司真的會買紙本書,而且是按工業規模購買。
Anthropic 已經證明:紙本書可以直接變成 AI 原料
2025 年 Anthropic 與作者之間的著作權訴訟,意外揭開了一條非常少被一般使用者看見的 AI 資料供應鏈。
法院文件顯示,Anthropic 曾花費數百萬美元取得大量實體書籍,並建立大規模數位化流程。
它的做法並不是拿著手機一本一本翻頁拍照。
而是更接近工業加工:
買書 → 拆除或切除裝訂 → 分離頁面 → 高速掃描 → OCR → 建立數位文本 → 紙本退出原本的流通狀態
之所以要切掉書背非常簡單。
一本正常裝訂的書不適合高速自動送紙掃描器。
但是只要把裝訂裁掉,幾百頁紙就可以像影印文件一樣高速通過掃描設備。
對處理數百萬本書的系統而言,每本節省幾分鐘,最後就是天文數字般的效率差距。
Anthropic 因此不是把書當成「一本書」處理。
在這條 pipeline 裡,它更像:
數百頁尚未被數位化的高品質文字資料。
書籍原本的物質形式,在資料工程的視角裡反而成為需要被移除的包裝。
2026 年,Amazon 的掃書工廠也被追到了
事情並沒有停在 Anthropic。
2026 年 8 月,404 Media 做了一個非常漂亮,甚至有點像諜報故事的調查。
記者在一批疑似可能被 AI 公司收購的稀有書籍中放入追蹤裝置,接著一路追蹤貨物。
最後,這批書抵達 Amazon 位於美國拉斯維加斯的一處設施。
404 Media 隨後訪問了曾在該設施工作的員工。根據相關描述,設施會收到大量紙本書籍,工作流程包含移除書籍裝訂,讓頁面可以高速進行數位掃描。
也就是說,這已經不是單一公司的偶發性實驗。
實體出版物正在逐漸成為 AI 資料產業的一種供應來源。
這讓日本古書店突然收到大量專業書訂單的故事,多了一層非常現實的背景。
即使目前不知道岡山物流中心最後替誰服務,市場對 AI 採購的懷疑並不是憑空想像。
類似的產業需求確實存在。
可是 AI 不是早就把網路讀完了嗎?為什麼還要買紙本?
這才是整件事情最有意思的地方。
2020 年代初期,大型語言模型最容易取得的資料來源是網際網路。
網站、Wikipedia、論壇、新聞、論文、電子書、程式碼 repository,各種公開資料可以被大量蒐集。
但到了生成式 AI 大規模普及之後,一個新的問題逐漸浮現:
網路開始充滿 AI 自己產生的文字。
搜尋結果裡有 AI SEO 文章。
購物網站有 AI 商品描述。
論壇開始出現 bot 回覆。
電子書平台甚至出現大量 AI 生成書籍。
網站又引用其他 AI 網站,而後者可能再引用前一篇 AI 文章。
資料開始形成一個奇怪的迴圈:
人類資料 ↓ 訓練 AI ↓ AI 產生內容 ↓ 內容重新進入網路 ↓ 下一代模型再次讀取
對 AI 公司而言,這會產生非常麻煩的 Data Provenance 問題:
你抓到的這段文字,到底是一名醫師 1994 年寫的專業文章,還是一個 2025 年模型讀完那篇文章後重新改寫的內容?
這時候,一本 1987 年出版、從來沒有被完整數位化的醫學專書,突然變得異常珍貴。
因為你幾乎可以確定:
它不是 ChatGPT 寫的。
紙本開始變成「Pre-AI Data」
這讓舊書出現一個以前不存在的價值。
它們不只是舊知識。
它們還是一種有明確年代來源的 Pre-AI Data。
一本 1978 年出版的哲學書,不可能偷偷混入 2026 年大型語言模型生成的段落。
一本 1993 年的政治回憶錄,也不會被現代 SEO farms 重新拼接。
一本 1985 年的地方史可能從未出現在 Google Books、Internet Archive 或任何公開全文資料庫裡。
從 AI 訓練角度來看,這是一座非常乾淨的地下礦脈。
而且出版物通常經過:
作者 ↓ 編輯 ↓ 校對 ↓ 出版 ↓ 讀者市場
與隨機網頁相比,文字品質、結構與語法通常更加穩定。
於是,一個非常諷刺的現象出現了。
AI 原本靠網際網路長大,當網際網路開始被 AI 自己的內容污染後,它又重新回頭挖人類的紙本世界。
我們花了三十年把世界數位化。
現在最先進的 AI 公司,卻開始派卡車回去找那些還沒有被數位化的東西。
問題是:掃描一本書,真的叫做「保存」一本書嗎?
乍看之下答案似乎很簡單。
書掃成 PDF 了。
文字 OCR 出來了。
甚至 AI 可以搜尋它、理解它、回答裡面的內容。
知識不是保存得更好了嗎?
某種程度上,是。
但這裡有一個文化保存領域早就非常熟悉的區別:
Digitization 不等於 Preservation。
數位化保存的是某些資訊。
實體保存保存的是整個物件。
例如一本 1930 年代出版的書,其研究價值可能不只有正文。
它還包含:
- 紙張材質
- 油墨
- 印刷技術
- 裝訂方法
- 原始封面
- 插圖
- 排版
- 當年的售價
- 書店標籤
- 藏書章
- 前任讀者筆記
- 修補痕跡
- 頁面污漬
- 特定版次的錯字
甚至一本書被誰擁有過,本身都可能是一段歷史。
OCR 對這些東西基本上毫無興趣。
對 OCR 而言:
「第 147 頁寫了什麼?」
非常重要。
但是:
「第 147 頁邊緣有一名 1960 年代讀者用鉛筆寫了什麼?」
可能直接被裁掉、忽略或辨識失敗。
因此,把一本書轉成純文字,其實就像把一棟古建築完整做成 3D Scan,接著把建築拆掉,再宣布:
我們已經保存它了。
你確實保存了一部分非常重要的資訊。
但你沒有保存那棟建築。
一本書不是 ZIP 檔案的紙本版本
這也是數位時代非常容易出現的一個認知錯誤。
我們習慣把「資訊」和「載體」分開。
照片可以從 HDD 複製到 SSD。
MP3 從一台電腦搬到另一台,基本沒有差別。
TXT 複製一千次,內容仍然相同。
因此很容易產生一種直覺:
書也只是文字的 container。
只要把內容取出來,原本的 container 就沒有用了。
但是歷史文物並不是這樣運作。
莎士比亞作品的現代電子版可以完美保存文字,但一冊 1623 年出版的 First Folio 不會因此失去價值。
因為物件本身就是資訊。
這就是 Material Culture,物質文化 的概念。
人類如何製造物件、如何使用它、如何在上面留下痕跡,本身就是文化資料。
當 AI 資料 pipeline 只保留 machine-readable text 時,它其實是在進行非常強烈的資訊選擇:
文字重要,物件不重要。
而這個價值判斷不一定適用於歷史學家、圖書館員、收藏家或未來研究者。
真正危險的可能不是暢銷書,而是「沒人覺得重要」的書
假設一家 AI 公司買走 10 萬本《哈利波特》,文化保存問題其實相對有限。
因為世界上還有大量副本。
真正值得注意的是另一種書:
1982 年某個地方政府出版的產業調查。
1976 年只印過一次的哲學評論。
1991 年某位教授的小型研究專著。
昭和時代某個地區的生活史。
早已倒閉出版社出版的醫學教材。
這些書在市場上的售價可能只有幾百日圓。
但是「便宜」不代表「很多」。
二手市場可能只剩幾十本甚至更少。
傳統收藏家看到一本少見的書,可能會珍惜它。
可是自動化 AI 採購系統看到的可能只是:
ISBN 價格 480 日圓 尚未存在 corpus BUY
機器不一定知道自己正在買的是全世界最後 20 本之一。
這就是大規模資料採購與傳統收藏市場最不同的地方。
AI 不需要認為一本書有文化價值,才會想要它。
它只需要判斷這本書包含模型尚未擁有的資訊。
甚至可能出現「數位保存了,但公共存取反而消失」
這裡還有另一個非常微妙的問題。
想像某本冷門書原本存在於:
東京古書店 3 本 京都 2 本 私人收藏 5 本 地方圖書館 1 本 網路全文 0 本
它雖然稀少,但仍然是一種分散式存在。
任何收藏者、研究者都有可能在市場上取得它。
現在 AI 公司買走其中五本。
書被裁切、掃描。
文字變成高品質數位資料。
從資訊工程角度看:
availability 上升了。
但是如果這個 corpus 屬於企業內部、不對外公開呢?
那麼可能出現:
實體公開市場副本 ↓
私人 AI dataset ↑
人類研究者可直接取得的版本 ↓
模型可存取的版本 ↑
這是一種非常奇怪的知識集中化。
書裡的內容沒有消失,但控制內容的人變少了。
AI 可能可以回答這本書講過什麼,而你本人卻再也找不到一本可以翻閱的原書。
著作權問題甚至還不是整件事最難的部分
AI 與書籍的爭議過去大多集中在 Copyright。
作者有沒有授權?
訓練算不算 Fair Use?
盜版電子書能不能拿來建立資料庫?
這些問題當然重要。
Anthropic 的案件就清楚顯示,美國法院曾區分兩件事情:
利用合法取得書籍進行模型訓練,以及持有透過盜版來源取得的書籍資料庫,法律問題並不完全相同。
Anthropic 後續也與作者集體訴訟達成規模達 15 億美元的和解。
可是即使明天全世界突然把 AI 訓練的著作權規則全部寫清楚,另一個問題仍然存在:
合法買下一件東西,是否代表大規模消耗它永遠沒有文化成本?
如果某家公司合法買走最後一千本某種絕版地方史,然後全部裁切掃描,它可能沒有偷任何一本書。
但文化保存問題依然沒有消失。
法律回答的是 ownership。
保存科學問的是 survival。
兩者不是同一個問題。
圖書館早就知道:不是所有東西都該用同一種方式掃
事實上,人類並不是直到 AI 時代才發明書籍數位化。
圖書館、博物館、檔案館已經做了幾十年。
對普通、大量、仍有很多副本的出版物,可以使用快速掃描。
但面對稀有書籍,保存機構通常會使用更溫和的方法:
- 非破壞式 overhead scanner
- V-shaped book cradle
- controlled lighting
- 高解析攝影
- 色彩校正
- metadata cataloging
- 保存原始頁面布局
速度會慢很多。
成本也高很多。
但目的完全不同。
圖書館的目標通常是:
Digital Copy + Original Object
而工業級 AI dataset pipeline 更容易追求:
Machine-readable Text / Cost / Throughput
當處理量從 100 本變成 100 萬本時,每一本多花 10 分鐘都是巨大的成本。
於是書背開始變成 throughput 的敵人。
這就是文化保存與資料中心邏輯真正碰撞的地方。
更合理的未來可能不是「禁止 AI 買書」
完全禁止 AI 公司購買舊書恐怕既不實際,也不一定合理。
很多二手書最後原本就可能因為無人購買而被回收。
大規模數位化反而可能讓部分從未進入網路的知識第一次留下數位副本。
真正需要解決的可能是稀缺性辨識。
例如在破壞性掃描以前先建立幾道 gate:
1. 確認館藏數量
WorldCat、國家圖書館、ISBN database 或地方館藏系統中還存在多少副本?
2. 辨識版次
同一本書的初版、修訂版、地方限定版可能完全不同。
3. Rare-book threshold
當可確認副本數低於一定程度,自動轉入 non-destructive scanning。
4. Preserve-one policy
至少保留一份完整實體樣本進入公共或合作保存機構。
5. Archive copy
除了 AI 用純文字 corpus,也建立高解析原始頁面檔案與 metadata。
這些做法都會增加成本。
但相較於訓練 frontier model 所需要的龐大 GPU、電力與資料中心投資,保存一本已經存在幾十年的實體書,其實可能是整條 AI pipeline 最便宜的一環。
AI 時代開始讓「什麼值得保存」重新變成科技問題
這件事最後真正有趣的地方,可能並不是日本古書店突然多賺了五倍。
它揭露的是 AI 發展到下一個階段後,一個以前很少有人想到的資源問題。
早期 AI 缺的是算力。
後來缺 GPU。
再後來缺電、資料中心與 HBM。
現在另一種稀缺資源逐漸浮現:
沒有被 AI 生成過的人類知識。
紙本書恰好是一個巨大、離線、具有年代證明,而且仍然沒有被完整數位化的 repository。
於是一本在古書店角落放了二十年的哲學書,突然可能成為 frontier AI company 想取得的 training asset。
它的價格也許只有 300 日圓。
它的內容卻可能從未存在於任何大型語言模型的資料裡。
這是一個非常奇怪的新世界。
AI 讓舊書重新有價值。
AI 也可能因此讓某些舊書消失得更快。
我們到底保存了什麼?
假設一本 50 年前的書只剩最後一份。
我們把它完整掃描。
OCR 準確率 99.99%。
圖片全部保存。
全文可以永久搜尋。
然後原書被裁掉書背、拆成數百張紙,最後回收。
知識有沒有消失?
沒有完全消失。
那本書有沒有消失?
有。
兩個答案可以同時成立。
而 AI 時代可能逼迫我們第一次大規模面對這個差別。
我們以前認為數位化的敵人是遺忘。
現在卻可能遇到另一種情況:
因為我們太急著保存資訊,反而消耗了資訊原本存在的物件。
也許未來真正重要的原則不是拒絕 AI 閱讀人類留下來的書。
而是在模型讀完它們之後,確保人類仍然有機會讀到原來的那一本。
Tech English|本文專有名詞
Destructive Scanning|破壞式掃描
為了提高掃描速度而切除書背、拆開裝訂,使單張頁面可以進入高速掃描設備。效率高,但通常無法讓書籍恢復原本完整狀態。
Optical Character Recognition, OCR|光學字元辨識
把掃描圖片中的文字辨識成電腦可搜尋與處理的文字資料,是紙本書進入 AI 資料 pipeline 的重要步驟。
Training Corpus|訓練語料庫
用來訓練語言模型的大型文字集合,可以包含網站、書籍、論文、程式碼與其他文本資料。
Data Provenance|資料來源追溯
記錄資料來自何處、何時產生、經過哪些處理。生成式 AI 大量進入網路後,判斷資料究竟源自人類還是其他模型變得愈來愈重要。
Digital Preservation|數位保存
利用數位檔案長期保存內容與相關資訊,但並不等同於保存原始實體物件,因此通常需要搭配 metadata、格式管理與實體保存策略。
Material Culture|物質文化
研究人類製造與使用的實體物件所承載的文化資訊。對書籍而言,紙張、裝訂、筆記、藏書章、版次與磨損本身都可能具有研究價值。
核心結論
AI 公司對高品質、可追溯且較少受到生成內容污染的資料需求,正在讓紙本舊書成為新的資料資源,但把書籍轉換成訓練語料並不等於完整保存書籍本身。
為什麼重要
如果大規模 AI 採購開始進入全球二手書市場,影響的可能不只有著作權,而是絕版書、地方史與冷門專業出版物的實體存量。未來 AI 資料治理可能必須同時考慮資料品質、來源追溯與文化保存。
本文技術
限制與注意
- •目前沒有公開證據證明 2026 年 8 月起集中送往岡山物流中心的日本古書訂單,最終買家就是 Anthropic、Amazon 或其他特定 AI 公司。
- •日本古書店大量訂單與累計超過 50 噸日本書籍出口美國,是調查中找到的兩組線索,目前不能直接視為同一批貨物。
- •50 噸約等於 10 萬本書僅是以每本約 500 公克進行的粗略重量換算,不代表實際出口冊數。
- •並非所有被 AI 公司購買或數位化的紙本書籍都一定屬於稀有書籍;文化保存風險取決於版次、現存副本數與掃描方式。
- •破壞式掃描可以提高大規模數位化效率,也可能保存原本缺乏數位副本的文本,因此其文化影響並非只有單一方向。
- •不同國家的著作權、合理使用與 AI 訓練規範不同,美國法院案例不能直接套用至日本、台灣或其他司法管轄區。
資料來源
404 Media — We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility
Investigation
404 Media — Inside the Warehouse Where Amazon Scans and Destroys Books for AI Training
Investigation / Interview
原始來源
news.ntv.co.jp相關公司
Anthropic
Amazon


