來源:市場資訊
(來源:澎湃新聞)
引言:舊書店里的最后一座數(shù)據(jù)礦山
今年春夏之交,一些德國二手書店老板陸續(xù)注意到一種不太尋常的現(xiàn)象。舊書店在歐洲是一種文化和商業(yè)傳統(tǒng),你總能在一個城市,尤其是有大學的城市里找到那么幾家古董書店以及二手書店。他們的生意多半寥寥,除了附近人文學科的大學生時常來光顧,或許還有幾個老主顧。自21世紀以來,這早已不是一門主流生意了,店主們多是垂垂老矣的舊時代的遺老。準確地說,這些書店的生存狀況岌岌可危。
![]()
萊比錫大學附近的舊書店,筆者拍攝
但這陣子,每天幾乎在固定時間,系統(tǒng)都會自動跳出一批來自一家名為Zoombooks的加拿大公司的訂單。這家公司并不購買熱門小說,也不追逐初版本、簽名本或者具有收藏價值的古籍,而是大量收購那些長期無人問津的普通舊書:二十世紀七十年代以后出版、帶有ISBN編號、以非虛構類為主的紙質圖書。訂單穩(wěn)定、規(guī)律,像一臺程序設定好的機器,不斷掃空書架上那些積滿灰塵、許多年沒有讀者翻閱過的書,其中還包括烹飪書,民間故事,或是不出名的各類小說和游記。
幾位書店老板交流后發(fā)現(xiàn),這并不是孤例。從德國到西班牙,再到澳大利亞、新西蘭,越來越多舊書商發(fā)現(xiàn)了相同的采購模式。很快,人們開始猜測,這些書或許并不會重新流入市場,而是會被拆解、掃描,成為大型語言模型訓練的數(shù)據(jù)來源。更讓人不安的是,一些媒體進一步推測,完成數(shù)字化之后,這些紙質書可能會被系統(tǒng)性銷毀,以避免再次流通。
盡管涉事公司隨后公開否認了這些說法,目前也沒有證據(jù)證明這些書一定被用于人工智能訓練,但這一事件仍然迅速引發(fā)了歐洲書業(yè)的廣泛討論。令我印象深刻的是,德國媒體和舊書行業(yè)流露出的情緒,并不僅僅是對版權的擔憂,而更像是一種對于書籍命運本身的惋惜。在不少受訪書商看來,一本舊書最大的價值,不在于它是否能夠產(chǎn)生新的商業(yè)利潤,而在于它仍然有機會被另一位陌生讀者重新發(fā)現(xiàn)。書籍完成第一次閱讀之后,并沒有結束自己的生命,它會進入舊書店、圖書館、私人書架,在漫長的流通過程中不斷建立新的聯(lián)系。這種對于書籍物質生命的珍視,是歐洲,尤其德國長期形成的書籍文化(Buchkultur)的一部分。
![]()
慕尼黑一家二手書店的書架,價格在2歐-20歐不等,筆者拍攝。
然而,我發(fā)現(xiàn)自己很難完全站在這種惋惜或是批判的聲音一邊。作為研究者,我太清楚那些尚未完成數(shù)字化的文獻意味著什么。為了尋找一本地方出版社在上世紀八十年代出版的考古學報告,我曾不得不遠赴另一座城市;為了查閱一冊僅存于圖書館特藏室的專業(yè)資料,需要經(jīng)歷漫長的申請與等待,托上四五個認識的朋友同學一層一層去詢問;更多的時候,一本書明明存在于世界某個角落,卻因為沒有電子版本,而幾乎等同于不存在。如果有一天,這些沉睡于舊書店和圖書館里的知識能夠真正進入數(shù)字世界,讓更多研究者、學生和普通讀者自由檢索,我會非常欣喜。
問題因此變得復雜起來。我們歡迎知識被數(shù)字化,因為數(shù)字化意味著更廣泛的傳播、更低的獲取門檻,也意味著更多沉默的文獻終于重新進入公共視野。但與此同時,我們也開始意識到,當人工智能第一次把全球舊書市場視作一座尚未開采的數(shù)據(jù)礦山時,書籍的身份正在悄然發(fā)生變化。對于讀者而言,它仍然是一部作品;對于收藏家而言,它是一件物品;而對于大型語言模型而言,它首先是一份尚未進入訓練集的數(shù)據(jù)。
這或許才是這場事件真正值得討論的地方。過去幾十年,我們不斷討論互聯(lián)網(wǎng)如何改變閱讀方式,而今天,一個新的問題已經(jīng)出現(xiàn):當互聯(lián)網(wǎng)幾乎已經(jīng)被大型模型讀取殆盡之后,人工智能開始轉向紙質世界。它不再尋找新的網(wǎng)頁,而開始尋找那些尚未數(shù)字化的舊書、地方志、行業(yè)出版物和絕版專著。人類文明積累于紙頁之間的大量知識,甚至是百年來積累的過剩的書籍們,第一次以如此明確的方式,被重新定義為一種等待開發(fā)的數(shù)據(jù)資源。
這不只是一個關于版權的故事,也不僅僅是一個關于人工智能對抗舊日人文情懷的故事。它關乎知識將以何種形式繼續(xù)存在,關乎一本書在數(shù)字時代將擁有怎樣新的命運,更關乎一個值得我們長期思考的問題:當人工智能以前所未有的效率利用知識的同時,它是否也在有意無意之間,改變著文化系統(tǒng)賴以延續(xù)的生態(tài)與韌性?
互聯(lián)網(wǎng)之后:人工智能為何重新走向紙質世界
Zoombooks事件揭示了一個根本性的事實:開放互聯(lián)網(wǎng)作為大型語言模型主要知識來源的時代,正在逐漸接近邊界。
過去二十余年,互聯(lián)網(wǎng)幾乎構成了人們對于“知識世界”的全部想象。從維基百科到新聞媒體,從博客、論壇到開放數(shù)據(jù)庫,數(shù)字網(wǎng)絡以前所未有的速度匯聚和傳播著人類文明的成果。對于搜索引擎而言,這意味著知識變得越來越容易獲取;對于大型語言模型而言,則意味著互聯(lián)網(wǎng)成為了前所未有的訓練語料庫。無論是GPT、Claude還是Gemini,其能力的躍升,都建立在對海量網(wǎng)絡文本的統(tǒng)計學習之上。
然而,互聯(lián)網(wǎng)并不等同于全部的人類知識。近年來,人工智能研究領域開始越來越頻繁地討論一個問題:高質量公共文本的增長速度,已經(jīng)無法匹配大型模型對于訓練數(shù)據(jù)的需求。非營利研究機構Epoch AI在關于數(shù)據(jù)趨勢的分析中預測,以目前模型發(fā)展的速度,公開可獲取的高質量文本數(shù)據(jù)將在未來幾年逐漸接近可利用上限。這并不是說互聯(lián)網(wǎng)會停止增長,而是意味著真正具有原創(chuàng)性、可靠性和知識密度的公開文本,其新增速度已經(jīng)遠低于模型參數(shù)擴張的速度。
這里所說的“數(shù)據(jù)耗盡”,并非物理意義上的消失,而是一種邊際效應的下降。互聯(lián)網(wǎng)每天仍然產(chǎn)生數(shù)以億計的新內容,但其中越來越大的比例屬于重復轉載、營銷文本、社交媒體碎片以及算法推薦生成的同質化表達。對于需要不斷學習復雜語言結構和專業(yè)知識的大型語言模型而言,這類內容能夠提供的新信息越來越有限。人工智能需要的不只是更多語言,而是更多此前尚未進入訓練體系的人類原創(chuàng)知識。
與此同時,另一個問題正在出現(xiàn)。隨著生成式人工智能迅速普及,互聯(lián)網(wǎng)本身開始越來越多地由人工智能生產(chǎn)內容。研究者Shumailov等人在《Nature》發(fā)表的論文提出,當模型長期依賴人工智能生成的數(shù)據(jù)繼續(xù)訓練時,模型會逐漸丟失原始數(shù)據(jù)分布中的長尾特征,語言的豐富性和知識的多樣性不斷衰減,最終出現(xiàn)所謂的“模型崩潰”(Model Collapse)現(xiàn)象。換言之,如果未來的人工智能不斷閱讀由人工智能自己生成的文本,它最終學習到的,很可能只是自己不斷放大的回聲。
這一發(fā)現(xiàn)意味著,人類原創(chuàng)內容并不會因為人工智能的發(fā)展而失去價值,相反,它將變得更加重要。大型語言模型必須持續(xù)回到人類創(chuàng)造的知識之中,才能維持語言與思想的開放性。
正是在這樣的背景下,紙質世界重新進入了人工智能的視野。長期以來,互聯(lián)網(wǎng)實際上只是人類知識體系中已經(jīng)完成數(shù)字化的一部分。數(shù)量龐大的地方出版物、行業(yè)協(xié)會資料、專業(yè)教材、地方志、內部研究報告以及二十世紀后半葉的大量紙質出版物,從未真正進入開放網(wǎng)絡。它們既沒有被搜索引擎索引,也沒有被大型模型系統(tǒng)性讀取,卻依然保存著豐富而高度專業(yè)的知識。對于普通讀者而言,這些書籍或許只是舊書店角落里無人問津的庫存;而對于大型語言模型而言,它們卻代表著一片尚未被開發(fā)的數(shù)據(jù)空間。
因此,Zoombooks事件真正值得關注的,是這部分在過去沒有市場價值的舊書如今擁有了數(shù)據(jù)價值。這種價值并非來自版本、裝幀或收藏意義,而來自其中所保存的信息尚未進入數(shù)字世界。一本出版于1983年的地方民族志,一冊某行業(yè)協(xié)會發(fā)行的技術手冊,甚至一本幾十年來幾乎無人翻閱的普通學術專著,都可能因為尚未數(shù)字化,而成為人工智能眼中比一篇早已被反復抓取的網(wǎng)絡文章更有價值的知識來源。
如果說過去二十年,互聯(lián)網(wǎng)曾經(jīng)是等待開發(fā)的知識大陸,那么今天,大型語言模型正在把目光投向另一片長期沉默的大陸,那些仍然存在于紙頁之間、尚未被數(shù)字化的人類知識。人工智能開始購買舊書,并不僅僅意味著一種新的商業(yè)行為,它更標志著知識開發(fā)進入了一個新的階段:當開放互聯(lián)網(wǎng)的邊際效用逐漸下降之后,紙質世界正在成為下一輪知識數(shù)字化的前沿。
知識的第二次去物質化
如果將Zoombooks事件置于更長的知識傳播史中考察,它所揭示的或許并不僅僅是一種新的數(shù)據(jù)獲取方式,而是知識正在經(jīng)歷一次新的媒介轉向。
人類文明的發(fā)展,始終伴隨著知識對物質載體的不斷重新組織。在手抄本時代,知識幾乎與物件本身不可分離。一部作品往往只存在于有限的幾份抄本之中,其傳播速度取決于抄寫者的勞動,閱讀權也因此長期掌握在修道院、宮廷和少數(shù)受過教育的知識階層手中。知識不僅昂貴,而且稀缺,其稀缺性很大程度上并非來自思想本身,而是來自物質復制能力的限制。
十五世紀古騰堡活字印刷術在歐洲的普及,以及更早之前中國雕版印刷與活字印刷的發(fā)展,共同改變了這一局面。書籍史學者Elizabeth Eisenstein在其《作為變革推動者的印刷機》一文指出,印刷革命真正深刻的意義,并不僅僅在于提高了復制效率,而在于它重構了知識的傳播機制。標準化文本、穩(wěn)定的版本和規(guī)模化復制,使知識第一次擺脫了對于唯一物質載體的依賴。一部作品不再只屬于某一本手抄本,而能夠同時存在于成百上千冊完全相同的印刷品之中,閱讀也因此逐漸從少數(shù)人的特權走向更廣泛的社會實踐。
![]()
古騰堡印刷術,1568年出版的木刻插圖,轉引自菲利普·B·梅格斯《平面設計史》(John Wiley & Sons,1998年,第64頁)。
這種變化所帶來的,不只是出版業(yè)的繁榮,更深刻地塑造了現(xiàn)代知識社會。安德森在《想象的共同體》中曾指出,印刷資本主義創(chuàng)造的不只是圖書市場,它還創(chuàng)造了一種共同閱讀的經(jīng)驗。當成千上萬的人閱讀同一種語言、同一種出版物時,一個超越地理空間的文化共同體便得以形成。現(xiàn)代科學、民族國家乃至公共知識空間,都在某種意義上建立于這場媒介革命之上。
因此,印刷革命可以被理解為知識傳播史上的第一次“去物質化”。這里所謂的“去物質化”,并非知識擺脫了物質媒介,而是知識第一次擺脫了對于唯一物件的依賴。它依然存在于書籍之中,卻不再被鎖定于某一本書;它獲得了可以無限復制、廣泛流通的能力,也由此推動了知識門檻不斷向大眾開放。
今天,大型語言模型的發(fā)展,正在推動另一種性質截然不同的變化。
數(shù)字化時代,電子書、數(shù)據(jù)庫和數(shù)字圖書館雖然改變了知識的傳播媒介,但一本書仍然作為一部完整的作品存在:它有作者、有書名、有章節(jié),也保留著相對穩(wěn)定的文本邊界。然而,進入大型語言模型之后,書籍卻經(jīng)歷了另一種徹底的轉換。一本書不再作為作品被保存,而是被拆解為數(shù)以萬計的詞元(tokens),經(jīng)過向量化和概率建模,重新組織為參數(shù)之間的統(tǒng)計關系。對于模型而言,它并不會“擁有”一本書,而只是吸收其中的語言模式。
如果說印刷革命讓知識脫離了唯一的手抄本,那么人工智能正在讓知識進一步脫離作品本身。
媒介理論學者N. Katherine Hayles認為,信息始終體現(xiàn)于具體媒介之中,媒介不是意義之外的容器,而是意義生成的一部分。然而,大型語言模型所完成的,并不是一次新的出版,而是一次新的計算。知識第一次不再以書籍、文章或文獻作為自身存在的基本單位,而越來越以參數(shù)、向量和概率分布的形式存在于模型內部。對于人工智能而言,一本書的價值,不再首先來自它作為文化對象的完整性,而來自其中尚未進入模型的信息。
這就是我們正在目睹的第二次知識的去物質化。
結語:另一座巴別圖書館
博爾赫斯曾在書中設想了一座無限的巴別圖書館。那里擁有六角形大廳、無窮無盡的書架,以及由有限字符排列組合而成的所有可能存在的書。每一本已經(jīng)寫出的作品,每一本尚未寫出的作品,每一種真實與虛假的歷史,都已經(jīng)存在于這座圖書館之中。然而,圖書館的居民并沒有因此獲得智慧。恰恰相反,他們陷入了永恒的迷失。因為當所有書都存在時,沒有人再知道哪一本值得閱讀;當所有真理都存在時,也沒有人能夠辨認真理。他們隨意毀壞他們認為是無意義的書,最終相繼走向不可避免的自我滅亡。
![]()
博爾赫斯《巴別圖書館》西班牙語版封面。
某種意義上,大型語言模型正在建造另一座巴別圖書館。它并不會收藏所有的書本本身,也不會像亞歷山大圖書館那樣珍藏文明的原件。相反,它把無數(shù)書籍拆解、熔煉、重新組織,讓它們共同存在于數(shù)千億參數(shù)構成的統(tǒng)計空間之中。那里沒有封面,沒有裝幀,沒有版本,也沒有一本可以被重新翻開的《堂吉訶德》或《資本論》。書籍作為作品消失了,留下的是知識之間不斷流動的概率關系。
作為人文學術研究,我很難對這場數(shù)字化浪潮持一種簡單的悲觀態(tài)度。因為真正限制人文學科發(fā)展的,往往不是思想,而是文獻本身的可獲得性。大量具有學術價值的地方文獻、專業(yè)出版物和灰色資料,至今仍沉睡在圖書館特藏室、地方檔案館或小型出版社之中。它們沒有電子版本,沒有全文數(shù)據(jù)庫,也很少進入國際館際互借體系。對于絕大多數(shù)研究者而言,我們知道它們存在,也知道它們可能重要,卻始終無法閱讀。因此,我始終期待更多文獻能夠完成數(shù)字化。讓那些受限于地理、館藏和成本的知識重新進入公共空間,讓更多學生、研究者和普通讀者真正接觸它們,這無疑延續(xù)了印刷革命以來知識不斷走向開放的歷史方向。
但這里必須強調,訓練大語言模型和數(shù)據(jù)電子化是同樣過程的不同分支。公共數(shù)字化的目標,是讓更多人重新閱讀一部作品;而大型語言模型的訓練,則是讓模型吸收作品中的信息。前者保存的是一本書,后者保存的是一本書經(jīng)過統(tǒng)計之后留下的語言模式。數(shù)字圖書館試圖擴大公共知識,而人工智能訓練目前更多是在擴大模型自身的知識能力。二者當然并非毫無關聯(lián)。事實上,大規(guī)模人工智能訓練往往伴隨著文獻掃描、OCR識別、文本整理和元數(shù)據(jù)建立等數(shù)字化過程,從技術路徑上看,它們共享著相當一部分基礎設施。未來,如果這些數(shù)字化成果能夠在版權許可或公共機構的推動下重新進入公共知識體系,那么人工智能的發(fā)展甚至可能成為推動更多文獻數(shù)字化的一股力量。然而,至少在今天,二者之間仍然存在著本質區(qū)別:絕大多數(shù)被掃描進入訓練流程的書籍,并不會因此重新回到公眾手中。知識被數(shù)字化了,卻未必因此公共化;知識被開放給了模型,卻未必被開放給了公眾,盡管這兩者確實相伴而行。
![]()
意大利作家翁貝爾托·埃可受博爾赫斯影響,在其著作《玫瑰的名字》里所設計的圖書館,代表整個世界,四角為四個六邊形的藏書室。
正如第一次印刷革命曾經(jīng)打破手抄本時代的知識壟斷一樣,人工智能同樣可能推動人類知識以前所未有的方式流通。作為研究者,我真誠期待那些長期沉睡于地方圖書館、舊書店和檔案館中的文獻能夠完成數(shù)字化,讓更多原本無法觸及它們的人重新獲得閱讀的機會。如果人工智能能夠降低知識獲取的門檻,它無疑延續(xù)了印刷革命以來知識不斷走向公共的歷史方向。
真正值得警惕的,并不是數(shù)字化本身。而是當知識越來越容易被計算之后,我們是否仍然能夠保留一種判斷知識價值的能力。
我曾在討論歐洲古書市場時寫過,真正珍貴的古籍、手稿、地圖和初版本,并不會因為數(shù)字化而失去價值。相反,它們作為歷史物件的獨特性,正隨著數(shù)字復制能力的提高而愈發(fā)凸顯。它們承載的不只是信息,還有時間留下的痕跡、閱讀發(fā)生過的證據(jù),以及任何掃描都無法復制的在場性。真正不可替代的,始終是那些作為“物”存在的文化遺產(chǎn)。
然而,問題也恰恰出現(xiàn)在這里。哪些書屬于不可替代的文化遺產(chǎn)?哪些書只是等待被掃描的數(shù)據(jù)?哪些書值得永久保存,哪些書可以在完成數(shù)字化之后退出流通?
過去,這些判斷更多來自圖書館、大學、出版機構、收藏家以及一代又一代讀者共同形成的文化共識。它們未必總是正確,卻始終是一個開放而不斷修正的公共過程。而當大型語言模型開始以“訓練價值”重新定義書籍時,一套新的價值體系正在形成。一本地方出版社出版的普通專著,也許對于未來某位歷史學家具有不可預知的意義;但對于算法而言,它首先是一份數(shù)據(jù),一旦完成吸收,其物質存在便失去了功能。
于是,我們最終面對的問題,不僅僅是人工智能是否會取代閱讀,而是:誰擁有定義一本書價值的權力?誰來決定哪些書可以被銷毀,哪些則應該被保留在文物室里。
我們當然期待技術繼續(xù)推動知識傳播,但或許也應當保留一種謙遜:并非所有今天看似無用的書,都注定無用;并非所有尚未被閱讀的知識,都應該首先成為訓練數(shù)據(jù)。
博爾赫斯沒有告訴我們巴別圖書館是否值得建造。
今天,大型語言模型也許正在建造另一座屬于數(shù)字時代的巴別圖書館。它能夠以前所未有的效率組織和利用知識,卻仍然無法替人類回答一個始終屬于文化的問題:一本書真正的價值,究竟來自它所包含的信息,還是來自它始終作為一本書存在于世界之中。真正值得我們憂慮的,或許并不是AI擁有了無限的知識,而是當所有問題似乎都能夠迅速獲得答案時,人們反而失去了在閱讀中尋找意義的過程。閱讀一本書,從來不僅僅是獲取信息,也是進入作者的時代、思想與生命經(jīng)驗,與一種陌生性不斷相遇。當知識經(jīng)過模型的熔煉,以更加高效、更加濃縮的形式重新呈現(xiàn)給我們時,它當然降低了知識獲取的門檻,卻也可能消解了知識原本賴以生成意義的語境。
因此,值得討論的還有一個更具人文意味的問題:當越來越多的人通過人工智能接觸那些被重新組織、重新表述甚至重新解釋過的知識時,我們獲得的是更加豐富的理解,還是一種知識過剩之后的無意義感?人工智能能夠以前所未有的效率回答問題,卻未必能夠替代閱讀一本書時緩慢形成理解、懷疑與判斷的過程。也許,人類真正需要精進的,并不是獲取答案的能力,而是在無限接近答案的時代,依然愿意走進一本書、繼續(xù)提出問題的能力。真正需要守護的,也許不是知識本身,而是文化系統(tǒng)的韌性,一種允許冷門的書繼續(xù)留在書架上,允許尚未被理解的思想繼續(xù)等待下一位讀者的從容。人類文明最重要的財富,并不只是已經(jīng)被高效利用的知識,我們歡迎知識更開放,但文化的生命力,不僅來自知識被利用的效率,也來自那些暫時無用、尚未被閱讀、卻仍然得以存在的可能性。
黑塞提出過所謂消遣的藝術,我們閱讀并非純然為了獲得絕對功利或實用的知識,也不是只為了追問AI一句這本書的中心論點和寫作方式是什么,而是以閱讀的方式與作者跨時空跨地域地進行對話。米沃什說,至少還有書籍;毛姆說,養(yǎng)成閱讀的習慣,就是為自己建造一座幾乎可以躲避人生所有苦難的避難所。此時今日,所有著作都可以在幾秒內被大語言模型蒸餾,但閱讀從來不是為了抵達結論,而是為了經(jīng)歷一段思想的旅程。循此苦旅,以達繁星。
參考文獻:
Anderson, B. (1983).Imagined Communities. Verso.
Benjamin, W. (2008).The Work of Art in the Age of Mechanical Reproduction(H. Zohn, Trans.). Penguin. (Original work published 1936)
Borges, J. L. (1998).The Library of Babel. InCollected Fictions. Penguin. (Original work published 1941)
Darnton, R. (1982).What Is the History of Books?Daedalus, 111(3), 65–83.
Darnton, R. (2009).The Case for Books. PublicAffairs.
Eisenstein, E. L. (1979).The Printing Press as an Agent of Change. Cambridge University Press.
Floridi, L. (2011).The Philosophy of Information. Oxford University Press.
Hayles, N. K. (2002).Writing Machines. MIT Press.
Shumailov, I., et al. (2024).AI models collapse when trained on recursively generated data. Nature.
Villalobos, P., et al. (2024).Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data. Epoch AI.
Schaffer, A., Oremus, W., & Tiku, N. (2026).Inside an AI startup's plan to scan and dispose of millions of books. Washington Post.
Badische Zeitung. (2026).Bei Antiquariaten gehen Millionen Buchbestellungen von Zoom Books ein – Alles für KI-Training?https://www.badische-zeitung.de/bei-antiquariaten-gehen-millionen-buchbestellungen-von-zoom-books-ein-alles-fuer-ki-training-in-den
Publishers Marketplace. (2026).Canadian Company Zoom Books Is Buying Second-Hand Books for Scraping?https://lunch.publishersmarketplace.com/2026/05/canadian-company-zoom-books-is-buying-second-hand-books-for-scraping/
SRF Kultur. (2026).Jagd auf alte Bücher – KI-Firmen kaufen Antiquariate leer und vernichten die Bücher.
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.