AI 大模型的訓練離不開海量高質量文本數據,而書籍作為結構化的深度內容載體,正是這類數據的核心來源之一 —— 但版權問題始終是行業繞不開的痛點。最近,美國 AI 公司 Anthropic 在法庭文件中披露了一項名為 “巴拿馬項目” 的計劃:通過第三方渠道購入海量實體書籍,經高精度掃描提取完整文本內容后,不僅會統一銷毀全部實體書籍載體,還會對存儲原始掃描副本的設備執行專業的硬盤數據文件銷毀,全程僅留存經標準化處理的訓練用文本片段,這套試圖 “去痕跡化” 的特殊操作隨即引發行業廣泛爭議。Anthropic 成立于 2021 年,由前 OpenAI 員工達里奧?阿莫迪等人創辦,2023 年估值約 150 億美元,核心產品是 Claude 系列大模型。
![]()
為開發軟件,AI公司銷毀了數百萬冊實體書籍
巴拿馬項目的核心流程形成了 “采購 — 數字化提取 — 載體數據銷毀” 的完整鏈路:通過第三方供應商從書店、批發商處購入數百萬本實體書,覆蓋小說、學術著作、專業教材等多個類別;之后用光學字符識別(OCR)技術進行高精度掃描 —— 準確率超過 99.5%,提取的結構化文本全部用于 Claude 模型訓練;數字化工作完成后,所有采購的實體書籍便被統一進行數據銷毀,全程未留存原始實體副本。這些細節是 2024 年上半年通過版權訴訟的法庭文件曝光的,文件顯示該項目至少從 2022 年啟動,一直持續到 2023 年底,主要在美國境內開展,掃描工作由合作技術服務商負責,書籍采購則覆蓋了多個州的渠道。
Anthropic 的內部文件指出,公開網絡上的文本數據質量良莠不齊,且版權風險較高;相比之下,書籍內容的權威性和結構化程度更高,能有效提升模型的推理能力和知識準確性。但直接獲取版權授權不僅成本高昂,流程也十分復雜,因此他們才選擇了這種 “先復制內容、再銷毀載體” 的曲線方案,試圖通過實體書的數據銷毀弱化復制行為的版權屬性,打合規擦邊球。不過,這種做法大概率涉嫌違反美國《版權法》—— 版權保護的核心是作品的復制權與傳播權,即便完成了實體載體的數據銷毀,未經授權制作受版權保護作品的數字化副本這一行為本身,已然構成侵權事實。麥肯錫 2024 年發布的《AI 數據倫理報告》顯示,68% 的 AI 企業存在數據來源不透明的問題,32% 則涉及潛在的版權風險。
![]()
合規銷毀數據文件硬盤
相比之下,其競爭對手的做法要合規得多:OpenAI 在 2023 年與企鵝蘭登書屋、哈珀柯林斯等出版社達成了版權合作,從源頭獲得合法授權;Google DeepMind 則在 2024 年 3 月發布《訓練數據透明度白皮書》,詳細列出了數據來源及授權情況。Anthropic 這種寄望于載體數據銷毀來規避版權責任的激進操作,未來恐怕會面臨更多法律訴訟的風險。
行業層面,歐盟 AI 法案已于 2024 年 5 月正式生效,要求 AI 開發者披露訓練數據的來源及版權狀態,違規者最高將面臨全球營業額 4% 的罰款。而在競爭對手這邊,Meta 在 2024 年 6 月推出了 “開放數據聯盟”,聯合出版社和學術機構搭建合法的訓練數據共享平臺,試圖從根本上解決行業的數據來源難題。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.