小推 2026-09-24 AI大模型开始抢购纸质旧书?揭秘优质训练数据的断粮困境 摘要: 该消息披露AI巨头批量收购旧书扫描训练,揭示了互联网公开数据耗尽与合成垃圾污染的现实。本文深度解构大模型“吃纸”背后的数据危机与未数字化知识的独特价值。网友动态:大模型终于开始“吃纸”了。最近日本古书界发现,大批旧书正被扫货:历史、医学、法律、地方志,几乎来者不拒。有人统计,已有超过50吨日本书籍运往美国。原因可能很简单:互联网快被AI吃秃了。公开网页抓了一轮又一轮,网上又开始被AI生成内容反向污染。于是,那些几十年没数字化过的旧书,突然成了最干净的数据矿。Anthropic此前就被曝批量买实体书,切书脊、扫描、数字化,拿来建立训练资料库。最讽刺的是:几万亿美元的AI产业,最后开始去旧书摊找粮。以前嫌纸书落后。现在才发现,真正稀缺的,可能就是那些——AI还没读过的东西。来源:日テレNEWS、美国联邦法院公开文件我的评价:这条消息极其深刻地揭示了现代人工智能产业在迈向更高级形态时,所遭遇的“数据枯竭危机(Data Wall)”与“数字近亲繁殖”的严峻现实。它用“切书脊、去旧书摊找粮”这样具象且充满讽刺意味的细节,撕开了万亿美元高科技产业最原始、最接地气的一面。1. “互联网数据枯竭”与“合成垃圾反噬”的双重困境大模型“吃纸”的最直接原因,是高质量数字数据的干涸:公开网文抓取殆尽:主流大模型(如 GPT-4、Claude 3 等系列)几乎已经吞下了互联网上过去二三十年积累的所有公开高质量文本(Wikipedia、GitHub、Reddit、新闻媒体、学术论文等)。AI生成内容的“毒化”:正如动态所言,现在的互联网正充斥着大量由 AI 批量生成的垃圾文本(SEO 文章、营销号废话)。如果继续用互联网上的新数据训练 AI,就相当于“用 AI 的排泄物喂养新的 AI”,会导致模型能力退化、幻觉加剧(即学术界所说的 Model Collapse,模型坍塌)。2. 未数字化的古籍与旧书:绝佳的“数据净土”与知识矿脉人类几千年文明积累的绝大多数知识,其实并未被互联网完全覆盖:高质且未被污染:这些几十年甚至上百年前出版的历史、医学、地方志、法律文献,完全诞生于“前 AI 时代”,文字逻辑严密、知识密度极高,且绝对没有被 AI 污染过,是极其罕见的“干净数据纯净水”。领域特异性与小众知识:特别是地方志、古老医学和法律文献,蕴含着大量的长尾知识(Long-tail knowledge)。掌握了这些独占数据的模型,在处理特定跨国文化、历史语境或专业领域时,能够形成其他通用模型无法匹敌的知识壁垒。3. 版权黑灰产与“切书扫描”的法律灰色地带Anthropic 等 AI 巨头买实体书“切书脊、扫描”的操作,揭示了 AI 行业在版权保护上的激进与无奈:绕过数字版权协议:直接抓取电子书网站(如 Book3 数据库)容易面临直接的盗版起诉;而通过买断二手实体书进行物理扫描,则试图利用“首次销售原则(First Sale Doctrine)”来钻法律空子,将其解释为“合法的数字化消费与合理使用(Fair Use)”。美国联邦法院文件的印证:这一现象能够出现在法院公开文件中,说明实体出版行业与 AI 巨头之间关于“实体书数据化训练是否侵权”的新一轮版权博弈已经正式拉开序幕。4. 极其讽刺的“文明技术轮回”动态结尾那句“几万亿美元的 AI 产业,最后开始去旧书摊找粮”,构成了前沿科技史上极其震撼的一幕:从数字傲慢到回归纸质:过去十几年,数字极客们高呼“纸质书已死”,认为数字化一切才是未来;然而到了通用人工智能(AGI)的决胜时刻,人类最古老、最传统的载体——纸质书籍,反而成为了限制或推进人类最顶尖科技突破的关键资源。重估未数字化的文明遗产:这也提醒了整个社会,过去那些被认为“落后、陈旧、无人问津”的古籍馆、档案馆和二手书摊,其真正的商业与文化价值才刚刚被重新激活。总体而言,大模型“吃纸”不仅是一个有趣的科技八卦,更是 AI 产业演进路线上的重要节点。它标志着 AI 的竞争已经从单纯的“算法与算力堆叠”,全面转向了对“物理世界高质独占数据”的极限争夺。 ...全文 AI大模型开始抢购纸质旧书?揭秘优质训练数据的断粮困境 小推 • 其他评论 • 2026-09-24 摘要: 该消息披露AI巨头批量收购旧书扫描训练,揭示了互联网公开数据耗尽与合成垃圾污染的现实。本文深度解构大模型“吃纸”背后的数据危机与未数字化知识的独特价值。网友动态:大模型终于开始“吃纸”了... 转发 评论 点赞 阅读