大模型终于露出了最原始的獠牙:它们开始吃纸了!
如果你最近去过东京的神田神保町——那个被誉为世界最大古书店街的地方,可能会注意到一种极为诡异的景象。 这里的古书店主们,接待了一批奇奇怪怪的“大客户”。 他们既不是戴着老花镜的老学者,也不是搞文献收藏的富豪,更不像任何一种人类读书人。 他们买书不挑作者,不看名气,不选装帧,甚至不计较品相。从昭和时代的地方志、几十年前的法学判例集、早已淘汰的旧医学手册,到极其枯燥的农业生产统计小册子,只要是带字的,他们统统照单全收。 有店家一天就被扫走上百本,有的店铺累计卖出了上千册。买家注册的账号名称五花八门,但包裹最终的送达地址,却全都指向了同一个跨境物流中转站。 直到日本媒体追查发现,自去年以来已经有超过50吨日本二手书籍被出口到了美国,大家才恍然大悟:这根本不是什么书虫在淘宝,而是一场跨国算力巨头发起的“纸质文明大清剿”。 按一本书500克粗算,50吨相当于整整10万册纸质书。那些藏在书架深处、落满灰尘的纸质知识,正在被整箱整箱地塞进集装箱,运往大洋彼岸。 顶尖的高科技AI公司,怎么突然对古董摊上的“破纸”产生了如此饥渴的食欲? 答案既科幻又讽刺:在吞噬了几乎整个互联网之后,大模型终于没饭吃了。它们开始“吃纸”了。 一、互联网被“蹭秃”了,大模型面临断粮危机 过去几年,人工智能的进化逻辑简单粗暴:大力出奇迹。只要模型够大,数据够多,AI就能越来越聪明。硅谷的爬虫机器人像蝗虫过境一样,把全球网页上的维基百科、论坛贴吧、新闻报道、甚至社交平台上的吵架纪录全给吃了个遍。 但人类在网络上留下的字,毕竟是有限的。 权威AI研究机构 Epoch AI 曾发布过一份让人后背发凉的预测报告:按照目前大模型训练数据的消耗速度,互联网上积累的高质量人类文本数据——大约在数万亿至数十万亿 Token 之间——将在2026年前后彻底耗尽。 这就是让硅谷所有首席科学家夜不能寐的“数据墙”(Data Wall)。 比“没书吃”更可怕的是“吃毒药”。如今的互联网,早已不是那个纯洁的知识海洋,而是充斥着各种由AI批量生成的营销号文章、SEO垃圾信息和水军废话。如果大模型继续纵容爬虫在现在的网络上“拾荒”,就会陷入极其可怕的“模型塌陷”(Model Collapse)。 英国剑桥大学和牛津大学的研究人员在《Nature》上发表的论文证实:如果让AI用AI生成的数据来训练自己,只需要迭代几代,模型的输出就会彻底沦为毫无逻辑的呓语。这就像让一个画家只临摹画册的复印件,复印件再复印,几代之后,画面就只剩下模糊不清的噪点。这种“算力近亲繁殖”会导致AI智力急速衰退。 面对即将见底的网络数据库和遍地有毒的垃圾信息,硅谷巨头们放眼全球,猛然发现:最纯净、最具有逻辑深度、绝未被AI污染过的“高蛋白粮源”,居然全部静静地躺在那些没有被数字化的实体纸质书里。 二、从“优雅爬虫”到“工业斩首”:硅谷的物理拆书术 既然互联网的数据榨不出来汁了,那就只能对实体书下手。 你可能以为AI公司买书回去,是安排一排工作人员坐在桌前,小心翼翼地翻页扫描?那太低估科技新贵们对效率的狂热追求了。在硅谷,把纸质书变成训练集的过程,充满了工业时代最原始的暴力美学。 此前就有外媒曝光过 AI 独角兽公司 Anthropic 的经典操作。为了快速获取海量高质量图书文本,他们建立了极其凶残的“图书数字化流水线”: 巨头们买来成吨的实体图书,甚至根本不看内容,直接送进工业级切纸机。随着铡刀轰然落下,珍贵的书脊被瞬间切掉,一本本厚重的著作瞬间化为几百张散落的单页。 随后,这些纸张被塞进高速工业扫描仪,以每分钟几百页的速度狂飙,转化成高分辨率图像。紧接着,最新的 OCR(光学字符识别)视觉大模型接手,将图像中的文字、排版、表格瞬间提取为结构化的数字文本。 什么叫硬核数字化?这就叫“拆书炼丹”。 一本凝聚了作者半辈子心血的著作,在流水线上只需几秒钟,就会经历从物理消亡到数字升华的全过程。书脊断裂的声音,就是大模型吞噬人类文明的嚼碎声。 三、为什么偏偏是日本的古旧书籍? 在这场全球性的“纸质文本抢购战”中,日本的二手书之所以成为硅谷眼中的“顶级A5和牛”,有着非常现实的技术逻辑。 首先,是极高的数据纯度与排版质量。日本从近代以来就拥有极其庞大的出版业,印刷工艺精良,字体排版高度规范。 这种高质感纸张和清晰的印刷,让现代 OCR 软件的识别准确率几乎高达 99.9%。相较于某些印刷质量参差不齐、扫描出来满屏糊字的其他语种旧书,日本古书简直是整理数据工程师的梦幻食材。 其次,是不可替代的“领域知识深度”。这次神秘买家扫荡的重点,包含了大量的“地方志”(地方历史记载)、过期的法律判例集、以及昭和时代的行业报告。这些东西在当年发行量极小,且极少被上传到互联网。里面记录的社会运行逻辑、人情世故、法律博弈和历史细节,是任何现代网页都提供不