一批纸质书被买下,送进仓库。
工作人员切掉书脊,把完整的书拆成一页页散纸,再送去扫描。文字被留下,原来的书却无法恢复。
如果我告诉你,这是 Anthropic 为了 AI 干的,你可能不会太意外。
但如果我说这次干这事的公司,是全球最大的「线上书店」亚马逊呢?

404 Media 在一批旧书里放入追踪器,发现它们一路被送到拉斯维加斯的一座 亚马逊设施。员工向该媒体描述,公司收到纸质书后,会切掉书脊,再把散开的纸页送去扫描。
亚马逊回应称,公司通过商业渠道购买这些书,用于开发和改进客户使用的产品与服务。

有意思的是,亚马逊当年就是靠卖书起家的。
现在,一些书到了它手里,先见到的却是扫描仪。
AI 公司已经能从互联网得到海量文本,为什么还要回来收购纸书?得到书以后,又为什么要先把它拆掉?
一本装订完好的书,并不适合直接进入高速扫描流水线。
如果想保留原书,通常要把书放在书托上,用顶置相机逐页拍摄。扫描时还要照顾到装订角度、纸张状态,以及文字是否被书脊遮挡。
美国国会图书馆的数字化保存指南要求,如果书本比较脆弱或珍贵,扫描时应使用书托、顶置相机等设备,尽量避免损伤书脊和纸张。
可切掉书脊后,一本书就变成了几百张可以连续进纸的散页。扫描速度更快,也更容易在同一条流水线上处理不同尺寸的书。
拆书这事发生在模型训练之前。它解决的是怎样用更少的人工,把更多纸页变成机器可以处理的文件。

公众第一次看清这种流程,来自 Anthropic 的版权诉讼。
法院裁定文件记载,Anthropic 购买了大量纸质书,拆除装订、裁切纸页,再将扫描结果放进内部数字资料库。纸本随后被丢弃,一份实体副本以后就对应一份数字副本。
亚马逊从卖书起家,三十多年后,书又以另一种方式回到了它新开的「旧书屠宰场」。
书:「我与你们不共戴天!!!」
模型公司当然不缺网页。
它们缺的是来源清楚、质量稳定,而且能确认主要由人类写成的文本。
过去几年,生成式 AI 制造的文章、商品描述、问答和网站迅速增加。网页不会因此立即失去训练价值,合成数据也并非天然有害。
但如果训练材料不加甄别地混入上一代模型生成的内容,模型可能逐渐丢失原始数据中那些低频、少见的信息。
一项发表于《Nature》的研究,将这种递归训练造成的退化称为「模型崩溃」。

出版时间较早的纸质书,则有一个很简单的优势:它们出现在生成式 AI 普及以前。
一本书通常还经历过作者写作、编辑加工和出版筛选,能够提供比零散网页更连贯的长文本。
那些没有电子版的专业书、小众出版物和绝版书尤其特殊。很多内容单靠网页抓取根本拿不到。
今年 7 月,404 Media 曾报道,已经有服务商开始把旧书包装成适合 AI 训练的人类文本来源。
到了这次追踪调查,原本藏在匿名订单和中间商之后的采购链,第一次指向了一座 亚马逊设施。
网页已经不够干净了,AI 又回来翻人类的旧书架。
这件事放在 亚马逊身上,还有一层很特别的背景。
亚马逊 最早就是靠卖书起家的。到了生成式 AI 的时代,它的书店里开始出现越来越多 AI 生成的内容。
2023 年,亚马逊修改了 Kindle Direct Publishing 的规则,要求作者在出版时申报书中的文字、图片或翻译是否由 AI 生成。
随后,它还把单个作者每天能够发布的新书数量限制在三本——看到这里很难不愣一下:三本?一天?这到底是「写书」,还是「印刷厂限流版体验卡」?
估计各位读者读到这里的第一反应大概也是:等等,这个数字是不是不太对?

一些 AI 研究者自己也遇到了这件事。
AI 学者 Melanie Mitchell 出版过《Artificial Intelligence: A Guide for Thinking Humans》。后来,亚马逊上出现了一本和它同名的 45 页电子书。 WIRED(《连线》杂志)找检测公司分析后认为,这本书有很高概率由 AI 生成,亚马逊随后将它下架。

此外,李飞飞的回忆录《The Worlds I See》出版以后,亚马逊上也很快出现了十多本各种「总结」和「分析」。WIRED 检查其中一些内容后,也认为它们很可能使用了生成式 AI.
记者问李飞飞怎么看,大家猜一下她怎么回?
——她只回了一个表情:🤯。

一边是越来越容易被生产出来的新书,另一边,AI 公司又开始寻找那些几十年前出版、没有电子版、还没有进入互联网的纸质旧书。

机器一边像「永不停歇的印刷机」一样吐出层出不穷的新书,另一边却像在黑暗图书馆里觅食的「图书考古学家」,执着且贪婪地,寻找那些人类一页一页写下、尚未被数字化的旧书。
这种采购目前还谈不上改变整个旧书市场。
但有一些书商现在已经感受到了变化。
英国和爱尔兰多家旧书商最近告诉《卫报》,他们收到过规模异常的订单。有人一次卖出数千本书,也有人从今年开始陆续接到数千本类似采购。

这些订单和普通藏家的买法不太一样。
买家并不集中购买某位作者、某个题材或者某个年代的书。有些订单横跨完全没有关系的类别。
他们也很少议价。
一位书商提到,这些买家愿意直接支付网站上的价格。还有书商认为,大规模采购已经开始影响正常的二手书交易。
被买走的也不全是昂贵的珍本。
此前《The Atlantic》梳理这轮旧书采购时发现,其中有不少只是几十年前出版的冷门书籍。它们可能已经绝版,但并不一定稀有到只有一两本存世。

这类书过去可能会在旧书网站上挂很久。
等待它的通常是某个刚好需要这本书的读者、研究者或者收藏者。
现在它们又多了一类买家。
2014 年,科幻作家厄休拉·勒古恩在美国国家图书奖的领奖台上说过一句话:「书不只是商品。」当时她批评的是出版业越来越被商业逻辑支配,其中还特别提到了亚马逊。

现在它们又多了一类买家。
读者买一本书,是想把它留下。AI 公司买一本书,可能恰恰是为了把它拆掉。
这类买家并不一定在意书的品相,也不准备把它重新卖出去。他们需要的是里面还没有被数字化的文字。
现在还没有证据表明 AI 公司的采购已经普遍推高了旧书价格。但对于供应量本来就很少的版本,只要实体副本不断退出流通,未来寻找它的人就会面对更少的选择。
过去我们很容易把「数字化」理解成是一种更方便阅读的手段。
图书馆扫描一本旧书,通常是为了保存它。条件允许的话,数字版本还会让更多人看到原本只能在馆内阅读的资料。
AI 公司做的数字化可不一定如此。

这些冷门的旧书过去没有被数字化,往往就是因为读者太少。
现在,没有被数字化反而成了它们被购买的理由。
分享一位科学科普博主 @李苦舟 对此的评价:
「搞笑的是,在AI公司购买这些所谓具有关乎人类命运的、不可替代的、无比宝贵的旧书之前,它们是无人问津的。」
以前,一本冷门旧书可能在书架上放很多年,等一个刚好需要它的人。
现在,AI 公司开始批量寻找这类书,把它们拆开,再扫描成数字文件。
可这些数字文件并不会像图书馆的数字藏书一样,兜兜转转又回到普通读者手里,而是留在公司内部的数据库。
于是,一本过去只是很难找到的书,被数字化以后,可能依然很难找到。
机器终于读到了它,下一位读者却未必还能读到。
文章来自于"APPSO",作者 "APPSO"。