# AI 公司被曝大量收购旧书，以获取"纯净"训练素材

- 来源：IT之家（RSS）
- 发布时间：2026-07-28 19:22
- AIHOT 分数：55
- AIHOT 链接：https://aihot.virxact.com/items/cms4lz9k405omroepv9y6ssfd
- 原文链接：https://www.ithome.com/0/982/742.htm

## AI 摘要

多家 AI 公司通过中间商大规模收购 2022 年前出版的二手图书，以获取未受 AI 生成内容污染的高质量训练数据。Anthropic 曾投入数百万美元购买纸质图书用于训练 Claude，随后将图书销毁，并因长期保存含 700 万本盗版图书的数据库被判赔偿 15 亿美元。订单规模从 1000 本到 100 万本不等，部分图书被采用破坏性扫描方式数字化后拆毁，引发伦理争议。

## 正文

IT之家 7 月 28 日消息，AI 公司在推动内存和存储资源日益紧张之后，如今似乎又将目光投向了人类的文学遗产。调查媒体 404 Media 最新报道称，多家 AI 公司正通过中间商大规模收购二手图书，以获取高质量训练数据用于训练 AI 模型，同时避免引发公众舆论反弹。

AI 的发展离不开海量数据，但并非所有数据都有价值，关键在于数据质量。近年来，大量由 AI 生成的低质量内容（俗称“AI 垃圾内容”）充斥互联网，不仅污染了数据环境，也降低了 AI 继续学习的效果。因此，领先的 AI 公司开始重新寻找由人类创作的内容，尤其是 2022 年之前出版的纸质书籍，因为这些内容更有可能是原创作品，尚未受到 AI 生成内容的污染。

事实上，AI 公司利用纸质图书训练模型已有先例。作为当前卷入版权诉讼的主要 AI 公司之一，Anthropic 曾投入数百万美元购买大量纸质图书，用于提取内容训练 Claude AI 模型，随后再将这些图书销毁。据悉，该公司从 Better World Books 大量采购图书。法院虽然认定，将正版图书用于 AI 训练属于版权法中的“合理使用”，但 Anthropic 因长期保存一个包含 700 万本盗版图书的数据库，侵犯了作者和出版商版权，最终被判赔偿高达 15 亿美元（IT之家注：现汇率约合 101.62 亿元人民币）。

类似争议也发生在谷歌身上。近期，一个出版商联盟已对谷歌提起诉讼，指控其未经授权使用数百万本受版权保护的图书训练 Gemini AI 模型。

拥有超过 1.11 亿本图书目录信息的在线数据库 ISBNdb，长期以来一直是书商、图书馆和发行商的重要平台。随着 AI 行业迅速发展，ISBNdb 也开始调整业务方向，推出专门面向 AI 企业的大规模图书采购服务。

404 Media 报道称，相关订单规模从一次采购 1000 本到一次采购 100 万本不等。

一位不愿透露姓名的职业书商表示，今年 4 月以来，图书销量出现了前所未有的增长。过去生意好的时候，一周只能卖出约 20 本书；而近几个月，每周销量已飙升至数百本，是平时销量的约五倍。

Alibris、Biblio 等二手书交易平台上的其他书商，也反映出现了类似的大宗采购现象。

尽管目前没有确凿证据证明这些采购行为一定来自 ISBNdb 或某家 AI 公司，但其中存在不少异常现象。例如，大规模采购的对象几乎全部都是带有国际标准书号（ISBN）的图书，这种由 13 位数字组成的编码是全球图书唯一识别标识。

此外，这些采购行为几乎没有任何主题、类型或作者偏好，无论是小说、教材还是专业书籍都在采购范围内。更令人意外的是，买家似乎完全不在意价格，即使部分图书明显高于市场价，也会直接买下。

在 Anthropic 的版权诉讼过程中，曾参与 Google Books 项目、后来负责 Anthropic“巴拿马计划（Project Panama）”数字化项目的汤姆 · 哈维（Tom Harvey）证实，Anthropic 曾聘请多家专业文档扫描公司对纸质图书进行数字化处理。

其中一家合作公司是 Datamation Information Services，该公司提供非破坏性扫描和破坏性扫描两种图书数字化服务。

非破坏性扫描通常使用俯拍扫描仪、平板扫描仪或 V 型扫描设备，在不拆解图书的情况下完成数字化。而破坏性扫描则会直接拆开书籍，将每一页送入高速工业扫描仪进行处理。

由于破坏性扫描效率更高、成本更低，因此 AI 公司普遍选择这一方式，最终导致数百万本纸质图书被拆毁。

毫无疑问，纸质图书对于 AI 来说是一座巨大的知识宝库。然而，这种做法也引发了越来越多的伦理争议。

批评者认为，目前尚不清楚 AI 公司在数字化过程中，是否会区分普通图书与珍贵图书、绝版图书。如果这些稀有书籍被拆毁，它们可能将永久退出流通。

另一个更大的问题在于，这些扫描后的内容最终都会进入 AI 公司的私有数据库，仅用于训练 AI，而普通公众无法访问。

这意味着，人们或许能够获得更加智能的 AI，但代价可能是，人类积累的大量知识资源将不再以公开、可获取的形式留给未来世代。
