一项对超过 14,000 本亚马逊自出版图书的分析显示,AI 生成的书籍正凭借数量而非质量,将人类作者挤出市场。即便是未检测到 AI 文本的书籍,单本收入也在下降。
研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书,他们从美国五大出版商之一的内部数据集中提取了每日销售数据。据研究人员称,该数据集追踪约 50 万本亚马逊图书,覆盖该平台每日售出电子书的约 95%。
与早期仅凭简短图书预览来检测 AI 文本的研究不同,研究人员根据每本书的全文进行分类。他们使用了 Pangram v3.3 检测器,其开发者报告误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比,图书被分为三档:无、轻度(不超过 25%)和重度(超过 25%)。
目录占比大,销量低于平均水平
含大量 AI 内容的图书占所研究目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%,却贡献了 72.5% 的收入。乍一看,这似乎印证了 AI 书籍仍是滞留在市场底部的低质量“垃圾内容”这一观点。

不过,该研究表明这一观点忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度,累计目录规模增长了 38.3 倍,而每季度有销量的图书数量增长了 19.2 倍。季度收入仅增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的收入池。
即便是未检测到 AI 文本的书籍,单本收入也在下降。
在八种体裁中,有六种体裁的图书,若将2023年与2025年出版的作品在相同上市后时间段内的收入进行对比,单本书收入均出现下滑。而仅看未检测到AI文本的图书,八种体裁中有七种的收入出现下降。
这排除了“平均值下降仅仅是因为销量不佳的AI图书拉低了整体目录水平”这一解释。作者将这种效应称为“稀释”,但强调他们的比较属于观察性和关联性研究,并非因果关系的实验性证明。

唯一的例外是奇幻/超自然/恐怖类,AI文本在该类体裁中出现最晚,渗透率也最低。在该类体裁中,未检测到AI文本的图书单本收入反而上涨了35%。研究人员表示,这种反转表明,整体市场趋势并非导致上述现象的原因。
在Kindle Unlimited覆盖率较高的体裁中,这一规律更为明显,因为读者共享同一个订阅池。在这些体裁中,未检测到AI文本的图书在收入份额上的领先优势,比Kindle Unlimited覆盖率较低的体裁小了8.4个百分点。研究人员将此差距归因于体裁本身的特性,并未将其与Kindle Unlimited建立因果关系。
AI图书正闯入畅销榜前列
在研究期间,含有大量AI内容的新晋Top 25图书占比从接近零上升至31%。榜单前列的更新换代速度也在加快。未检测到AI文本的图书中,能连续两个季度留在Top 25榜单内的占比一度低至约28%,到研究结束时稳定在约62%左右。

产出集中在少数高产作者手中。在385个作者身份中,有287个在出版第一本含大量AI内容的书籍后,月度产出有所增加。收入最高的笔名在扣除平台费用前,凭借8本书获得了170万美元的总收入。单本含大量AI内容的书籍最高收入为64.3万美元,共售出80,431本。
这项研究呼应了《纽约时报》关于“Coral Hart”的报道——据报道,该作者在一年内以21个笔名出版了200多本言情小说,售出约5万本。AI垃圾内容并不局限于图书领域。还有人利用AI生成的歌曲,通过流媒体平台诈骗了数百万美元。

畅销AI书籍与现有作品中罕见语言的重复度极高
为了衡量畅销AI书籍与现有作品中罕见语言的重复程度,研究人员使用了艾伦人工智能研究所的infini-gram工具以及Google Books索引。
他们识别出那些在Google Books中出现在不超过5卷书籍里、且在4.7万亿token的网络快照中完全缺失的罕见表达。这类短语指向与已出版书籍紧密相关的语言模式。

在50本含大量AI内容的最高收入书籍中,这些罕见表达覆盖了45%的文本,而未检测到AI文本的前50本书中,这一比例为37.7%。对于获奖或入围奖项的小说,这一数字仅为19.1%。
在AI书籍中,收入每增加十倍,重叠率就上升7.6个百分点。未检测到AI文本的书籍则不存在这种相关性。该方法并不追踪个别段落的来源,也无法证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。
Chakrabarty 告诉 Ai2,AI 检测器只会返回“一个估计值——一个关于某段文字有多大概率是合成内容的分数”,而不会指出这些语言的来源。如果一段可疑文本还包含一些在网上找不到、只出现在少数几本书中的罕见表达,那么人们“就可以相当有把握地说,它是从书中摘取的”。这类证据“作为佐证 AI 检测器分数的间接证据”,同时“有助于驳斥一些陈词滥调的论点,即把人类阅读书籍类比为 AI 在书籍上训练”——这是 AI 公司在版权纠纷中的标准辩护理由。
研究结果直接影响到正在进行的版权案件
这些结果对针对 AI 公司的版权诉讼具有直接影响。在 Kadrey 诉 Meta 案中,法官 Vince Chhabria 于 2025 年 6 月作出了有利于 Meta 的裁决,但也发出了强烈警告。他表示,很难想象使用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断地制造出竞争性作品的产品,能够被认定为合理使用。
不过,原告当时并未提供这种市场稀释效应的实证证据。而当前这项研究恰恰提供了此前缺失的那类证据,表明当 AI 标题大量涌入市场时,未检测到 AI 文本的书籍收入会下降。
让法律诉讼更加困难的是,AI 内容无法在平台本身上被识别出来。作者在通过 Kindle Direct Publishing 出版时必须披露 AI 参与情况,但亚马逊并不会将该信息传递给消费者。该平台多年来一直苦于应对盗用知名作者姓名和风格的 AI 标题,主要应对措施是将每日发布数量限制在三本以内。
语言重叠的发现与 2025 年 11 月的一项研究相吻合,该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季,另一篇论文表明,仅需两本书就足以针对某位作者的风格对模型进行微调。
继续阅读以了解全貌。订阅以获取无炒作报道。
- 完全访问 THE DECODER 上的每一篇文章
- 无广告
- 参与评论和社区讨论
- 每周 AI 新闻邮件速览
- 每年 6 期:“AI Radar”——深度剖析最重要的 AI 议题
- 每日 AI 新闻,始终紧跟最新动态
- 我们完整的十年存档
- 由深耕 AI 领域 10 年以上的团队报道