# AI生成书籍正淹没亚马逊，并拉低人类作者的单书收入

- 来源：The Decoder：AI News（RSS）
- 作者：Jonathan Kemper
- 发布时间：2026-08-15 19:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsuaf2hr05zgroe0y1e7275v
- 原文链接：https://the-decoder.com/ai-generated-books-are-flooding-amazon-and-tanking-sales-for-human-authors

## 精选理由

这项研究把市场稀释从推测变成可量化证据，版权诉讼中此前缺少的经验性数据可能由此补上，并影响合理使用的判断。

## AI 摘要

一项对14,419本自出版电子书的分析显示，AI生成书籍正以数量而非质量挤占人类作者市场，即便未检测到AI文本的书籍，单书收入也在下滑。2023年Q1至2026年Q1，书目总量增长38.3倍，而季度收入仅增长8.9倍；在八个类型中，七个类型的无AI文本书籍单书收入下降。

## 正文

一项对超过 14,000 本亚马逊自出版图书的分析显示，AI 生成的书籍正凭借数量而非质量，将人类作者挤出市场。即便是未检测到 AI 文本的书籍，单本收入也在下降。

研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书，他们从美国五大出版商之一的内部数据集中提取了每日销售数据。据研究人员称，该数据集追踪约 50 万本亚马逊图书，覆盖该平台每日售出电子书的约 95%。

与早期仅凭简短图书预览来检测 AI 文本的研究不同，研究人员根据每本书的全文进行分类。他们使用了 Pangram v3.3 检测器，其开发者报告误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比，图书被分为三档：无、轻度（不超过 25%）和重度（超过 25%）。

目录占比大，销量低于平均水平

含大量 AI 内容的图书占所研究目录的 20%，但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%，却贡献了 72.5% 的收入。乍一看，这似乎印证了 AI 书籍仍是滞留在市场底部的低质量“垃圾内容”这一观点。

含大量 AI 内容的图书占目录的 20%，但仅占销量的 12.1% 和收入的 11.3%。| 图片来源：Chakrabarty 等人

不过，该研究表明这一观点忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度，累计目录规模增长了 38.3 倍，而每季度有销量的图书数量增长了 19.2 倍。季度收入仅增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的收入池。

即便是未检测到 AI 文本的书籍，单本收入也在下降。

在八种体裁中，有六种体裁的图书，若将2023年与2025年出版的作品在相同上市后时间段内的收入进行对比，单本书收入均出现下滑。而仅看未检测到AI文本的图书，八种体裁中有七种的收入出现下降。

这排除了“平均值下降仅仅是因为销量不佳的AI图书拉低了整体目录水平”这一解释。作者将这种效应称为“稀释”，但强调他们的比较属于观察性和关联性研究，并非因果关系的实验性证明。

图书目录增长了38.3倍，而收入仅增长8.9倍；在八种体裁中，有七种体裁的未含AI文本图书的单本收入出现下滑。| 图片来源：Chakrabarty et al.

唯一的例外是奇幻/超自然/恐怖类，AI文本在该类体裁中出现最晚，渗透率也最低。在该类体裁中，未检测到AI文本的图书单本收入反而上涨了35%。研究人员表示，这种反转表明，整体市场趋势并非导致上述现象的原因。

在Kindle Unlimited覆盖率较高的体裁中，这一规律更为明显，因为读者共享同一个订阅池。在这些体裁中，未检测到AI文本的图书在收入份额上的领先优势，比Kindle Unlimited覆盖率较低的体裁小了8.4个百分点。研究人员将此差距归因于体裁本身的特性，并未将其与Kindle Unlimited建立因果关系。

AI图书正闯入畅销榜前列

在研究期间，含有大量AI内容的新晋Top 25图书占比从接近零上升至31%。榜单前列的更新换代速度也在加快。未检测到AI文本的图书中，能连续两个季度留在Top 25榜单内的占比一度低至约28%，到研究结束时稳定在约62%左右。

未含AI文本图书的销售份额从2023年初的近100%下降至2026年第二季度的约60%，而AI图书占新晋Top 25榜单作品的比重最高达31%。| 图片来源：Chakrabarty et al.

产出集中在少数高产作者手中。在385个作者身份中，有287个在出版第一本含大量AI内容的书籍后，月度产出有所增加。收入最高的笔名在扣除平台费用前，凭借8本书获得了170万美元的总收入。单本含大量AI内容的书籍最高收入为64.3万美元，共售出80,431本。

这项研究呼应了《纽约时报》关于“Coral Hart”的报道——据报道，该作者在一年内以21个笔名出版了200多本言情小说，售出约5万本。AI垃圾内容并不局限于图书领域。还有人利用AI生成的歌曲，通过流媒体平台诈骗了数百万美元。

在385个作者身份中，有287个在出版第一本AI书籍后提高了产出。收入最高的作者身份凭借8本书获得了170万美元的总收入。| 图片来源：Chakrabarty et al.

畅销AI书籍与现有作品中罕见语言的重复度极高

为了衡量畅销AI书籍与现有作品中罕见语言的重复程度，研究人员使用了艾伦人工智能研究所的infini-gram工具以及Google Books索引。

他们识别出那些在Google Books中出现在不超过5卷书籍里、且在4.7万亿token的网络快照中完全缺失的罕见表达。这类短语指向与已出版书籍紧密相关的语言模式。

畅销AI书籍对现有书籍中罕见表达的依赖程度远高于获奖文学作品，后者的覆盖率仅为19.1%。| 图片来源：Chakrabarty et al.

在50本含大量AI内容的最高收入书籍中，这些罕见表达覆盖了45%的文本，而未检测到AI文本的前50本书中，这一比例为37.7%。对于获奖或入围奖项的小说，这一数字仅为19.1%。

在AI书籍中，收入每增加十倍，重叠率就上升7.6个百分点。未检测到AI文本的书籍则不存在这种相关性。该方法并不追踪个别段落的来源，也无法证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。

Chakrabarty 告诉 Ai2，AI 检测器只会返回“一个估计值——一个关于某段文字有多大概率是合成内容的分数”，而不会指出这些语言的来源。如果一段可疑文本还包含一些在网上找不到、只出现在少数几本书中的罕见表达，那么人们“就可以相当有把握地说，它是从书中摘取的”。这类证据“作为佐证 AI 检测器分数的间接证据”，同时“有助于驳斥一些陈词滥调的论点，即把人类阅读书籍类比为 AI 在书籍上训练”——这是 AI 公司在版权纠纷中的标准辩护理由。

研究结果直接影响到正在进行的版权案件

这些结果对针对 AI 公司的版权诉讼具有直接影响。在 Kadrey 诉 Meta 案中，法官 Vince Chhabria 于 2025 年 6 月作出了有利于 Meta 的裁决，但也发出了强烈警告。他表示，很难想象使用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断地制造出竞争性作品的产品，能够被认定为合理使用。

不过，原告当时并未提供这种市场稀释效应的实证证据。而当前这项研究恰恰提供了此前缺失的那类证据，表明当 AI 标题大量涌入市场时，未检测到 AI 文本的书籍收入会下降。

让法律诉讼更加困难的是，AI 内容无法在平台本身上被识别出来。作者在通过 Kindle Direct Publishing 出版时必须披露 AI 参与情况，但亚马逊并不会将该信息传递给消费者。该平台多年来一直苦于应对盗用知名作者姓名和风格的 AI 标题，主要应对措施是将每日发布数量限制在三本以内。

语言重叠的发现与 2025 年 11 月的一项研究相吻合，该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季，另一篇论文表明，仅需两本书就足以针对某位作者的风格对模型进行微调。

继续阅读以了解全貌。订阅以获取无炒作报道。

完全访问 THE DECODER 上的每一篇文章

无广告

参与评论和社区讨论

每周 AI 新闻邮件速览

每年 6 期：“AI Radar”——深度剖析最重要的 AI 议题

每日 AI 新闻，始终紧跟最新动态

我们完整的十年存档

由深耕 AI 领域 10 年以上的团队报道
