The Decoder:AI News(RSS)
精选
70AI 编辑部评分,满分 100

AI-generated books are flooding Amazon and tanking sales for human authors

2026-08-15 19:00· 26分钟前· Jonathan Kemper
推荐理由

这项研究把市场稀释从推测变成可量化证据,版权诉讼中此前缺少的经验性数据可能由此补上,并影响合理使用的判断。

正文 · AI 翻译
Image description

一项对超过 14,000 本亚马逊自出版图书的分析显示,AI 生成的书籍正凭借数量而非质量,将人类作者挤出市场。即便是未检测到 AI 文本的书籍,单本收入也在下降。

研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书,他们从美国五大出版商之一的内部数据集中提取了每日销售数据。据研究人员称,该数据集追踪约 50 万本亚马逊图书,覆盖该平台每日售出电子书的约 95%。

与早期仅凭简短图书预览来检测 AI 文本的研究不同,研究人员根据每本书的全文进行分类。他们使用了 Pangram v3.3 检测器,其开发者报告误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比,图书被分为三档:无、轻度(不超过 25%)和重度(超过 25%)。

目录占比大,销量低于平均水平

含大量 AI 内容的图书占所研究目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%,却贡献了 72.5% 的收入。乍一看,这似乎印证了 AI 书籍仍是滞留在市场底部的低质量“垃圾内容”这一观点。

Three-part chart on AI text in self-publishing: line graphs show the rising share of new titles with over 25 percent AI text from 2023 to 2026 across eight genres, bar charts break down sales-rank tiers by AI-text band, and a slope graph compares title, sales, and revenue shares across the three AI bands.
含大量 AI 内容的图书占目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。| 图片来源:Chakrabarty 等人

不过,该研究表明这一观点忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度,累计目录规模增长了 38.3 倍,而每季度有销量的图书数量增长了 19.2 倍。季度收入仅增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的收入池。

即便是未检测到 AI 文本的书籍,单本收入也在下降。

在八种体裁中,有六种体裁的图书,若将2023年与2025年出版的作品在相同上市后时间段内的收入进行对比,单本书收入均出现下滑。而仅看未检测到AI文本的图书,八种体裁中有七种的收入出现下降。

这排除了“平均值下降仅仅是因为销量不佳的AI图书拉低了整体目录水平”这一解释。作者将这种效应称为“稀释”,但强调他们的比较属于观察性和关联性研究,并非因果关系的实验性证明。

Four charts on revenue per book: growth curves for catalog, selling titles, sales, and revenue relative to 2023; revenue per title in the launch window by release cohort; and two genre-level comparisons of the 2023 and 2025 cohorts.
图书目录增长了38.3倍,而收入仅增长8.9倍;在八种体裁中,有七种体裁的未含AI文本图书的单本收入出现下滑。| 图片来源:Chakrabarty et al.

唯一的例外是奇幻/超自然/恐怖类,AI文本在该类体裁中出现最晚,渗透率也最低。在该类体裁中,未检测到AI文本的图书单本收入反而上涨了35%。研究人员表示,这种反转表明,整体市场趋势并非导致上述现象的原因。

在Kindle Unlimited覆盖率较高的体裁中,这一规律更为明显,因为读者共享同一个订阅池。在这些体裁中,未检测到AI文本的图书在收入份额上的领先优势,比Kindle Unlimited覆盖率较低的体裁小了8.4个百分点。研究人员将此差距归因于体裁本身的特性,并未将其与Kindle Unlimited建立因果关系。

AI图书正闯入畅销榜前列

在研究期间,含有大量AI内容的新晋Top 25图书占比从接近零上升至31%。榜单前列的更新换代速度也在加快。未检测到AI文本的图书中,能连续两个季度留在Top 25榜单内的占比一度低至约28%,到研究结束时稳定在约62%左右。

Four charts on AI books' market position: sales share by AI-text band over time, area chart of Top 25 rank slots, heatmap of Top 25 shares by genre, and curves for bestseller retention and new entrants.
未含AI文本图书的销售份额从2023年初的近100%下降至2026年第二季度的约60%,而AI图书占新晋Top 25榜单作品的比重最高达31%。| 图片来源:Chakrabarty et al.

产出集中在少数高产作者手中。在385个作者身份中,有287个在出版第一本含大量AI内容的书籍后,月度产出有所增加。收入最高的笔名在扣除平台费用前,凭借8本书获得了170万美元的总收入。单本含大量AI内容的书籍最高收入为64.3万美元,共售出80,431本。

这项研究呼应了《纽约时报》关于“Coral Hart”的报道——据报道,该作者在一年内以21个笔名出版了200多本言情小说,售出约5万本。AI垃圾内容并不局限于图书领域。还有人利用AI生成的歌曲,通过流媒体平台诈骗了数百万美元。

Six charts on AI exposure and author output: Top 25 share of books with no AI text by catalog exposure, comparison by Kindle Unlimited availability, scatter plot of monthly book output before and after AI adoption, and three bar rankings of output and revenue for the most successful author identities.
在385个作者身份中,有287个在出版第一本AI书籍后提高了产出。收入最高的作者身份凭借8本书获得了170万美元的总收入。| 图片来源:Chakrabarty et al.

畅销AI书籍与现有作品中罕见语言的重复度极高

为了衡量畅销AI书籍与现有作品中罕见语言的重复程度,研究人员使用了艾伦人工智能研究所的infini-gram工具以及Google Books索引。

他们识别出那些在Google Books中出现在不超过5卷书籍里、且在4.7万亿token的网络快照中完全缺失的罕见表达。这类短语指向与已出版书籍紧密相关的语言模式。

Three charts on overlap with rare expressions from existing books: bar comparison for Top 50, 100, and 200 by revenue, scatter plot of revenue versus coverage with regression lines, and density curves for AI books, self-published bestsellers, and award-winning literature.
畅销AI书籍对现有书籍中罕见表达的依赖程度远高于获奖文学作品,后者的覆盖率仅为19.1%。| 图片来源:Chakrabarty et al.

在50本含大量AI内容的最高收入书籍中,这些罕见表达覆盖了45%的文本,而未检测到AI文本的前50本书中,这一比例为37.7%。对于获奖或入围奖项的小说,这一数字仅为19.1%。

在AI书籍中,收入每增加十倍,重叠率就上升7.6个百分点。未检测到AI文本的书籍则不存在这种相关性。该方法并不追踪个别段落的来源,也无法证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。

Chakrabarty 告诉 Ai2,AI 检测器只会返回“一个估计值——一个关于某段文字有多大概率是合成内容的分数”,而不会指出这些语言的来源。如果一段可疑文本还包含一些在网上找不到、只出现在少数几本书中的罕见表达,那么人们“就可以相当有把握地说,它是从书中摘取的”。这类证据“作为佐证 AI 检测器分数的间接证据”,同时“有助于驳斥一些陈词滥调的论点,即把人类阅读书籍类比为 AI 在书籍上训练”——这是 AI 公司在版权纠纷中的标准辩护理由。

研究结果直接影响到正在进行的版权案件

这些结果对针对 AI 公司的版权诉讼具有直接影响。在 Kadrey 诉 Meta 案中,法官 Vince Chhabria 于 2025 年 6 月作出了有利于 Meta 的裁决,但也发出了强烈警告。他表示,很难想象使用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断地制造出竞争性作品的产品,能够被认定为合理使用。

不过,原告当时并未提供这种市场稀释效应的实证证据。而当前这项研究恰恰提供了此前缺失的那类证据,表明当 AI 标题大量涌入市场时,未检测到 AI 文本的书籍收入会下降。

让法律诉讼更加困难的是,AI 内容无法在平台本身上被识别出来。作者在通过 Kindle Direct Publishing 出版时必须披露 AI 参与情况,但亚马逊并不会将该信息传递给消费者。该平台多年来一直苦于应对盗用知名作者姓名和风格的 AI 标题,主要应对措施是将每日发布数量限制在三本以内。

语言重叠的发现与 2025 年 11 月的一项研究相吻合,该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季,另一篇论文表明,仅需两本书就足以针对某位作者的风格对模型进行微调。

继续阅读以了解全貌。订阅以获取无炒作报道。

  • 完全访问 THE DECODER 上的每一篇文章
  • 无广告
  • 参与评论和社区讨论
  • 每周 AI 新闻邮件速览
  • 每年 6 期:“AI Radar”——深度剖析最重要的 AI 议题
  • 每日 AI 新闻,始终紧跟最新动态
  • 我们完整的十年存档
  • 由深耕 AI 领域 10 年以上的团队报道

来源:The Decoder:AI News(RSS) · the-decoder.com

AI-generated books are flooding Amazon and tanking sales for human authors

The Decoder:AI News(RSS)·2026-08-15 19:00·26分钟前·Jonathan Kemper
正文 · AI 翻译
Image description

一项对超过 14,000 本亚马逊自出版图书的分析显示,AI 生成的书籍正凭借数量而非质量,将人类作者挤出市场。即便是未检测到 AI 文本的书籍,单本收入也在下降。

研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书,他们从美国五大出版商之一的内部数据集中提取了每日销售数据。据研究人员称,该数据集追踪约 50 万本亚马逊图书,覆盖该平台每日售出电子书的约 95%。

与早期仅凭简短图书预览来检测 AI 文本的研究不同,研究人员根据每本书的全文进行分类。他们使用了 Pangram v3.3 检测器,其开发者报告误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比,图书被分为三档:无、轻度(不超过 25%)和重度(超过 25%)。

目录占比大,销量低于平均水平

含大量 AI 内容的图书占所研究目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%,却贡献了 72.5% 的收入。乍一看,这似乎印证了 AI 书籍仍是滞留在市场底部的低质量“垃圾内容”这一观点。

Three-part chart on AI text in self-publishing: line graphs show the rising share of new titles with over 25 percent AI text from 2023 to 2026 across eight genres, bar charts break down sales-rank tiers by AI-text band, and a slope graph compares title, sales, and revenue shares across the three AI bands.
含大量 AI 内容的图书占目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。| 图片来源:Chakrabarty 等人

不过,该研究表明这一观点忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度,累计目录规模增长了 38.3 倍,而每季度有销量的图书数量增长了 19.2 倍。季度收入仅增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的收入池。

即便是未检测到 AI 文本的书籍,单本收入也在下降。

在八种体裁中,有六种体裁的图书,若将2023年与2025年出版的作品在相同上市后时间段内的收入进行对比,单本书收入均出现下滑。而仅看未检测到AI文本的图书,八种体裁中有七种的收入出现下降。

这排除了“平均值下降仅仅是因为销量不佳的AI图书拉低了整体目录水平”这一解释。作者将这种效应称为“稀释”,但强调他们的比较属于观察性和关联性研究,并非因果关系的实验性证明。

Four charts on revenue per book: growth curves for catalog, selling titles, sales, and revenue relative to 2023; revenue per title in the launch window by release cohort; and two genre-level comparisons of the 2023 and 2025 cohorts.
图书目录增长了38.3倍,而收入仅增长8.9倍;在八种体裁中,有七种体裁的未含AI文本图书的单本收入出现下滑。| 图片来源:Chakrabarty et al.

唯一的例外是奇幻/超自然/恐怖类,AI文本在该类体裁中出现最晚,渗透率也最低。在该类体裁中,未检测到AI文本的图书单本收入反而上涨了35%。研究人员表示,这种反转表明,整体市场趋势并非导致上述现象的原因。

在Kindle Unlimited覆盖率较高的体裁中,这一规律更为明显,因为读者共享同一个订阅池。在这些体裁中,未检测到AI文本的图书在收入份额上的领先优势,比Kindle Unlimited覆盖率较低的体裁小了8.4个百分点。研究人员将此差距归因于体裁本身的特性,并未将其与Kindle Unlimited建立因果关系。

AI图书正闯入畅销榜前列

在研究期间,含有大量AI内容的新晋Top 25图书占比从接近零上升至31%。榜单前列的更新换代速度也在加快。未检测到AI文本的图书中,能连续两个季度留在Top 25榜单内的占比一度低至约28%,到研究结束时稳定在约62%左右。

Four charts on AI books' market position: sales share by AI-text band over time, area chart of Top 25 rank slots, heatmap of Top 25 shares by genre, and curves for bestseller retention and new entrants.
未含AI文本图书的销售份额从2023年初的近100%下降至2026年第二季度的约60%,而AI图书占新晋Top 25榜单作品的比重最高达31%。| 图片来源:Chakrabarty et al.

产出集中在少数高产作者手中。在385个作者身份中,有287个在出版第一本含大量AI内容的书籍后,月度产出有所增加。收入最高的笔名在扣除平台费用前,凭借8本书获得了170万美元的总收入。单本含大量AI内容的书籍最高收入为64.3万美元,共售出80,431本。

这项研究呼应了《纽约时报》关于“Coral Hart”的报道——据报道,该作者在一年内以21个笔名出版了200多本言情小说,售出约5万本。AI垃圾内容并不局限于图书领域。还有人利用AI生成的歌曲,通过流媒体平台诈骗了数百万美元。

Six charts on AI exposure and author output: Top 25 share of books with no AI text by catalog exposure, comparison by Kindle Unlimited availability, scatter plot of monthly book output before and after AI adoption, and three bar rankings of output and revenue for the most successful author identities.
在385个作者身份中,有287个在出版第一本AI书籍后提高了产出。收入最高的作者身份凭借8本书获得了170万美元的总收入。| 图片来源:Chakrabarty et al.

畅销AI书籍与现有作品中罕见语言的重复度极高

为了衡量畅销AI书籍与现有作品中罕见语言的重复程度,研究人员使用了艾伦人工智能研究所的infini-gram工具以及Google Books索引。

他们识别出那些在Google Books中出现在不超过5卷书籍里、且在4.7万亿token的网络快照中完全缺失的罕见表达。这类短语指向与已出版书籍紧密相关的语言模式。

Three charts on overlap with rare expressions from existing books: bar comparison for Top 50, 100, and 200 by revenue, scatter plot of revenue versus coverage with regression lines, and density curves for AI books, self-published bestsellers, and award-winning literature.
畅销AI书籍对现有书籍中罕见表达的依赖程度远高于获奖文学作品,后者的覆盖率仅为19.1%。| 图片来源:Chakrabarty et al.

在50本含大量AI内容的最高收入书籍中,这些罕见表达覆盖了45%的文本,而未检测到AI文本的前50本书中,这一比例为37.7%。对于获奖或入围奖项的小说,这一数字仅为19.1%。

在AI书籍中,收入每增加十倍,重叠率就上升7.6个百分点。未检测到AI文本的书籍则不存在这种相关性。该方法并不追踪个别段落的来源,也无法证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。

Chakrabarty 告诉 Ai2,AI 检测器只会返回“一个估计值——一个关于某段文字有多大概率是合成内容的分数”,而不会指出这些语言的来源。如果一段可疑文本还包含一些在网上找不到、只出现在少数几本书中的罕见表达,那么人们“就可以相当有把握地说,它是从书中摘取的”。这类证据“作为佐证 AI 检测器分数的间接证据”,同时“有助于驳斥一些陈词滥调的论点,即把人类阅读书籍类比为 AI 在书籍上训练”——这是 AI 公司在版权纠纷中的标准辩护理由。

研究结果直接影响到正在进行的版权案件

这些结果对针对 AI 公司的版权诉讼具有直接影响。在 Kadrey 诉 Meta 案中,法官 Vince Chhabria 于 2025 年 6 月作出了有利于 Meta 的裁决,但也发出了强烈警告。他表示,很难想象使用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断地制造出竞争性作品的产品,能够被认定为合理使用。

不过,原告当时并未提供这种市场稀释效应的实证证据。而当前这项研究恰恰提供了此前缺失的那类证据,表明当 AI 标题大量涌入市场时,未检测到 AI 文本的书籍收入会下降。

让法律诉讼更加困难的是,AI 内容无法在平台本身上被识别出来。作者在通过 Kindle Direct Publishing 出版时必须披露 AI 参与情况,但亚马逊并不会将该信息传递给消费者。该平台多年来一直苦于应对盗用知名作者姓名和风格的 AI 标题,主要应对措施是将每日发布数量限制在三本以内。

语言重叠的发现与 2025 年 11 月的一项研究相吻合,该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季,另一篇论文表明,仅需两本书就足以针对某位作者的风格对模型进行微调。

继续阅读以了解全貌。订阅以获取无炒作报道。

  • 完全访问 THE DECODER 上的每一篇文章
  • 无广告
  • 参与评论和社区讨论
  • 每周 AI 新闻邮件速览
  • 每年 6 期:“AI Radar”——深度剖析最重要的 AI 议题
  • 每日 AI 新闻,始终紧跟最新动态
  • 我们完整的十年存档
  • 由深耕 AI 领域 10 年以上的团队报道

来源:The Decoder:AI News(RSS)· the-decoder.com