对 OpenAI(乃至整个 AI 训练领域)而言,在与《纽约时报》的诉讼中取得了一场重大胜利。
美国政府刚刚正式支持 OpenAI 的主张,即受版权保护的文本训练属于合理使用,部分理由是出于国家安全考虑。
这是华盛顿方面在围绕 AI 训练的更广泛版权诉讼浪潮中首次正式介入,不过该文件仅具咨询性质,对法院不具约束力。
美国司法部提交了一份美国政府的利益声明,正式主张在 OpenAI 版权诉讼中,使用受版权保护的文本训练大语言模型通常应被认定为合理使用;
这一区分仍然留下了关于训练数据如何获取以及特定输出是否复制了受保护段落的独立版权问题。 司法部将获取材料、基于材料进行训练以及生成输出这三个环节区分开来,并将其论证重点专门放在训练阶段的复制行为上。
司法部认为,训练与发表文章的目的不同,因为大语言模型是利用文本来学习统计关系并生成新的回复。
在市场损害方面,司法部表示,训练本身并不会替代原作品,因此后续由 AI 生成的竞争性内容不应自动使此前的训练行为变得不合法。
政府还警告称,一刀切的许可要求可能会提高小型 AI 公司的准入门槛,并使美国开发者相对于外国竞争对手处于不利地位。
法院仍需逐案裁定合理使用问题,但若采纳司法部的框架,将把大部分法律压力从模型训练转向数据获取和具体输出内容。