生成式 AI 正在改变创意工具的可能性,随之而来的是确保这些工具不会被用于伤害最易受侵害人群的责任。保护儿童免受性剥削是我们公司最坚定的承诺之一。
与我们整体的安全方针一致,我们将儿童安全考量融入从模型开发、产品发布到最终用户生成的每一个层面。这一方针与 Thorn 的《面向生成式 AI 的安全设计》原则高度契合,该原则为生成式 AI 开发者如何防范儿童性虐待材料(CSAM,包括 AI 生成的 CSAM)的创建与传播,以及其他针对儿童的性伤害,树立了行业标准。以下概述了这些原则如何贯穿于我们的产品和流程之中。
- 开发:构建主动应对风险的模型 保障训练数据安全
安全始于用户接触我们的产品之前。我们在模型开发过程中采取审慎步骤,以降低模型被用于生成涉及未成年人的 CSAM 或其他性内容的风险。我们整合了哈希匹配、儿童安全分类器以及基于大语言模型的审核机制,确保不会使用涉及未成年人或成年人的性内容来训练模型。红队测试与评估
在模型发布前,我们在法律允许的范围内进行全面测试,以识别并解决潜在的漏洞。我们在文本、图像、视频和音频等多个维度进行此类测试,以降低用户生成 CSAM 或其他涉及未成年人性内容的可能性。这种持续测试确保我们的防护措施能够跟上模型与新技术的涌现以及威胁向量的演变。2. 部署:保障措施、政策与执行 明确界定使用限制
我们确保所有用户都清楚了解我们针对任何涉及儿童的性内容的严格禁令。我们的使用政策禁止所有“描绘、协助或宣扬儿童性虐待或儿童色情化的内容”,并明确说明任何违规行为都将导致永久封号,并在适当时向美国国家失踪与受虐儿童中心(NCMEC)报告。检测儿童性虐待材料及涉及儿童的性内容
模型部署后,我们依靠多层检测机制来识别潜在有害内容以及试图创建此类内容的行为。这包括将所有用户提供的内容与已知的儿童性虐待材料哈希数据库进行比对,并使用专门的儿童性虐待材料分类器来检测此前未知的儿童性虐待材料。我们还应用基于AI的分类器来识别试图创建儿童性虐待材料或其他涉及儿童的性内容的行为。向NCMEC报告
我们人工审核所有被标记的内容,并将所有已确认的儿童性虐待材料报告给NCMEC。2025年,我们共向NCMEC的网络举报热线提交了516份报告。部署内容来源认证
我们实施C2PA来源认证信号,以便使用我们工具生成的内容可以追溯到其来源。来源认证并非解决滥用的完整方案,但它为平台、研究人员和执法部门提供了识别AI生成内容的重要信号。3. 维护:监控、改进与合作 监控与持续迭代
用于创建和传播儿童性虐待材料的技术发展迅速。我们持续测试和迭代我们的模型及安全措施,以确保我们的防护手段能够跟上步伐,尤其是在我们迈向更多实时生成内容的过程中。与行业及民间社会合作
我们也认识到,没有任何一家公司能独自解决这个问题。我们致力于与Thorn和Tech Coalition等组织以及行业同行合作,因为最好的防御来自共享知识。我们将持续投入这些合作伙伴关系,并随着威胁形势的变化和应对工具的演进,不断更新我们的方法。
您可以在我们的安全页面了解更多关于我们整体安全工作的信息。如果您遇到认为使用我们的工具生成且令人担忧的内容,请在此处举报。