如果 Claude Fable 不再帮助你,你永远不会知道。
2026 年 6 月 9 日
更新:Anthropic 在遭到开发者强烈反对后,已撤回这项政策。该公司现在表示,针对前沿大语言模型开发的 Fable 5 安全措施将对用户可见,而不再静默降低模型性能。
我没想到会在模型卡中读到这个。Fable 5 模型卡:
我们实施了新的干预措施,限制 Claude 在处理针对前沿大语言模型开发的请求时的有效性(例如,在构建预训练流水线、分布式训练基础设施或机器学习加速器设计方面)。使用 Claude 开发竞争性模型已经违反了我们的服务条款,但通过我们的安全措施来强制执行这一限制,可以避免加速那些最愿意违反这些条款的行为者。与我们在网络安全、生物学和化学以及知识蒸馏尝试方面的干预措施不同,这些安全措施对用户不可见。Fable 5 不会回退到不同的模型。相反,这些安全措施将通过提示词修改、引导向量或参数高效微调(PEFT)等方法来限制模型的有效性。
Claude 现在可以被静默削弱了。Anthropic 决定在发生这种情况时不告知用户。
现代软件公司越来越多地构建自己的嵌入向量、重排序和推荐系统。就连我那个小型自筹资金的应用 wanderfugl.com,也有一个我自己训练的自定义重排序器和嵌入算法。
Anthropic 给出了几个它认为属于"前沿人工智能开发"的例子,但没有提供明确的界限。问题在于,许多曾经只用于人工智能实验室的技术,现在正被普通软件公司使用。初创公司训练嵌入模型。它们构建重排序器。它们微调并托管小型大语言模型。"前沿人工智能研究"与普通产品开发之间的界限每年都变得越来越难以界定。
这给企业带来了真实的供应链风险。如果我在开发 AI 组件时,Claude 给出了糟糕或错误的建议,我无法判断是模型本身感到困惑、我的问题无解,还是某些隐形的政策限制悄悄起了作用。Anthropic 明确选择不告知用户这种情况何时发生。
一旦开发工具可以在不告知你的情况下停止为你的成功进行优化,你就再也无法完全信任自己的基础设施了。
Anthropic 的供应链风险
Anthropic 表示这些安全措施仅影响 0.03% 的开发者。也许今天确实如此。
问题在于,AI 公司的定义正在发生变化。
也许你今天没有在训练前沿模型——大多数公司都没有。但现代软件中越来越多地包含 AI 模型。五年前,创业意味着编写 API 和 SQL 查询。而今天,它往往意味着训练、微调和部署模型。
五年前,像 CLIP 这样的模型还是前沿 AI 研究项目。而今天,我正在为一家自筹资金的旅游初创公司微调它们。
如果你正在调试产品的模型训练流程,而 Claude 给出了错误答案,是模型困惑了?是你提供了错误的上下文?还是某个隐藏政策削弱了 Claude 协助你的能力?
你无从知晓。
未来文章的 RSS 订阅源。