前沿扩散与控制
在一个软件首次拥有真实边际成本的世界里,我们如何确保前沿成果惠及整个生态系统?
关键在于,要在真实世界场景中优化成本与成果的前沿。具体而言,这意味着为每项任务使用合适的模型,并围绕它优化上下文、技能、工具和智能体编排框架。
这正是我们 MAI 模型家族背后的动机。这些模型从零开始构建,拥有清晰的数据溯源,并针对企业 RLE 中从通用技能到专业技能的迁移学习进行了优化。我们在这条道路上持续取得快速进展。
现在,我们可以将已饱和的前沿能力,通过针对高使用率产品优化的模型,以更低的成本大规模交付,同时继续使用前沿模型来满足前沿需求。我们正在自有产品中验证这一点,从而为所有其他 AI 原生、SaaS 或企业公司创建了一个可复用的模板。
在我们的产品中,来自 OpenAI 和 Anthropic 的前沿模型与 MAI 共同构成了编排系统的一部分。但模型只是爬山系统中的一个环节。编排框架、记忆、上下文、工具、技能、用户交互等,共同塑造了这些智能体系统的评估指标和性能。
确保你处于掌控之中的另一个关键标准是:即使某个特定模型被移除,你的评估指标也应能继续爬山。因此,我们构建了 RLE,让模型在产品系统内部学习,并根据完成客户真正关心的任务来获得奖励。我们针对模型将实际遇到的产品编排框架、交互和结果来训练模型。并在战略上确保编排框架、记忆、上下文、技能都外化于模型之外。
产品特定的评估指标和模型独立性,赋予我们掌控力和一个直接的爬山路径,让我们能够不断优化,直到达到正确的质量-成本目标。我们现在看到,MAI 模型在许多用例中超越了通用前沿模型,同时只使用了极少量的模型 token。
我们相信,最大的机遇在于,在人们日常工作的产品中,将这些所有层面协同优化。并且,当我们的模型能够匹配或超越前沿替代方案时,我们已开始将流量路由到自有产品界面上的 MAI。
我们在 GitHub Copilot、Excel 和 Outlook 上看到了令人鼓舞的初步成果,并开始将同样的方法推广到 Copilot Chat、PowerPoint 等更多产品中。随着整个系统持续进行爬山优化,所有这些成果只会变得更好!
我们在第一方产品中所做的工作,也正是每一家企业客户可以在其现实世界的智能体系统中,利用自有评估体系、自有 RLE、工作流和上下文所能够实现的。我们正在通过 Foundry 和我们的工具链提供所有这些能力。
更多详情请阅读:https://microsoft.ai/news/hill-climbing-mai-models-for-github-copilot-and-excel/