Apple Machine Learning Research(RSS)
精选
79AI 编辑部评分,满分 100

苹果发布第三代 Apple Foundation Models(AFM)

2026-06-08 08:00· 59天前
AI 导读

苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。

推荐理由

Apple与Google罕见联手推出的第三代基础模型,直接为下一代Siri和系统级AI功能铺路,标志着消费级AI的深度整合,产品经理和iOS开发者必须关注。

正文 · AI 翻译
Hero

2026年6月8日

我们的下一代 Apple Intelligence 以用户为中心,深度集成到操作系统之中,并由一项大胆的新架构驱动,其核心是隐私保护。

该架构的核心是我们的第三代 Apple 基础模型(AFM),这是一个与 Google 合作定制构建的、包含五个基础模型的系列。这些模型涵盖从设备端模型到运行在私有云计算上的服务器端模型。

Apple 基础模型旨在为用户解锁广泛的有用体验,例如全新的 Siri 以及让日常应用更智能、更实用的智能工具。

该模型系列包含两个设备端模型:

  • AFM 3 Core,这是我们下一代 30 亿参数的密集模型,在质量上实现了显著提升。
  • AFM 3 Core Advanced,这是我们最强大的设备端模型。它原生支持多模态,能够实现富有表现力的语音和更高准确度的听写等实用功能。该模型基于 Apple 前沿研究构建,拥有 200 亿参数,采用稀疏架构,根据请求仅激活 10 亿到 40 亿个参数。AFM 3 Core Advanced 由我们最强大的 Apple 芯片系统解锁并为其进行了优化。

我们最新的 Apple 基础模型还包括三个运行在私有云计算上的服务器端模型,这确保了用户数据永远不会被存储或与任何人(包括 Apple)共享。这些模型是:

  • AFM 3 Cloud,我们的服务器端主力模型,针对速度、效率和性能进行了优化。
  • ADM 3 Cloud(图像),用于图像生成和编辑,解锁了先进的照片编辑工具、全新的 Image Playground 等更多功能。
  • AFM 3 Cloud Pro,我们最强大的服务器端模型,为最严苛的用例提供动力,例如智能体工具使用和复杂推理。

AFM 3 Core、AFM 3 Core Advanced、AFM 3 Cloud 以及 ADM 3 Cloud 均为 Apple 芯片量身打造。

对于 AFM 3 Cloud Pro,我们与 Google 和 NVIDIA 合作,将私有云计算扩展到 Google Cloud 中的 NVIDIA GPU,同时保持相同的保障措施来保护用户隐私。更多详情请访问我们的安全研究网站。

我们的第三代 Apple 基础模型在能力和质量上均实现了显著提升。在接下来的概述中,我们将深入探讨驱动我们端侧模型和服务器端模型的可扩展架构、我们的训练方法以及更多内容。

模型架构

我们为端侧和服务器端模型设计的架构,旨在为用户提供强大的 Apple 智能体验,并将我们的最新模型深度集成到操作系统中。

最大化端侧 AI 能力

深度创新的领域之一是我们最强大的端侧模型 AFM 3 Core Advanced。传统的大语言模型——无论是密集激活还是稀疏激活——都需要将所有权重驻留在活动内存(DRAM)中,这会产生巨大的内存占用,从而限制了在消费级硬件上的可扩展性。为了突破这一瓶颈,AFM 3 Core Advanced 引入了一种基于指令遵循剪枝(IFP)的新型稀疏激活架构,该技术由 Apple 研究人员开发(见图 1)。

该模型并非将整个模型强制加载到 DRAM 中,而是将完整模型存储在闪存(NAND)中。由于 NAND 到 DRAM 的带宽速度太慢,无法像标准 MoE 模型要求的那样逐个 token 地交换权重,因此 AFM 3 Core Advanced 会针对每个提示词做出路由决策。一个轻量级的密集模块在初始处理阶段选择一组固定的专家,并在生成过程中定期重新选择它们。为了最大限度地减少数据移动,该模型依赖于高比例的始终活跃的“共享专家”,以及仅在需要时才交换到 DRAM 中的、依赖于输入的“路由专家”。

AFM 3 Core Advanced 模型架构

AFM 3 Core Advanced Model Architecture

图 1:AFM 3 Core Advanced 模型架构示意图。模型绝大部分参数是与堆叠式 Transformer 架构中前馈(FFN)模块相关联的“专家”权重。给定用户查询后,模型会选择性加载一小部分专家,并将它们与共享的静态权重拼接,从而在 DRAM 中形成一个密集模型。模型在 token 生成过程中会定期重新选择并更新激活的专家。

这一设计还引入了关键的推理时弹性。AFM 3 Core Advanced 并非对所有任务使用单一模型,也不管理一组较小的模型集合,而是针对每个具体用例使用预定数量的活跃参数。这使得权重能够根据请求难度的不同,在请求之间增量加载,从而将模型规模扩展到远超传统 DRAM 限制的程度,同时将延迟降至最低。

扩展服务器端基础模型

除了设备端 AI 的创新,我们在服务器端模型方面也迈出了一大步。例如,我们的服务器端模型 AFM 3 Cloud 代表了由私有云计算驱动的多模态推理能力的重大进步。为此,我们对去年推出的并行轨迹混合专家(PT-MoE)基础架构实施了几项关键升级。这些架构上的改进稳定了训练过程,并提升了模型在其上下文窗口内对复杂服务器端查询进行推理和准确召回信息的能力。

使用 ADM 3 Cloud 创建和编辑图像

我们推进模型架构的另一个例子是最新的图像模型 ADM 3 Cloud。为了支持高质量的图像创建(见图 2)、编辑和 Genmoji 功能,我们开发了 ADM 3 Cloud,以实现强大的可控性和参数效率。它能够泛化到不同的宽高比和分辨率,并借鉴更广泛的 Apple 基础模型家族来指导创建和编辑过程。虽然基础模型原生支持图像创建、编辑和 Genmoji,我们也使用专门的适配器来驱动特定的下游编辑体验,例如照片中的空间重构图功能,以及 Image Playground 中基于触摸的图像修改和个性化功能。

Examples of images generated with ADM 3 Cloud.

图 2:由 ADM 3 Cloud 驱动的原生图像生成示例。该模型在不同主体和复杂光照条件下均展现出照片级真实感。

训练数据

强大的基础模型需要多样化、高质量的数据。为了训练我们的基础模型,我们使用了混合数据,包括公开可获取的信息、从第三方授权或购买的数据、开源数据、通过专项研究获得的数据以及合成数据。我们在训练基础模型时,不会使用用户的私人个人数据或用户交互数据。我们也尊重网络发布者选择退出基础模型训练的权利。

训练方案

为了支持我们全新的 Apple Intelligence 体验,我们在最新一代云端 TPU 加速器上显著扩展了预训练的规模。所有模型在针对各自架构和用例进行专业化之前,共享一个共同的初始基础,并增加了多模态能力,如音频、图像理解、长上下文推理以及高质量视觉生成。随后,我们扩展了后训练流程,将监督式微调与多阶段强化学习相结合。

最后,我们针对每个模型的目标硬件进行了优化。AFM 3 Core、AFM 3 Core Advanced、AFM 3 Cloud 和 ADM 3 Cloud(图像)经过优化,可在 Apple 芯片上高效运行,而 AFM 3 Cloud Pro 则针对 NVIDIA GPU 进行了优化。通过使用量化感知训练,我们在保持高精度的同时大幅压缩了模型,共同提供了用户所期望的响应迅速、高质量的体验。

评估

我们的第三代 Apple 基础模型旨在为集成的 Apple Intelligence 体验提供支持,使我们的操作系统更智能、更有用,我们在模型层面和功能层面都进行了质量评估。

下面,我们首先详细介绍模型层面的评估,然后是模型所解锁功能的结果。这些评估反映了我们模型在当前开发阶段的表现。在测试版期间,我们将持续改进它们,为用户提供出色的体验。

模型层面评估

为确保卓越体验,内部人工评估员会从多个关键维度对模型回答进行评估,包括指令遵循、真实性和呈现效果。对于基于图像的提示词,我们还会评估图像理解能力,即衡量模型成功识别、提取和推理视觉内容的能力。

在这些维度上,我们的端侧模型展现出了显著的代际进步。在通用文本能力方面,更新后的 AFM 3 Core 模型相比前代有所提升,在 45.6% 的提示词上获得偏好,而 2025 年基线模型仅为 23.3%(见图 3)。这一进步也延伸到了视觉输入领域;在图像理解方面,当用户对两者有明确偏好时,他们选择 AFM 3 Core 而非上一代模型的概率超过 61%(见图 4)。

我们的服务器端模型 AFM 3 Cloud 相比前代也有显著提升。在针对通用文本能力的人工并排评估中,它在 64.7% 的提示词上获得偏好,而 2025 年的 AFM Server 模型仅为 8.7%,这一代际飞跃在所有语言区域均保持一致。我们在单侧评估中也看到了持续进步,该评估从多个维度独立对回答进行评分:与 2025 年的 AFM Server 模型相比,AFM 3 Cloud 在整体回答满意度上实现了约 36% 的相对提升,在指令遵循性能上实现了 21% 的相对提升。此外,在模型对视觉输入进行解读和推理的图像理解方面,AFM 3 Cloud 相比去年的前代模型表现出显著进步,在 37.8% 的提示词上获得偏好,而 2025 年基线模型仅为 9.6%。

最后,AFM 3 Cloud Pro 在 AFM 3 Cloud 的基础上实现了进一步提升,在文本方面的整体回答满意度相对提升了约 10%,在图像理解方面整体相对提升了 14%。AFM 3 Cloud Pro 在数学等特定任务类别中表现优异,相比 AFM 3 Cloud 实现了 14% 的相对提升。

媒体内容 · 前往原文查看

文本人工评估

图 3:在通用文本能力的人工并排评估中,AFM 3 Core 和 AFM 3 Cloud 相较于我们上一代模型的偏好响应占比。结果按四个不同的语言区域组呈现,以展示在国际变体中的一致性能。“English”1 代表我们的全球英语评估集,而“PFIGSCJK”2、“DDNSTV”3 和“AFIHHMPRTU”4 代表我们其余受支持的全球语言区域。

媒体内容 · 前往原文查看

图像理解的人工评估

图 4:在英语图像理解能力的人工并排评估中,AFM 3 Core 和 AFM 3 Cloud 相较于其 2025 年前代产品的偏好响应占比。

特定功能评估

除了模型层面的评估,我们还评估了由我们基础模型驱动的所有功能。下面,我们重点介绍其中一些结果。

为了衡量我们新表现力语音的质量,评估人员使用 5 分制平均意见得分(MOS)量表,将 AFM 3 Core Advanced 与苹果现有的生产级文本转语音(TTS)系统进行了对比(见表 1)。在其高效的 10 亿参数激活规模下运行时,AFM 3 Core Advanced 获得了 4.15 的总分——比当前生产基线显著提高了 0.28 分,尤其考虑到 MOS 量表上 0.1 分的提升就代表着客户体验中非常明显的改进(请听音频 1)。在对话文本上,例如朗读短信时使用的随意语言,这种质量差距甚至更大。在这些对话场景中,AFM 3 Core Advanced 得分为 4.24,而生产系统为 3.82,两者相差 0.42 分,这证明了其提供了明显更自然、更具表现力的音频体验。

媒体内容 · 前往原文查看
指标

当前 TTS 系统

AFM 3 Core Advanced

通用语音

3.87

4.15

对话语音3.82

4.24

表 1:文本转语音(TTS)生成的人工评估结果,采用 5 分制平均意见得分进行评分。结果对比了 AFM 3 Core Advanced 与苹果现有的生产级 TTS 系统。每个类别中的最高分已加粗显示。

媒体内容 · 前往原文查看

当前 TTS 系统

AFM 3 Core Advanced

音频 1:对话式文本转语音生成的并排对比。上方一行展示了一个涉及三人讨论读书会的多轮群聊通知。下方一行展示了一组对话式步行导航语音:“继续直走,你不会错过的。你会看到左边有一排商店,其中一家鞋店挂着鲜红色的遮阳篷。你看到了吗?那就是我们快到的标志。”在两个示例中,左侧列展示当前生产基线,右侧列展示 AFM 3 Core Advanced 更自然、更具表现力的节奏。

作为这些文本转语音改进的补充,AFM 3 Core Advanced 在其语音转文本能力方面也展现出显著进步(见图 5)。针对听写等特定下游功能,我们收集了与之前听写系统在七个维度上的并排偏好判断:整体质量、标点符号、大小写、布局、语义捕捉、不流畅处理及风格。在 10 亿参数激活规模下,AFM 3 Core Advanced 在整体质量上以 44.7% 对 17.6% 的偏好度胜出,且这一偏好优势在其余六个维度上均保持一致。

音频人工评估

负责任的人工智能

我们最新的 Apple 基础模型在每一步都遵循我们的核心价值观,并建立在行业领先的隐私保护基础之上。此外,在开发和推进 Apple 智能与 Apple 基础模型的每个阶段,我们都运用负责任的人工智能原则来指导我们的功能与模型:

  1. 用智能工具赋能用户:我们识别可以负责任地运用人工智能的领域,以创建满足特定用户需求的工具。我们尊重用户选择如何使用这些工具来实现自身目标。
  2. 代表我们的用户:我们打造深度个性化的产品,旨在真实地代表全球用户。我们持续努力,避免在人工智能工具和模型中延续刻板印象和系统性偏见。
  3. 精心设计:我们在整个流程中(包括设计、模型训练、功能开发和质量评估)都采取预防措施,以识别我们的 AI 工具可能被滥用或导致潜在危害的方式。我们将持续监控,并借助用户反馈主动改进我们的 AI 工具。
  4. 保护隐私:我们通过强大的设备端处理和像私有云计算这样的突破性基础设施来保护用户的隐私。在训练我们的基础模型时,我们不会使用用户的私人个人数据或用户交互信息。

我们的安全分类法有助于识别需要谨慎处理的敏感内容。为确保我们的模型在不同语言和文化背景下都能尊重这些边界,我们进行了多语言的后训练对齐,使用了特定语言的护栏模型,并在我们支持的所有语言区域中,由母语者完善了人工红队测试。我们持续致力于改进我们模型与负责任 AI 方法的对齐,我们最新的模型已显示出显著进展。

结论

我们的第三代苹果基础模型代表了向前迈出的一大步,为新的 Apple 智能体验提供动力,使我们的操作系统对用户更加有用。这包括一个全新版本的 Siri、先进的照片编辑工具、Image Playground 的强大更新、极具表现力的语音,以及更多功能。为保护用户隐私,这些模型完全在设备端和私有云计算上运行。我们期待在今年夏末的一份技术报告中分享关于我们最新基础模型的更多细节,包括更新的评估和基准测试。

脚注

  1. 英语指代不同国家的方言(例如,美国、英国、澳大利亚、印度)。

  2. PFIGSCJK 指葡萄牙语、法语、意大利语、德语、西班牙语、中文、日语和韩语。

  3. DDNSTV 指丹麦语、荷兰语、挪威语、瑞典语、土耳其语和越南语。
  4. AFIHHMPRTU 指阿拉伯语、芬兰语、印尼语、希伯来语、印地语、马来语、波兰语、俄语、泰语和乌克兰语。

相关阅读与更新。

苹果设备端与服务器端基础语言模型的更新

2025年6月9日

通过 Apple Intelligence,我们将强大的生成式 AI 直接集成到人们日常使用的应用和体验中,同时保护他们的隐私。在 2025 年全球开发者大会上,我们推出了新一代语言基础模型,专门用于增强最新软件版本中的 Apple Intelligence 功能。我们还推出了新的基础模型框架,为应用开发者提供……

介绍 Apple 的端侧与服务器基础模型

2024 年 6 月 10 日

在 2024 年全球开发者大会上,我们推出了 Apple Intelligence,这是一个深度集成到 iOS 18、iPadOS 18 和 macOS Sequoia 中的个人智能系统。

Apple Intelligence 由多个高性能生成式模型组成,这些模型专为用户日常任务而设计,并能根据用户当前活动实时调整。内置于 Apple Intelligence 的基础模型已针对各类用户体验进行了微调,例如撰写和润色文本、对通知进行优先级排序和摘要、为与家人朋友的对话创建趣味图像,以及执行应用内操作以简化跨应用交互。

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

苹果发布第三代 Apple Foundation Models(AFM)

Apple Machine Learning Research(RSS)·2026-06-08 08:00·59天前
AI 导读

苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。

正文 · AI 翻译
Hero

2026年6月8日

我们的下一代 Apple Intelligence 以用户为中心,深度集成到操作系统之中,并由一项大胆的新架构驱动,其核心是隐私保护。

该架构的核心是我们的第三代 Apple 基础模型(AFM),这是一个与 Google 合作定制构建的、包含五个基础模型的系列。这些模型涵盖从设备端模型到运行在私有云计算上的服务器端模型。

Apple 基础模型旨在为用户解锁广泛的有用体验,例如全新的 Siri 以及让日常应用更智能、更实用的智能工具。

该模型系列包含两个设备端模型:

  • AFM 3 Core,这是我们下一代 30 亿参数的密集模型,在质量上实现了显著提升。
  • AFM 3 Core Advanced,这是我们最强大的设备端模型。它原生支持多模态,能够实现富有表现力的语音和更高准确度的听写等实用功能。该模型基于 Apple 前沿研究构建,拥有 200 亿参数,采用稀疏架构,根据请求仅激活 10 亿到 40 亿个参数。AFM 3 Core Advanced 由我们最强大的 Apple 芯片系统解锁并为其进行了优化。

我们最新的 Apple 基础模型还包括三个运行在私有云计算上的服务器端模型,这确保了用户数据永远不会被存储或与任何人(包括 Apple)共享。这些模型是:

  • AFM 3 Cloud,我们的服务器端主力模型,针对速度、效率和性能进行了优化。
  • ADM 3 Cloud(图像),用于图像生成和编辑,解锁了先进的照片编辑工具、全新的 Image Playground 等更多功能。
  • AFM 3 Cloud Pro,我们最强大的服务器端模型,为最严苛的用例提供动力,例如智能体工具使用和复杂推理。

AFM 3 Core、AFM 3 Core Advanced、AFM 3 Cloud 以及 ADM 3 Cloud 均为 Apple 芯片量身打造。

对于 AFM 3 Cloud Pro,我们与 Google 和 NVIDIA 合作,将私有云计算扩展到 Google Cloud 中的 NVIDIA GPU,同时保持相同的保障措施来保护用户隐私。更多详情请访问我们的安全研究网站。

我们的第三代 Apple 基础模型在能力和质量上均实现了显著提升。在接下来的概述中,我们将深入探讨驱动我们端侧模型和服务器端模型的可扩展架构、我们的训练方法以及更多内容。

模型架构

我们为端侧和服务器端模型设计的架构,旨在为用户提供强大的 Apple 智能体验,并将我们的最新模型深度集成到操作系统中。

最大化端侧 AI 能力

深度创新的领域之一是我们最强大的端侧模型 AFM 3 Core Advanced。传统的大语言模型——无论是密集激活还是稀疏激活——都需要将所有权重驻留在活动内存(DRAM)中,这会产生巨大的内存占用,从而限制了在消费级硬件上的可扩展性。为了突破这一瓶颈,AFM 3 Core Advanced 引入了一种基于指令遵循剪枝(IFP)的新型稀疏激活架构,该技术由 Apple 研究人员开发(见图 1)。

该模型并非将整个模型强制加载到 DRAM 中,而是将完整模型存储在闪存(NAND)中。由于 NAND 到 DRAM 的带宽速度太慢,无法像标准 MoE 模型要求的那样逐个 token 地交换权重,因此 AFM 3 Core Advanced 会针对每个提示词做出路由决策。一个轻量级的密集模块在初始处理阶段选择一组固定的专家,并在生成过程中定期重新选择它们。为了最大限度地减少数据移动,该模型依赖于高比例的始终活跃的“共享专家”,以及仅在需要时才交换到 DRAM 中的、依赖于输入的“路由专家”。

AFM 3 Core Advanced 模型架构

AFM 3 Core Advanced Model Architecture

图 1:AFM 3 Core Advanced 模型架构示意图。模型绝大部分参数是与堆叠式 Transformer 架构中前馈(FFN)模块相关联的“专家”权重。给定用户查询后,模型会选择性加载一小部分专家,并将它们与共享的静态权重拼接,从而在 DRAM 中形成一个密集模型。模型在 token 生成过程中会定期重新选择并更新激活的专家。

这一设计还引入了关键的推理时弹性。AFM 3 Core Advanced 并非对所有任务使用单一模型,也不管理一组较小的模型集合,而是针对每个具体用例使用预定数量的活跃参数。这使得权重能够根据请求难度的不同,在请求之间增量加载,从而将模型规模扩展到远超传统 DRAM 限制的程度,同时将延迟降至最低。

扩展服务器端基础模型

除了设备端 AI 的创新,我们在服务器端模型方面也迈出了一大步。例如,我们的服务器端模型 AFM 3 Cloud 代表了由私有云计算驱动的多模态推理能力的重大进步。为此,我们对去年推出的并行轨迹混合专家(PT-MoE)基础架构实施了几项关键升级。这些架构上的改进稳定了训练过程,并提升了模型在其上下文窗口内对复杂服务器端查询进行推理和准确召回信息的能力。

使用 ADM 3 Cloud 创建和编辑图像

我们推进模型架构的另一个例子是最新的图像模型 ADM 3 Cloud。为了支持高质量的图像创建(见图 2)、编辑和 Genmoji 功能,我们开发了 ADM 3 Cloud,以实现强大的可控性和参数效率。它能够泛化到不同的宽高比和分辨率,并借鉴更广泛的 Apple 基础模型家族来指导创建和编辑过程。虽然基础模型原生支持图像创建、编辑和 Genmoji,我们也使用专门的适配器来驱动特定的下游编辑体验,例如照片中的空间重构图功能,以及 Image Playground 中基于触摸的图像修改和个性化功能。

Examples of images generated with ADM 3 Cloud.

图 2:由 ADM 3 Cloud 驱动的原生图像生成示例。该模型在不同主体和复杂光照条件下均展现出照片级真实感。

训练数据

强大的基础模型需要多样化、高质量的数据。为了训练我们的基础模型,我们使用了混合数据,包括公开可获取的信息、从第三方授权或购买的数据、开源数据、通过专项研究获得的数据以及合成数据。我们在训练基础模型时,不会使用用户的私人个人数据或用户交互数据。我们也尊重网络发布者选择退出基础模型训练的权利。

训练方案

为了支持我们全新的 Apple Intelligence 体验,我们在最新一代云端 TPU 加速器上显著扩展了预训练的规模。所有模型在针对各自架构和用例进行专业化之前,共享一个共同的初始基础,并增加了多模态能力,如音频、图像理解、长上下文推理以及高质量视觉生成。随后,我们扩展了后训练流程,将监督式微调与多阶段强化学习相结合。

最后,我们针对每个模型的目标硬件进行了优化。AFM 3 Core、AFM 3 Core Advanced、AFM 3 Cloud 和 ADM 3 Cloud(图像)经过优化,可在 Apple 芯片上高效运行,而 AFM 3 Cloud Pro 则针对 NVIDIA GPU 进行了优化。通过使用量化感知训练,我们在保持高精度的同时大幅压缩了模型,共同提供了用户所期望的响应迅速、高质量的体验。

评估

我们的第三代 Apple 基础模型旨在为集成的 Apple Intelligence 体验提供支持,使我们的操作系统更智能、更有用,我们在模型层面和功能层面都进行了质量评估。

下面,我们首先详细介绍模型层面的评估,然后是模型所解锁功能的结果。这些评估反映了我们模型在当前开发阶段的表现。在测试版期间,我们将持续改进它们,为用户提供出色的体验。

模型层面评估

为确保卓越体验,内部人工评估员会从多个关键维度对模型回答进行评估,包括指令遵循、真实性和呈现效果。对于基于图像的提示词,我们还会评估图像理解能力,即衡量模型成功识别、提取和推理视觉内容的能力。

在这些维度上,我们的端侧模型展现出了显著的代际进步。在通用文本能力方面,更新后的 AFM 3 Core 模型相比前代有所提升,在 45.6% 的提示词上获得偏好,而 2025 年基线模型仅为 23.3%(见图 3)。这一进步也延伸到了视觉输入领域;在图像理解方面,当用户对两者有明确偏好时,他们选择 AFM 3 Core 而非上一代模型的概率超过 61%(见图 4)。

我们的服务器端模型 AFM 3 Cloud 相比前代也有显著提升。在针对通用文本能力的人工并排评估中,它在 64.7% 的提示词上获得偏好,而 2025 年的 AFM Server 模型仅为 8.7%,这一代际飞跃在所有语言区域均保持一致。我们在单侧评估中也看到了持续进步,该评估从多个维度独立对回答进行评分:与 2025 年的 AFM Server 模型相比,AFM 3 Cloud 在整体回答满意度上实现了约 36% 的相对提升,在指令遵循性能上实现了 21% 的相对提升。此外,在模型对视觉输入进行解读和推理的图像理解方面,AFM 3 Cloud 相比去年的前代模型表现出显著进步,在 37.8% 的提示词上获得偏好,而 2025 年基线模型仅为 9.6%。

最后,AFM 3 Cloud Pro 在 AFM 3 Cloud 的基础上实现了进一步提升,在文本方面的整体回答满意度相对提升了约 10%,在图像理解方面整体相对提升了 14%。AFM 3 Cloud Pro 在数学等特定任务类别中表现优异,相比 AFM 3 Cloud 实现了 14% 的相对提升。

媒体内容 · 前往原文查看

文本人工评估

图 3:在通用文本能力的人工并排评估中,AFM 3 Core 和 AFM 3 Cloud 相较于我们上一代模型的偏好响应占比。结果按四个不同的语言区域组呈现,以展示在国际变体中的一致性能。“English”1 代表我们的全球英语评估集,而“PFIGSCJK”2、“DDNSTV”3 和“AFIHHMPRTU”4 代表我们其余受支持的全球语言区域。

媒体内容 · 前往原文查看

图像理解的人工评估

图 4:在英语图像理解能力的人工并排评估中,AFM 3 Core 和 AFM 3 Cloud 相较于其 2025 年前代产品的偏好响应占比。

特定功能评估

除了模型层面的评估,我们还评估了由我们基础模型驱动的所有功能。下面,我们重点介绍其中一些结果。

为了衡量我们新表现力语音的质量,评估人员使用 5 分制平均意见得分(MOS)量表,将 AFM 3 Core Advanced 与苹果现有的生产级文本转语音(TTS)系统进行了对比(见表 1)。在其高效的 10 亿参数激活规模下运行时,AFM 3 Core Advanced 获得了 4.15 的总分——比当前生产基线显著提高了 0.28 分,尤其考虑到 MOS 量表上 0.1 分的提升就代表着客户体验中非常明显的改进(请听音频 1)。在对话文本上,例如朗读短信时使用的随意语言,这种质量差距甚至更大。在这些对话场景中,AFM 3 Core Advanced 得分为 4.24,而生产系统为 3.82,两者相差 0.42 分,这证明了其提供了明显更自然、更具表现力的音频体验。

媒体内容 · 前往原文查看
指标

当前 TTS 系统

AFM 3 Core Advanced

通用语音

3.87

4.15

对话语音3.82

4.24

表 1:文本转语音(TTS)生成的人工评估结果,采用 5 分制平均意见得分进行评分。结果对比了 AFM 3 Core Advanced 与苹果现有的生产级 TTS 系统。每个类别中的最高分已加粗显示。

媒体内容 · 前往原文查看

当前 TTS 系统

AFM 3 Core Advanced

音频 1:对话式文本转语音生成的并排对比。上方一行展示了一个涉及三人讨论读书会的多轮群聊通知。下方一行展示了一组对话式步行导航语音:“继续直走,你不会错过的。你会看到左边有一排商店,其中一家鞋店挂着鲜红色的遮阳篷。你看到了吗?那就是我们快到的标志。”在两个示例中,左侧列展示当前生产基线,右侧列展示 AFM 3 Core Advanced 更自然、更具表现力的节奏。

作为这些文本转语音改进的补充,AFM 3 Core Advanced 在其语音转文本能力方面也展现出显著进步(见图 5)。针对听写等特定下游功能,我们收集了与之前听写系统在七个维度上的并排偏好判断:整体质量、标点符号、大小写、布局、语义捕捉、不流畅处理及风格。在 10 亿参数激活规模下,AFM 3 Core Advanced 在整体质量上以 44.7% 对 17.6% 的偏好度胜出,且这一偏好优势在其余六个维度上均保持一致。

音频人工评估

负责任的人工智能

我们最新的 Apple 基础模型在每一步都遵循我们的核心价值观,并建立在行业领先的隐私保护基础之上。此外,在开发和推进 Apple 智能与 Apple 基础模型的每个阶段,我们都运用负责任的人工智能原则来指导我们的功能与模型:

  1. 用智能工具赋能用户:我们识别可以负责任地运用人工智能的领域,以创建满足特定用户需求的工具。我们尊重用户选择如何使用这些工具来实现自身目标。
  2. 代表我们的用户:我们打造深度个性化的产品,旨在真实地代表全球用户。我们持续努力,避免在人工智能工具和模型中延续刻板印象和系统性偏见。
  3. 精心设计:我们在整个流程中(包括设计、模型训练、功能开发和质量评估)都采取预防措施,以识别我们的 AI 工具可能被滥用或导致潜在危害的方式。我们将持续监控,并借助用户反馈主动改进我们的 AI 工具。
  4. 保护隐私:我们通过强大的设备端处理和像私有云计算这样的突破性基础设施来保护用户的隐私。在训练我们的基础模型时,我们不会使用用户的私人个人数据或用户交互信息。

我们的安全分类法有助于识别需要谨慎处理的敏感内容。为确保我们的模型在不同语言和文化背景下都能尊重这些边界,我们进行了多语言的后训练对齐,使用了特定语言的护栏模型,并在我们支持的所有语言区域中,由母语者完善了人工红队测试。我们持续致力于改进我们模型与负责任 AI 方法的对齐,我们最新的模型已显示出显著进展。

结论

我们的第三代苹果基础模型代表了向前迈出的一大步,为新的 Apple 智能体验提供动力,使我们的操作系统对用户更加有用。这包括一个全新版本的 Siri、先进的照片编辑工具、Image Playground 的强大更新、极具表现力的语音,以及更多功能。为保护用户隐私,这些模型完全在设备端和私有云计算上运行。我们期待在今年夏末的一份技术报告中分享关于我们最新基础模型的更多细节,包括更新的评估和基准测试。

脚注

  1. 英语指代不同国家的方言(例如,美国、英国、澳大利亚、印度)。

  2. PFIGSCJK 指葡萄牙语、法语、意大利语、德语、西班牙语、中文、日语和韩语。

  3. DDNSTV 指丹麦语、荷兰语、挪威语、瑞典语、土耳其语和越南语。
  4. AFIHHMPRTU 指阿拉伯语、芬兰语、印尼语、希伯来语、印地语、马来语、波兰语、俄语、泰语和乌克兰语。

相关阅读与更新。

苹果设备端与服务器端基础语言模型的更新

2025年6月9日

通过 Apple Intelligence,我们将强大的生成式 AI 直接集成到人们日常使用的应用和体验中,同时保护他们的隐私。在 2025 年全球开发者大会上,我们推出了新一代语言基础模型,专门用于增强最新软件版本中的 Apple Intelligence 功能。我们还推出了新的基础模型框架,为应用开发者提供……

介绍 Apple 的端侧与服务器基础模型

2024 年 6 月 10 日

在 2024 年全球开发者大会上,我们推出了 Apple Intelligence,这是一个深度集成到 iOS 18、iPadOS 18 和 macOS Sequoia 中的个人智能系统。

Apple Intelligence 由多个高性能生成式模型组成,这些模型专为用户日常任务而设计,并能根据用户当前活动实时调整。内置于 Apple Intelligence 的基础模型已针对各类用户体验进行了微调,例如撰写和润色文本、对通知进行优先级排序和摘要、为与家人朋友的对话创建趣味图像,以及执行应用内操作以简化跨应用交互。

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com