IT之家 9 月 8 日消息,Arm 今天在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时将系统 IP、软件和开发者工具整合为完整平台。

Arm 方面表示,智能体 AI 的能力已从早期的问答交互,演进到理解用户意图并自主执行任务的阶段,智能体工作流和日益复杂的 AI 原生图形技术,对移动计算提出了新的要求。移动设备的性能表现将取决于三个核心维度:各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度能力。
CSS for Mobile 2 据此从整体系统层面统筹优化性能、能效和数据传输效率,并将优化延伸至物理实现阶段,使合作伙伴在开展 SoC 集成之前,就能将功耗、性能和面积(PPA)与架构设计协同考量。该平台在组件选用上保留了灵活性,合作伙伴既可以单独选用各个组件,也可以将其与自研 IP 或第三方 IP 结合。

Arm C2 CPU 集群:双 SME2 引擎
CPU 部分,Arm C2 CPU 集群融合了 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术。官方公布的数据显示,该集群在最新 AI 模型上的性能最高提升达 1.7 倍,单线程性能最高提升 15%,网页浏览速度提升 15%,应用启动速度提升 12%,集群级多线程性能提升 12%,可支持知识检索、模型准备和应用执行等任务并行处理。

与上一代配置相比,新一代 C2 CPU 集群集成双 SME2 引擎,SME2 能力翻倍。具体到智能体 AI 工作流的各个环节:
运行最新的 Moonshine 和 Parakeet 语音转文本模型时,搭载 SME2 的 C2-Ultra 相比 C1-Ultra 延迟降低 40%,有助于缩短智能体 AI 交互的起始延迟;
在记忆阶段,其内存信息检索与搜索性能较上一代提升 41%;
在推理阶段,小语言模型结合检索到的上下文生成结构化指令的平均速度较上一代提升 25%。

在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端测试中,C2-Ultra 配置相比上一代实现了 24% 的整体性能提升。

Arm 同时介绍了该工作流的核心编排层(Orchestration Layer)。它负责维护任务状态、整合上下文信息,并决定工作流中每个阶段由哪个计算资源执行,执行过程可能涉及本地应用、端侧模型、其他计算资源或云端服务,CPU 则统一协调权限管理与任务执行进程。

Mali G2-Ultra NX:神经网络加速器进入 GPU
GPU 部分,Mali G2-Ultra NX 是 Arm 首款 AI 原生 Mali GPU,核心变化是将专用神经网络加速器直接嵌入 GPU 着色器核心,使神经图形工作负载能够与图形和计算任务并行运行,并复用 GPU 的内存系统、一致性缓存和控制结构,减少数据在不同计算单元之间的传输。该 GPU 结合全新执行引擎和第三代光线追踪单元(RTUv3),为神经图形工作负载提供 AI 原生图形基础。

该 GPU 支持三项神经网络加速技术,其中神经超级采样(NSS)基于低分辨率渲染画面重建更高分辨率的图像;神经帧率提升(NFRU)通过生成中间帧提高帧率;神经超级采样与降噪(NSSD)将超分与降噪相结合,面向复杂光线追踪场景。
在 Arm 与 Sumo Digital 基于虚幻引擎联合打造的演示游戏《光影新生》中,NFRU 与 NSSD 方案与传统渲染相比实现了最高 4 倍的性能效率提升,外部内存流量降低多达 70%,使虚幻引擎 MegaLights 等技术得以应用于移动设备。该 GPU 面向持续高帧率体验设计,可支持最高 120 帧每秒的稳定运行。

执行引擎是 Arm Mali 过去七代产品中规模最大的指令集架构升级,支持每个线程束的寄存器数量比上一代多达 2 倍,并采用动态寄存器分配机制减少寄存器溢出。
与上一代产品相比,其基准测试性能最高提升 24%,非 AI 游戏性能提升 14%。光线追踪方面,新架构在主流光线追踪基准测试中可将 DRAM 流量最多降低 13%,并对不透明度微贴图(OMM)提供硬件级支持。

Arm 的演示数据显示,使用 OMM 可使帧率提升 30%,光线追踪工作负载最多降低 70%。作为背景,Arm Mali GPU 的累计出货量已超过 140 亿颗。
软件生态:KleidiAI 与 Arm AI Portal
软件层面,CSS for Mobile 2 依托全球超过 2200 万的 Arm 开发者社区,通过 KleidiAI 与主流 AI 框架的深度集成,为 Arm CPU 提供优化的软件执行路径,开发者无需改变现有开发流程,即可利用 SME2 等底层能力。
Arm AI Portal 则在统一平台汇聚经过优化和验证的模型、性能与准确性数据、代码示例及部署资源,Arm MCP 服务器将这些能力引入智能体 AI 开发环境,帮助开发者加快从评估到部署的开发流程。

按照 Arm 公布的信息,CSS for Mobile 2 为芯片合作伙伴提供了可灵活配置的基础平台,其后续在终端芯片和整机产品上的落地进展,大家可以进一步关注。