用户可在移动应用中享受实时视频特效、自动语音识别(ASR)和动作捕捉等即时 AI 功能。然而对开发者而言,在设备端运行复杂模型往往需要应对独特的平衡挑战,涉及设备散热管理、电池续航保持以及防止帧率下降。为了在不牺牲性能的前提下提供快速响应的 AI 体验,LiteRT 解锁了专为这类工作负载打造的硬件——神经网络处理器(NPU)。
LiteRT 是一个跨平台、可用于生产环境的设备端 AI 框架,在移动端、桌面端和物联网平台上提供 CPU、GPU 和 NPU 加速。LiteRT 专为高性能和可扩展性而设计,通过统一的 API 简化了高速 AI 功能的部署。该 API 抽象了与多个 NPU SDK 集成的复杂性,使开发者无需编写特定于厂商的代码即可适配不同的芯片平台。
将 NPU 性能转化为有意义的用户体验
LiteRT 已在 Google 产品、热门应用乃至 SDK 中得到充分验证。包括 Google Meet、Epic Games 和 Argmax Inc. 在内的行业领导者已在使用,以下是 NPU 加速在实际生产应用中的表现。
Google Meet:通过利用移动端 NPU,Google Meet 成功部署了一个比此前版本大 25 倍的超高清分割模型,且推理速度未受影响。关键在于,该模型保持了稳定的功耗,为在典型的 20-30 分钟会议中实现更高质量的背景替换创造了必要的散热余量。
Epic Games, Inc.:高保真、实时的动画体验对效率要求极高。Epic 面向 Android 的 Live Link Face(Beta)应用让创作者能够通过单摄像头捕捉表演,然后直接在设备上生成并流式传输实时 MetaHuman 面部动画至 Unreal Engine。
实时面部解算计算强度大,且需要持续的低延迟。通过在 NPU 上使用 LiteRT,Epic 在支持的 Android 设备上实现了专用设备端加速,使实时 MetaHuman 动画达到高达 30 FPS 的性能表现。
在虚幻引擎中利用 NPU 实现实时 MetaHuman 面部动画
Argmax Inc 近日发布了面向 Android 的 Argmax Pro SDK,该 SDK 与 LiteRT 合作,可实现设备端语音识别。通过利用 LiteRT 以及通过 Google Play 提供的 AI Pack 功能交付,Argmax 能够在遵守 Android 应用大小限制的同时,带来其顶级的准确率和实时速度。关键在于,他们利用了 LiteRT 的提前(AOT)编译技术,省去了成本高昂的设备端编译步骤,使得 NVIDIA Parakeet TDT 0.6B v2 等前沿语音模型能够以行业领先的延迟运行。
在 Google Tensor、联发科和高通技术的 SoC 上进行的性能测试表明,Argmax Pro SDK 从 GPU 升级到 NPU 可实现超过 2 倍的速度提升。除了速度提升,NPU 的能效优势还使得 Argmax SDK 的企业客户(如 Heidi Health)能够在长时间会话中进行可靠的设备端实时转录,同时减轻对电池续航的影响。最后,通过将运行时库和模型卸载到通过 Play 的 AI Packs 进行的按需下载,设备可以动态获取针对特定 NPU 优化的模型。
Argmax 的 Kotlin 优先 SDK 为 Android 带来了顶级的准确率和实时速度,并通过 Google LiteRT 实现了无缝的 NPU 和 GPU 加速。
Google AI Edge Gallery 应用:为了帮助开发者测试和验证 NPU 加速的性能,我们很高兴地宣布,Google AI Edge Gallery 应用现在支持针对特定 Gemma 模型的 NPU 加速,并内置了基准测试工具。AI Edge Gallery 可在 Android 上使用,让您快速了解移动硬件上 AI 性能的真正潜力。开发者还可以访问 GitHub 上的 Google AI Edge Gallery 来构建自己的体验。
使用 Google AI Edge Gallery 探索各种设备端大语言模型用例
跨硬件平台扩展性能
尽管在语音、动画和视频方面的性能提升显而易见,但由于各家厂商特定的 SDK 和复杂性,开发者过去一直难以打通通往 NPU 的道路。通过提供精简的工作流程和跨平台支持,LiteRT 使开发者能够部署从手机到工业物联网和 AI PC 的先进模型,同时不牺牲性能或可移植性。
跨平台 NPU 支持
正如近期 Google AI Edge Gemma 4 博客文章所强调的,LiteRT 将 NPU 加速扩展到了移动端之外,允许你使用单一框架在多种硬件上部署模型。在工业边缘侧,LiteRT 支持 Qualcomm Dragonwing™ IQ8 系列等平台,该系列也为 Arduino VENTUNO Q 提供支持,从而能够利用 Gemma 4 等模型实现机器人和智能制造等高可靠性应用场景。在桌面端,LiteRT 正通过与 Intel® Core™ Ultra 系列 2 和 3 处理器的 OpenVINO™ 集成,为 AI PC 做准备,为本地生成式 AI 工作负载带来显著的功耗节省和响应速度提升。
规模化性能验证
Google AI Edge Portal 提供了一项基准测试服务,覆盖超过 100 款最流行的手机,并提供跨设备、加速器和配置的机器学习工作负载洞察。开发者现在可以做出数据驱动的部署决策,例如是使用 AOT 还是 JIT,以最适合其应用场景和目标设备。要使用最新的 Portal NPU 功能,请在此处注册我们的私有预览版。
Google AI Edge Portal 基准测试结果
开启你的 NPU 之旅
凭借我们生产就绪的 NPU 集成,LiteRT 提供了一个统一的工作流程,抽象化了即时编译(JIT)和预编译(AOT)两种部署方式中的底层复杂性。
立即深入阅读我们的文档,开启你的 NPU 加速之旅。
- 文档:探索 LiteRT 和 LiteRT-LM 文档,获取全面的开发指南。
- GitHub 仓库:访问 LiteRT 和 LiteRT-LM GitHub 仓库,获取最新更新和实现细节。
- 示例:查看 LiteRT-Samples GitHub 仓库中的参考代码。使用 AI Edge Gallery 应用作为起点,构建你自己的应用。
- 模型:欢迎访问 LiteRT Hugging Face 社区,获取 Gemma 4 等即用型开放模型。我们持续积极优化开放权重模型系列,确保其架构改进直接映射到高速 NPU 内核。您可以通过 LiteRT-LM CLI 访问这些模型。更多详情请参阅《借助 Gemma 4 将最先进的智能体技能引入边缘设备》。
- Google Tensor - 注册获取 Google Tensor ML SDK 的实验性访问权限
欢迎通过在我们的 GitHub 频道上提交 issue 来告知我们您的反馈和功能请求。我们迫不及待地想看到您的创作!
致谢
Google:Akshat Sharma、Alice Zheng、Andrew Zhang、Ashley Lin、Byungchul Kim、Changming Sun、Charlie Xu、Chenchen Tang、Chunlei Niu、Cormac Brick、Derek Bekebrede、Fabian Bergmark、Fengwu Yao、Gerardo Carranza、Gregory Karpiak、Jae Yoo、Jing Jin、Jingjiang Li、Julius Kammerl、Jun Jiang、Lu Wang、Maria Lyubimtseva、Mariana Quesada、Marissa Ikonomidis、Matt Kreileder、Matthias Grundmann、Meghna Johar、Na Li、Ping Yu、Renjie Wu、Rishika Sinha、Sachin Kotwani、Salil Tambe、Siargey Pisarchyk、Siargey Pisarchyk、Somdatta Banerjee、Steven Toribio、Suleman Shahid、Terry Heo、Wai Hon Law、Weiyi Wang、Xiaoming Hu
合作伙伴:Alen Huang、Ankit Kapoor、Arda Atahan Ibis、Atila Orhon、Brian Keene、Chen Cen、Cheng-Dao Lee、Cheng-Yen Lin、Chun-Hsueh Lee (Jack)、Chun-Ting Lin (Graham)、Code Lin、Deep Yap、Dylan Angus、Felix Baum、HungChun Liu、Jhih-Kuan Lin、Jiun-Kai Yang (Kelvin)、Kedar Gharat、Ken Sieger、Laxmi Rayapudi、Lei Chen、Mike Tremaine、Ming-Che Lin (Vincent)、Poyuan Jeng、MetaHuman 团队、Vinesh Sukumar、Waimun Wong、Yi-Ru Chen、Yu-Ting Wan、Zach Nagengast
- 移动端
- 人工智能
- 案例研究
- 公告
- 学习
- 探索
- 影响力