去年三月,我们发布了 Holo3,这是当时最先进的计算机操控模型。该模型迅速获得了采用。开发者、企业和合作伙伴开始在广泛的工作流程中部署 Holo3,涵盖从浏览器自动化、商业软件到内部工具和桌面应用程序等场景。随着采用规模的增长,我们意识到仅凭性能已不足以满足需求。用户希望能在桌面和移动环境中运行相同的计算机操控能力,并与不同的智能体框架实现无缝集成。他们需要部署的灵活性,从云端推理到终端设备上的完全本地执行。
正因如此,我们发布了 Holo3.1 系列。Holo3.1 在生产环境中最重要的三个维度上提升了鲁棒性:环境(网页、桌面、移动端)、智能体框架以及部署目标。我们首次发布了针对本地推理优化的量化检查点,包括 FP8、Q4 GGUF 和 NVFP4。
Holo3.1 是我们迈向通用计算机操控智能体愿景的重要一步:这类系统能够跨环境运行,集成到任何智能体技术栈中,并在工作流程所在之处执行。
跨 GUI 环境与智能体框架的计算机操控
基于 Qwen 系列,Holo3.1 的设计旨在提升计算机操控智能体实际部署环境中的鲁棒性,同时保持最先进的性能。
随着团队将 Holo3 从评估阶段推进到生产环境,我们反复观察到同一个挑战:在某一场景下的出色表现并不一定能迁移到其他场景。移动设备、不同的智能体框架以及各异的执行框架都会引入各自的分布偏移来源。
移动端自动化
Holo3.1 将 Holo3 的能力扩展至浏览器和桌面控制之外,在移动端环境取得了重大提升。在 AndroidWorld 上,我们的 35B-A3B 模型从 67% 提升至 79.3%,而较小的 4B 和 9B 变体则从 58% 提升至 72%。
跨框架性能
为了更好地支持团队在第三方智能体技术栈内部署 Holo,Holo3.1 在 Holo3 已有的结构化 JSON 输出基础上,新增了对函数调用协议的原生支持。
在 OSWorld 以及我们涵盖电子商务、商业软件和协作工作流的内部基准测试套件中,函数调用和原生执行现已达到近乎同等的性能。Holo3.1 在我们的 Holotab 产品框架内进行评估时,其性能也比 Holo3 提升了超过 25%。
更小尺寸,实现成本与性能的权衡
为了进一步支持本地和端侧推理,除了用于实现顶尖性能的较大型 35B-A3B 模型外,我们还发布了新的模型尺寸,包括小模型(0.8B、4B 和 9B),以实现经济高效的私有化部署。
Holo3.1 和 Qwen 3.5 系列的性能与成本对比。整体性能首先计算四个 H Corporate 基准测试的平均值(因此每个系列权重相同),然后取 OSWorld、AndroidWorld、H Corporate、ScreenSpot-Pro 和 OSWorld-G 的平均值。
快速且本地的推理
这是我们首次发布量化权重的版本。我们从 35B-A3B 检查点开始,提供 FP8、Q4 GGUF 和 NVFP4 格式。
对于 NVFP4,我们使用了 NVIDIA 的 Model Optimizer,采用 W4A16 配置。这些检查点能够为计算机使用智能体实现快速的本地推理,且模型性能几乎没有下降。FP8 和 NVFP4 在 OSWorld 上取得了相同的分数,仅比全精度 BF16 检查点低约两个百分点。
加速效果显著:在 DGX Spark 上,NVFP4 W4A16 的总 token 吞吐量是 FP8 的 1.41 倍,是 BF16 的 1.74 倍。
迈向消费级硬件上的本地智能体
我们还发布了 Q4 GGUF 检查点,旨在消费级硬件上本地部署计算机使用智能体。
智能体本身在 Windows 或 Mac 机器上本地运行,而模型可以在同一台机器上运行——我们提供了 Apple Silicon 的参考数据——也可以在同一网络的 DGX Spark 上运行。在这两种情况下,执行过程都完全保持私有和本地化,没有任何数据离开用户的网络。
在 Spark 上,我们与 NVIDIA 共同开发的智能体框架优化,结合上述 NVFP4 量化技术,相比 FP8 基线实现了约 2 倍的端到端加速,将平均步骤时间从 6.8 秒缩短至 3.3 秒。
各平台与精度下的智能体请求速率。在 DGX Spark 上,采用 NVFP4 的 vLLM 在默认模式和快速模式下均实现了最高的请求速率,其次是 Q4 GGUF 和 FP8。这些改进及其他优化将集成到即将推出的桌面智能体框架中。
可用性
Holo3.1 系列提供四种尺寸:
| 模型 | 部署目标 |
|---|---|
| Holo3.1-0.8B | 超轻量级本地智能体 |
| Holo3.1-4B | 高性价比部署 |
| Holo3.1-9B | 性能与延迟均衡 |
| Holo3.1-35B-A3B | 顶尖性能 |
我们还发布了针对本地和边缘部署优化的 FP8、NVFP4 和 Q4 GGUF 检查点。
- Holo Models API:https://hcompany.ai/holo-models-api
- Hugging Face:https://huggingface.co/collections/Hcompany/holo31
我们期待看到开发者利用 Holo3.1 构建的应用。