# Weblica：面向视觉网页智能体的可扩展可复现训练环境

- 来源：Apple Machine Learning Research（RSS）
- 发布时间：2026-07-07 08:00
- AIHOT 分数：56
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrasd6r300i0ihog8xxwezye
- 原文链接：https://machinelearning.apple.com/research/weblica-visual-web-agents

## 精选理由

Apple 的研究把 web agent 训练从零散数据中解放出来，可复现环境是规模化 RL 的关键一步，做 web 自动化的值得关注。

## AI 摘要

苹果研究团队提出Weblica框架，通过HTTP级缓存保存网页稳定视觉状态并保留交互行为，结合大语言模型基于真实网站与核心导航技能合成环境，构建可复现、可扩展的训练环境。该框架将强化学习训练扩展到数千个多样化的环境和任务。最佳模型Weblica-8B在多个网页导航基准上超越同等规模的开源模型，推理步骤更少，测试时计算扩展性良好，性能与API模型相当。

## 正文

网络是复杂、开放且不断变化的，这使得为视觉网络智能体扩展训练数据变得极具挑战性。现有的数据收集尝试仍局限于用于监督微调的离线轨迹，或用于强化学习训练的少量模拟环境，因此未能捕捉到网络的多样性。我们提出了 Weblica（Web Replica），一个用于构建可复现且可扩展网络环境的框架。我们的框架利用 1) HTTP 级别的缓存来捕获和重放稳定的视觉状态，同时保留交互行为；2) 基于大语言模型的环境合成，该合成以真实世界网站和核心网络导航技能为基础。利用此框架，我们将强化学习训练扩展到数千个多样化的环境和任务。我们最好的模型 Weblica-8B 在多个网络导航基准测试中，以更少的推理步骤超越了相似规模的开源权重基线模型，在测试时计算量增加时表现出良好的扩展性，并且与 API 模型具有竞争力。

相关阅读与更新。

重述网络：一种实现计算与数据高效语言建模的方法

大语言模型是在大规模网络抓取数据上训练的，这些数据通常是非结构化、嘈杂且措辞不佳的。当前的缩放定律表明，从这类数据中学习需要大量的计算资源和数据，且需求会随着所训练模型的规模增长而增加。这之所以不可行，既是因为预训练带来的巨大计算成本和时长，也是因为网络上高质量数据即将面临稀缺。在这项研究中……

重述网络：一种实现计算与数据高效语言建模的方法

本文已被 ICLR 2024 的基础模型数据问题研讨会（Data Problems for Foundation Models workshop）接收。

大语言模型是在大规模网络抓取数据上训练的，这些数据通常是非结构化、嘈杂且措辞不佳的。当前的缩放定律表明，从这类数据中学习需要大量的计算资源和数据，且需求会随着所训练模型的规模增长而增加。这之所以不可行，既是因为巨大的计算成本和时长……
