Qwen · @Alibaba_Qwen · X·2026-09-01 12:21·36分钟前
AI 导读

Accio 开源了面向真实商业运营的智能体基准 CommerceAgentBench,早期结果显示最佳整体完成率约 62%。在被评测的开源权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强整体表现。基准及完整结果见 https://github.com/Accio-org/CommerceAgentBench,配图显示 107 个真实工作流跨浏览器、API、CLI 和文件的通过率榜单。

Qwen@Alibaba_Qwen
38AI 编辑部评分,满分 100
2026-09-01 12:21· 36分钟前
AI 导读

Accio 开源了面向真实商业运营的智能体基准 CommerceAgentBench,早期结果显示最佳整体完成率约 62%。在被评测的开源权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强整体表现。基准及完整结果见 https://github.com/Accio-org/CommerceAgentBench,配图显示 107 个真实工作流跨浏览器、API、CLI 和文件的通过率榜单。

CommerceAgentBench starts with real commercial demand, and Qwen3.8-Max delivers the strongest overall performance among open-weight models. Let's test Qwen on your real-world workflows! 🔥

AccioMost AI benchmarks test what a model says. In commerce, the hard part was never the answer. It’s execution. We’ve open-sourced CommerceAgentBench: a benchmark f...