# 蚂蚁集团提出 ARGenSeg-8B：基于自回归图像生成模型的图像分割框架

- 来源：蚂蚁 inclusionAI：HuggingFace 新模型
- 发布时间：2026-05-15 10:33
- AIHOT 分数：56
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmp6c0i6i00nbslnzm1hefdiu
- 原文链接：https://huggingface.co/inclusionAI/ARGenSeg-8B

## 精选理由

蚂蚁提出用自回归生成做分割，把理解和像素级感知统一到一个框架里，多个数据集SOTA且速度更快，做CV的值得看看。

## AI 摘要

蚂蚁集团推出 ARGenSeg-8B，一种将多模态理解与像素级感知统一的自回归图像生成分割框架。它利用多模态大语言模型（MLLM）输出视觉 token，并通过通用 VQ-VAE 解码为分割掩码，使分割完全依赖 MLLM 的像素级理解。采用 next-scale-prediction 策略并行生成视觉 token，降低推理延迟。在多个分割数据集上超越此前最优方法，推理速度显著提升。论文已被 NeurIPS 2025 接收，模型已发布在 HuggingFace。

## 正文

ARGenSeg：基于自回归图像生成模型的图像分割

1 蚂蚁集团 · NeurIPS 2025

🏠 关于

我们提出了一种新颖的基于自回归生成范式的图像分割方法（ARGenSeg），在统一框架内实现了多模态理解与像素级感知。以往将图像分割融入多模态大语言模型（MLLM）的工作通常采用边界点表示或专用分割头。这些方法依赖于离散表示或输入到任务特定解码器的语义提示词，限制了 MLLM 捕捉细粒度视觉细节的能力。为解决这些挑战，我们引入了一种基于图像生成的 MLLM 分割框架，该框架能够自然地为目标对象生成密集掩码。我们利用 MLLM 输出视觉 token，并通过通用 VQ-VAE 将其反 token 化为图像，使分割完全依赖于 MLLM 的像素级理解能力。为降低推理延迟，我们采用了一种下一尺度预测策略，并行生成所需的视觉 token。大量实验表明，我们的方法在多个分割数据集上超越了此前最先进的方法，推理速度显著提升，同时保持了强大的理解能力。

🔗 引用

如果您觉得这项工作有用，请引用：

@article{wang2025argenseg, title={ARGenSeg: Image Segmentation with Autoregressive Image Generation Model}, author={Wang, Xiaolong and Ru, Lixiang and Huang, Ziyuan and Ji, Kaixiang and Zheng, Dandan and Chen, Jingdong and Zhou, Jun}, journal={arXiv preprint arXiv:2510.20803}, year={2025} }

👏 致谢

我们衷心感谢 InternVL、VAR 和 PSALM 的贡献者，感谢他们的基础性工作和开源精神。

8B 参数
