内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 20 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「arXiv」清除

8月20日周四

18:24IT之家(RSS)72精选阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

8月11日周二

10:58HuggingFace Daily Papers(社区热门论文)68Macaron-V1:面向开放持续学习的开源智能体模型家族

7月17日周五

15:14公众号:通义实验室(千问)76精选Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话
08:00HuggingFace Daily Papers(社区热门论文)73精选NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

7月14日周二

09:05SenseTime74精选商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

7月13日周一

19:20公众号:腾讯混元76精选腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

7月9日周四

08:00HuggingFace Daily Papers(社区热门论文)55MuScriptor:开源多乐器音乐转录模型

7月8日周三

10:18HuggingFace Daily Papers(社区热门论文)72精选Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

6月24日周三

18:12Qwen76同事件通义千问发布Qwen-AgentWorld原生语言世界模型同一事件,精选展示《Qwen-AgentWorld 开源:让 Agent 学会“先预测,再行动”》
11:54Qwen:Blog Retrieval(API)81精选Qwen-AgentWorld:面向通用智能体的语言世界模型

6月18日周四

11:43HuggingFace Daily Papers(社区热门论文)74精选Sumi:从头训练的7B开源均匀扩散语言模型

6月15日周一

23:49IT之家(RSS)69MiniMax M3 模型正式开源:原生多模态、百万上下文

6月13日周六

22:07Rohan Paul68Nvidia 推出 Cosmos 3:全模态世界模型,让物理AI实现理解、模拟与行动

6月9日周二

01:01Hacker News 热门(buzzing.cc 中文翻译)74精选小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

5月25日周一

18:48蚂蚁 inclusionAI:HuggingFace 新模型69精选inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b
15:25蚂蚁 inclusionAI:GitHub 新仓库63精选蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族

5月12日周二

12:44HuggingFace Daily Papers(社区热门论文)76精选Qwen-Image-2.0技术报告

5月7日周四

18:16IT之家(RSS)69小米开源 OmniVoice 多语言语音克隆 TTS,号称一个模型搞定 600 余种语言

4月29日周三

17:33IT之家(RSS)65腾讯混元开源手机端离线翻译模型 Hy-MT1.5-1.8B-1.25bit,仅 440MB

4月17日周五

08:00HuggingFace Daily Papers(社区热门论文)81精选Qwen3.5-Omni技术报告
共 20 条,没有更多了
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「arXiv」 · 20 条清除

8月20日

星期四 · 1 条
18:24
IT之家(RSS)精选
AI 评分 72/100
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

智能体arXivGitHub多模态

推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。

8月11日

星期二 · 1 条
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 68/100
Macaron-V1:面向开放持续学习的开源智能体模型家族

Macaron-V1 是一个开源智能体模型家族,通过 Mixture-of-LoRA(MoL)架构冻结基座模型、组合专家 LoRA 适配器,并在每次用户交互时选择其中一个 LoRA,以支持部署后的持续学习。

智能体arXiv多模态模型发布

7月17日

星期五 · 2 条
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

arXiv多模态模型发布视频

推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

arXiv多模态开源生态模型发布

推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

7月14日

星期二 · 1 条
09:05
SenseTime@SenseTime_AI精选
AI 评分 74/100
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

arXivGitHub多模态开源生态
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

7月13日

星期一 · 1 条
19:20
公众号:腾讯混元精选
AI 评分 76/100
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

arXivGitHub多模态开源生态

推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月9日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
MuScriptor:开源多乐器音乐转录模型

MuScriptor 是一款开源权重多乐器音乐转录模型,通过合成数据预训练、真实音频微调及强化学习后训练,能处理真实世界多种音乐流派的复杂混音。模型支持按乐器存在条件定制转录输出,解决了现有方法在真实多乐器场景下泛化差、输出不可用的问题。

arXiv开源/仓库模型发布语音

7月8日

星期三 · 1 条
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。

arXiv多模态推理模型发布

推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。

6月24日

星期三 · 2 条
18:12
Qwen@Alibaba_Qwen同事件
AI 评分 76/100
通义千问发布Qwen-AgentWorld原生语言世界模型

通义千问发布Qwen-AgentWorld,一款原生语言世界模型,可在单一模型中模拟MCP、搜索、终端、SWE、Web、OS、Android共7种智能体环境。环境建模即训练目标,非事后适配。该模型在AgentWorldBench上性能超越Claude Opus 4.8和GPT-5.4。研究分两条路径:一是构建环境模拟基础模型;二是探索世界模型增强智能体训练——可控Sim RL(以LWM为环境的智能体强化学习)优于真实环境训练,而LWM预热(预测环境的学习)即使不经任何智能体特定微调,也能将预测知识迁移至智能体任务。

智能体arXivMCP/工具模型发布
同一事件,精选展示《Qwen-AgentWorld 开源:让 Agent 学会"先预测,再行动"》
11:54
Qwen:Blog Retrieval(API)精选
AI 评分 81/100
Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

智能体arXivHugging FaceMCP/工具
另有 3 家信源报道Hacker News 热门(buzzing.cc 中文翻译)HuggingFace Daily Papers(社区热门论文)公众号:通义实验室(千问)
推荐理由:Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。

6月18日

星期四 · 1 条
11:43
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Sumi:从头训练的7B开源均匀扩散语言模型

Sumi(日语“墨”)是一个完全开源的7B参数均匀扩散语言模型,从零开始在1.5T模型token上预训练。它在知识、推理和编程评测中与同等token预算的自回归模型表现相当,但在常识推理benchmark上略逊,教育密集型数据混合可能是原因之一。Sumi开放模型权重、检查点及完整训练配方(含公开语料数据混合说明),为社区提供首个大规模均匀扩散模型的基准参考。

arXivHugging Face开源生态数据/训练

推荐理由:Sumi 是第一个完全从零预训练的大规模均匀扩散语言模型,填补了社区在这方向的研究空白,做扩散语言模型的人终于有个可以摸的起点。

6月15日

星期一 · 1 条
23:49
IT之家(RSS)
AI 评分 69/100
MiniMax M3 模型正式开源:原生多模态、百万上下文

MiniMax 于 6 月 12 日开源 MiniMax M3 模型权重并发布 MSA 技术论文。M3 是原生多模态旗舰模型,总参数 428B,激活参数 23B,为首个从 Step 0 开始多模态混合训练的开源模型。在 Artificial Analysis 综合智能指数上获全球开源最高排名。输出速度从约 30 TPS 提升至约 80 TPS,后续还将提速 30-40%。M3 在编码与智能体评测中达行业顶尖水平,具备自主任务拆解、工具调用与多步推理能力,上下文支持百万级别。

arXivHugging Face多模态开源生态

6月13日

星期六 · 1 条
22:07
Rohan Paul@rohanpaul_ai
AI 评分 68/100
Nvidia 推出 Cosmos 3:全模态世界模型,让物理AI实现理解、模拟与行动

Nvidia发布Cosmos 3——一种全模态世界模型,将语言、图像、视频、音频和动作整合到同一系统,使物理AI能跨越“理解、模拟、行动”三大任务。它把动作视为世界的第一类语言,通过动作token设计,让模型可基于视频推断动作,或同时生成未来场景及对应运动。这使机器人从“识别物体”升级为预测“移动、抓取、滑动”等交互后果。相关论文《Cosmos 3: Omnimodal World Models for Physical AI》已发布于arXiv。

arXiv具身智能多模态模型发布

6月9日

星期二 · 1 条
01:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。

arXiv开源生态推理模型发布

推荐理由:小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。

5月25日

星期一 · 2 条
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 69/100
inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b

inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。

arXiv多模态安全/对齐模型发布
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型
推荐理由:把安全策略写成自然语言就能即插即用,不用重新微调,这个思路对需要频繁调整合规规则的产品团队很实用。虽然只是个2B的小模型,但开箱即用的动态适配能力值得关注。
15:25
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 63/100
蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族

蚂蚁集团 inclusionAI 开源了 SingGuard 多模态安全护栏模型族,包含 2B、4B 和 8B 三个版本。SingGuard 将安全策略作为运行时输入而非训练时固定分类,部署团队无需重新训练即可按默认分类或自定义自然语言规则评估内容。模型支持文本、图像、图文、多语言、查询侧和回复侧的安全审核,采用“快-慢”动态推理机制。SingGuard 在多模态安全、图像安全、文本查询安全、文本回复安全、多语言查询安全及多语言回复安全基准上达到平均 SOTA 性能。模型基于 Qwen3-VL 架构,支持通过 Transformers 和 vLLM 部署。

arXivHugging Face安全/对齐推理
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型
推荐理由:安全护栏模型大多是死规则,SingGuard 允许运行时动态注入策略,这对需要频繁调整审核规则的内容团队是个实用突破。蚂蚁开源了全系列模型与基准,部署门槛低,可以直接上手。

5月12日

星期二 · 1 条
12:44
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 76/100
Qwen-Image-2.0技术报告

Qwen-Image-2.0是一个统一高保真生成与精确编辑的全能图像生成基础模型。它采用Qwen3-VL作为条件编码器,结合多模态扩散变换器进行联合建模,并通过大规模数据整理与多阶段训练实现强化。该模型支持长达1K令牌的指令输入,能生成幻灯片、海报等富文本内容,显著提升多语言文本渲染与排版质量。在生成方面,它增强了细节、纹理真实感与光照一致性,并更可靠遵循复杂指令。人工评估表明,其在生成和编辑任务上均大幅超越前代模型。

arXiv图像生成多模态模型发布

推荐理由:这是 Qwen-Image 系列第一次把多模态理解和生成真正拧到同一框架里,长文本渲染和多语言排版提升肉眼可见,做海报和幻灯片的可以重点关注。

5月7日

星期四 · 1 条
18:16
IT之家(RSS)
AI 评分 69/100
小米开源 OmniVoice 多语言语音克隆 TTS,号称一个模型搞定 600 余种语言

小米AI实验室开源多语言语音克隆TTS模型OmniVoice,覆盖600余种语言。该模型采用极简双向Transformer架构,无需复杂结构即可实现文本到语音的直接转换。其语音合成质量超越同类主流模型,训练速度可达一天10万小时。关键设计包括全码本随机掩蔽策略和引入大语言模型预训练参数,显著提升训练效率与语音可懂度。测试显示,在多种语言中其相似度与可懂度超越多款商用系统,并对低资源小语种也能实现高质量合成。模型还支持自定义音色、带噪音频适配等实用功能。

arXivGitHub多模态开源生态

4月29日

星期三 · 1 条
17:33
IT之家(RSS)
AI 评分 65/100
腾讯混元开源手机端离线翻译模型 Hy-MT1.5-1.8B-1.25bit,仅 440MB

腾讯混元开源了手机端离线翻译模型Hy-MT1.5-1.8B-1.25bit,其体积仅440MB,可在手机本地离线运行。该模型支持33种语言及1056个翻译方向,基于1.8B参数原型通过极致量化压缩实现。其1.25-bit版本采用稀疏高效三值量化技术,将原始3.3GB模型大幅缩减。官方称其翻译质量优于谷歌翻译等主流系统,并提供了2-bit和1.25-bit两种量化方案以适配不同机型。模型完全离线工作,不收集用户数据,相关资源已全面开源。

arXivHugging Face模型发布端侧

4月17日

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 81/100
Qwen3.5-Omni技术报告

阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。

arXiv多模态模型发布语音

推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。
共 20 条,没有更多了