阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
微软发布升级版编程模型 MAI-Code-1.1-Flash,在 Terminal-Bench 2.1 测试中表现提升 22%,.NET 相关任务提升 15%,Token 生成速度提升 25%,完成相同任务所需 Token 减少 25%。
另有 1 家信源报道The Decoder:AI News(RSS)小米技术宣布具身基座模型 Xiaomi-Robotics-1 正式开源。该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练。本次开源覆盖从真机后训练到模型部署的完整流程,并提供相关 Benchmark 的评测代码。
商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步构建图文内容,如生成六步画龙教程。模型已上线 SenseNova Studio 与 HuggingFace。
同一事件,精选展示《商汤 SenseNova U1 开源:统一推理与图像生成》📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qw...
同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)Moonshot AI 发布了 Kimi K3 的模型权重与技术报告,并在 Hugging Face 上开源了高性能注意力内核、MoE 通信库等基础设施组件。新架构声称每单位算力的智能度提升 2.5 倍。该模型在基准测试中接近 Fable 5 和 GPT-5.6 Sol 等西方前沿模型,但英国网络研究所的独立测试显示其网络能力和数学技能仍落后于前沿模型。
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)月之暗面开源Kimi K3,一个2.8T总参数、104B激活参数的MoE模型,原生支持100万token上下文窗口。新架构KDA和AttnRes使单位算力智能密度提升2.5倍,长上下文解码速度提升6倍。除模型权重外,还开源了高性能推理内核FlashKDA、MoE通信库及Agent训练环境AgentENV,将开源模型能力门槛抬至闭源旗舰水平。
Releasing the model weights and technical report of Kimi K3. Kimi K3 is our most capable model: a 2.8T MoE model with na...
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
蚂蚁集团旗下具身AI公司Robbyant开源LingBot-World 2.0,这是一个因果世界模型,支持720p/60fps实时探索。关键突破在于长时间一致性:在20个场景中连续运行60分钟无可见退化。模型采用智能体循环架构,由VLM提议事件、导演智能体持续生成新任务,支持移动、战斗、按需天气及多人共享世界。已发布14B模型权重与代码,论文还描述了可在单消费级GPU部署的1.3B版本。
蚂蚁集团具身智能团队 Robbyant 发布 LingBot-World-Infinity(LingBot-World 2.0),一个因果视频生成模型,可作为交互式世界模拟器运行。该模型通过 MoBA 注意力机制和 DMD 自 rollout 训练,解决长程漂移和交互延迟问题。模型采用因果分解架构,每帧仅依赖过去帧和当前动作输入。团队同时发布 14B 参数开源 checkpoint,采用 CC BY-NC-SA 4.0 许可。公开推理脚本在 8 张 GPU 上运行 480×832 分辨率;部署版流式输出可达 60 fps,经 TensorRT 引擎编译。
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。
腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。
另有 1 家信源报道X:腾讯混元 (@TencentHunyuan)商汤推出 SenseNova-U1-8B-MoT-Infographic 模型,能够生成工作室级别的高密度信息图,此前这类工作流程缓慢且昂贵。YouTuber CAPITAL R 制作了演示视频,模型已在 HuggingFace 上线,GitHub 页面展示示例图片,并开放 Discord 社区。
Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。
网易有道推出“子曰 4.0”TTS 引擎 Confucius4-TTS,声称是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可完成语音克隆的开源模型。用户仅需 3 秒音频即可实现零样本音色克隆,克隆音色与原声相似度超 85%,任务准确度达 97%。模型支持中文、英语等 14 种语言,首创音频 Prompt 情感克隆迁移。底层采用 GPT 式语义大模型、SSL 预训练特征与 ECAPA-TDNN 说话人编码器、Flow Matching 框架。已全量开源(Apache 协议),提供 54GB 资源包供本地部署。
UniverSat是一种基于Vision Transformer的骨干网络,采用通用补丁编码器(Universal Patch Encoder),将来自任意空间、光谱和时间分辨率以及光学和非光学传感器的补丁映射到共享嵌入空间,使用共享权重。这使得单个模型能够在异构多模态数据集上通过自监督训练,生成鲁棒的传感器无关空间特征。在GeoBench、PANGEABench和SpectralEarth等标准地球观测基准的分类和分割任务中,取得了强劲结果。代码和模型已开源。
6月3日,京东开源JoyAI-Echo框架,解决长视频生成中角色身份崩坏、音色突变和生成缓慢三大难题。该框架通过跨模态音视频记忆库保持5分钟内角色外观与音色一致,记忆驱动后训练结合DMD技术带来约7.5倍推理加速。新增Director Agent支持自然语言对话式局部修订,无需重跑整条视频。配套轻量化实时超分模块,支持736×1280→1152×1920及1472×2560两档分辨率。评测集显示,语音内容准确率0.8646,用户偏好多项领先。代码与权重已开源至GitHub。
商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)大多数AI模型在生成图表时存在数值错误(如负值显示为正)、柱状图位置偏移、元素关系混乱等问题。SenseNova-U1-8B-MoT-Infographic(SenseNova-U1)专为解决此类图表生成问题而设计,能够生成准确的图表,并支持实时调整设计和布局。项目在Hugging Face提供了模型,并在GitHub展示了效果案例。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)SenseNova U1图像生成模型现已在ComfyUI上可运行,并获得包括REBEL AI在内的评测者高度认可。REBEL AI发布的实践教程展示了该模型的部署工作流,并对其图像生成能力进行了真实场景测试。模型支持8步快速推理,生成速度极快,应用场景涵盖人像、超现实艺术、文字标志和生物设计等。相关资源已在Hugging Face、GitHub和Discord平台开放。
小米AI实验室开源多语言语音克隆TTS模型OmniVoice,覆盖600余种语言。该模型采用极简双向Transformer架构,无需复杂结构即可实现文本到语音的直接转换。其语音合成质量超越同类主流模型,训练速度可达一天10万小时。关键设计包括全码本随机掩蔽策略和引入大语言模型预训练参数,显著提升训练效率与语音可懂度。测试显示,在多种语言中其相似度与可懂度超越多款商用系统,并对低资源小语种也能实现高质量合成。模型还支持自定义音色、带噪音频适配等实用功能。
小红书基础模型 FireRed-Image-Edit 在 GitHub 上正式亮相,该模型专注于图像编辑任务,并达到新的最佳性能(新 SOTA)。