内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「开源生态」清除

7月19日周日

21:00公众号:昆仑万维(天工)72昆仑万维宣布2026为"世界模型元年",发布Matrix-Game 3.5等模型昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。
16:29Qwen75Qwen3.8 开源发布,2.4T 参数模型上线Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月17日周五

13:48AYi76Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。推荐理由:K3登顶前端榜只是表象,更值得关注的是Moonshot将价格拉至前沿区间,这是中国模型首次不以低价取胜,而是在长上下文编码赛道与闭源巨头正面叫板,定价逻辑的转变可能重塑竞争格局。
08:00HuggingFace Daily Papers(社区热门论文)73NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

7月14日周二

17:00公众号:腾讯混元73腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。推荐理由:295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。
09:05SenseTime74商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

7月13日周一

19:20公众号:腾讯混元76腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月11日周六

08:00HuggingFace Daily Papers(社区热门论文)70GigaChat Audio:支持120分钟输入的时间感知音频大语言模型GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

7月10日周五

12:01公众号:龙猫LongCat(美团)74美团 LongCat-2.0 正式开源,同步开放国产卡推理代码美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

7月9日周四

15:16IT之家(RSS)73蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
08:57MarkTechPost(RSS)70Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。

7月8日周三

09:43Hacker News 热门(buzzing.cc 中文翻译)75Pulpie:用于清理网络的Pareto最优模型Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。

7月6日周一

15:20公众号:腾讯混元70腾讯混元 Hy3 正式发布:智能体与产品体验显著提升腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。

7月5日周日

22:21Meituan LongCat81美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B–56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月1日周三

16:32MarkTechPost(RSS)73NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。

6月30日周二

13:53公众号:龙猫LongCat(美团)82美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。
05:26Emad79美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
00:00Google Research:Blog(网页)76Google Research 推出 TabFM:用于表格数据的零样本基础模型Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。

6月28日周日

16:10The Decoder:AI News(RSS)70新浪开源VibeThinker-3B:推理可压缩,事实知识不能新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200–333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型已开源。推荐理由:VibeThinker-3B 用 3B 参数在数学编程上匹敌百倍大模型,推理可压缩而知识不能的假设值得深思。对做推理应用的人来说是个信号。

6月26日周五

20:05Chubby♨️77Ornith-1.0 开源智能体编程模型发布Ornith-1.0 是专为智能体编程设计的开源大语言模型家族,提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种尺寸。基于 gemma4 和 qwen3.5 后训练,采用强化学习联合优化任务脚手架与解决方案的自我改进策略。在多个编码基准上取得开源模型最优:Terminal-Bench 2.1(77.5)、SWE-Bench Verified(82.4)/ Pro(62.2)/ Multilingual(78.9)、NL2Repo(48.2)、SWE Atlas(QnA 41.2 / RF 42.6 / TW 39.1)、ClawEval(77.1)。所有模型以 MIT 许可证开源,支持商业与研究使用。主推文称其 397B 版本性能媲美甚至超越 Claude Opus 4.8。推荐理由:宣称在 agentic coding 上超越 Claude Opus 4.8 的开源 397B 模型,MIT 协议,benchmark 数字漂亮,但如果属实将彻底改变 agent 开发格局,目前最需要独立验证,谨慎对待「好得不像真的」时刻。

6月25日周四

14:04MarkTechPost(RSS)73百度发布Unlimited OCR:3B参数MoE模型,KV缓存恒定实现长文档高效解析百度推出Unlimited OCR,一个3B参数的MoE模型,推理时仅激活500M参数。其核心创新Reference Sliding Window Attention(R-SWA)将KV缓存大小固定为Lm + n(n默认128),内存和延迟不随输出长度增长。模型基于DeepSeek OCR继续训练4000步,支持32K最大长度,通过DeepEncoder实现16倍token压缩。在OmniDocBench v1.5上整体得分93.23,超出DeepSeek OCR基线6.22分;v1.6得分93.92为最高。Base模式下吞吐达5580 TPS,比DeepSeek OCR提升12.7%,6000 token输出时延迟低35%。适用于整本书转录等场景,代码与权重已在HuggingFace开源。推荐理由:Baidu这个OCR模型用R-SWA把KV缓存压成常量,长文档解析终于不用越跑越慢了。MIT开源,3B总参但推理只消500M,做文档管线的可以直接接。

6月24日周三

01:37Krea71Krea 2 技术报告正式发布我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report推荐理由:Krea 2 开源了两个图像模型权重,一个未蒸馏适合微调,一个快速蒸馏版覆盖多样审美。对于做图像生成应用和模型融合的团队,这次开放权重比很多大厂都实在。

6月23日周二

14:10公众号:京东JoyAI73京东全栈开源JoyAI-VL-Interaction,从"一问一答"走向"边看边说"京东近日开源全球首个全栈交互模型JoyAI-VL-Interaction,获vLLM-Omni原生支持。该模型能持续观察视频流、主动判断关键事件并实时响应,支持将复杂任务委托后台Agent处理。在58个真人盲评中,对比豆包视频通话助手胜率77.6%,对比Gemini视频通话助手胜率87.9%,监控预警场景达100%胜率。开源内容包括模型权重、交互数据集、训练方案及完整可部署系统,支持摄像头、直播流等视频输入及语音交互、长期记忆、vLLM部署,适用于安防监控、老人看护、直播讲解等实时场景。推荐理由:京东这个实时交互模型不是又一个刷榜模型,它把「什么时候该说话」变成了模型自己的判断。全栈开源且对比豆包、Gemini 胜率惊人,做安防、看护、直播的开发者可以直接试了。

6月18日周四

11:43HuggingFace Daily Papers(社区热门论文)74Sumi:从头训练的7B开源均匀扩散语言模型Sumi(日语“墨”)是一个完全开源的7B参数均匀扩散语言模型,从零开始在1.5T模型token上预训练。它在知识、推理和编程评测中与同等token预算的自回归模型表现相当,但在常识推理benchmark上略逊,教育密集型数据混合可能是原因之一。Sumi开放模型权重、检查点及完整训练配方(含公开语料数据混合说明),为社区提供首个大规模均匀扩散模型的基准参考。推荐理由:Sumi 是第一个完全从零预训练的大规模均匀扩散语言模型,填补了社区在这方向的研究空白,做扩散语言模型的人终于有个可以摸的起点。
10:40公众号:通义实验室(千问)75首个统一科学大模型 LOGOS 正式开源LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域专用方法:口袋条件配体生成纯序列范式首次超越3D扩散模型,超越NatureLM(8×7B);逆合成预测Top-1准确率74.8%;口袋位点识别仅靠序列达58.5% Top-n准确率;MOF材料生成NBB提升至17.78%。模型采用统一词汇表将蛋白质、小分子等编码为离散Token,通过空间交互离散化实现无需3D坐标的序列预测。预训练与下游任务形式与目标一致,跨领域知识迁移经实验验证有效。已完整开源模型权重、推理代码与技术报告。推荐理由:LOGOS用一套统一科学语法把蛋白质、小分子、材料等塞进同一个LLM框架,纯序列建模就干过了专用扩散模型,参数量却只有NatureLM的1/56,做AI4S的得认真看一眼。

6月17日周三

17:38Hugging Face:Blog(RSS)83GLM-5.2:为长周期任务而生GLM-5.2 发布,支持 1M token 上下文,采用 IndexShare 架构——每 4 个稀疏注意力层共用一个轻量索引器,将 1M 上下文下每 token FLOPs 降低 2.9 倍;MTP 层改进使推测解码接受长度提升 20%。长周期编码基准上,FrontierSWE 落后 Opus 4.8 仅 1%、领先 GPT-5.5 1%;PostTrainBench 仅次于 Opus 4.8;SWE-Marathon 落后 Opus 4.8 13% 但排名第二。标准编码测试 Terminal-Bench 2.1 获 81.0 分(GLM-5.1 为 63.5),接近 Opus 4.8 的 85.0。模型引入努力级别控制以平衡性能与延迟。MIT 开源许可,无地域限制。推荐理由:GLM-5.2 是第一个在长程编码基准上直逼 Opus 4.8 的开源模型,MIT 许可无地域限制,开源生态终于有了能打硬仗的长上下文工具。
16:05MarkTechPost(RSS)70MiniMax 发布 MSA 稀疏注意力方法,开源推理内核并推出 MiniMax-M3 模型MiniMax 发布 MSA(MiniMax Sparse Attention),一种构建在 Grouped Query Attention 上的稀疏注意力方法。它将注意力分解为索引分支与主分支:索引分支以块粒度(默认 128 token)为每个 GQA 组选择 16 个 token 块(固定预算 2048 个键值 token),主分支仅在这些块上执行精确 softmax 注意力。MSA 在 109B 参数 MoE 模型上训练,开源了面向 NVIDIA SM100 GPU 的推理内核 `fmha_sm100`(MIT 许可,支持 BF16/FP8/NVFP4/FP4),并发布生产模型 MiniMax-M3。MSA-PT 在 MMLU、GSM8K、HumanEval、RULER-8K、RULER-32K 上分别达 67.2、77.7、64.0、84.2、77.5,与全注意力基线持平。128K 上下文下,其 exp-free Top-k 选择比 `torch.topk` 快 5.1 倍。推荐理由:MiniMax 把长上下文注意力从 O(N) 压到固定每查询 2048 token,还同时开源高效内核与生产模型,对做长上下文 agent 的团队是即时可用的方法,遗憾是只限 SM100 GPU。
15:36jietang72GLM-5.2 开源登顶全球评测,与 Opus 4.8 持平智谱今日开源 GLM-5.2,在 Artificial Analysis 综合评测中以 51 分排名全球前三、开源模型第一,与 Claude Opus 4.8 持平。该模型在 Code Arena 前端代码生成中获 1,595 分排名第二,在 DesignArena 设计编码场景中以 1,360 分夺冠,并在软件工程基准 FrontierSWE 中位列第三。推荐理由:智谱GLM-5.2在多个硬核基准上压过所有开源模型,直接跟Claude Opus对标,做模型选型的得重新看看国产开源了。

6月16日周二

12:39Qwen:Blog Retrieval(API)72Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。推荐理由:Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。

6月14日周日

07:48🚨 AI News | TestingCatalog78智谱GLM-5.2开源发布,支持1M上下文智谱发布最强开源模型GLM-5.2,面向所有GLM Coding Plan用户(Lite/Pro/Max)开放。该模型支持真正可用的100万上下文窗口,在长程任务独立完成方面保持领先,适合构建复杂AI智能体应用,也是国产最强编码模型的核心引擎。面对外部封锁限制,智谱强调科学全球性、AGI不应被高墙垄断,采取激进开源态度。GLM-5.2的开源与API预计下周同步上线。推荐理由:智谱发布 GLM-5.2,把 1M 上下文和强编码能力装进开源模型,在当前地缘限制下这种激进开放是难得的立场,做 agent 的值得上手一试。

6月13日周六

17:54公众号:智谱(GLM)70智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。推荐理由:智谱把最强大模型全量开放且开源,这事本身就在打脸那些收回权限的闭源模型,做中文编码的开发者可以认真看看。
05:43MiniMax (official)82MiniMax M3 获 vLLM 日零支持,1M 上下文窗口与 MSA 稀疏注意力MiniMax M3 发布,具备前沿编码与智能体能力,原生图像视频输入和计算机使用,1M-token 上下文。核心采用 MSA 稀疏注意力:每个 query 评分 128-token KV 块,仅对 top 块做注意力。vLLM 当日即支持 M3,包括专用 MSA prefill/decode 核、前缀缓存与分块 prefill、BF16 和 MXFP8 检查点、Hopper 与 Blackwell 的 MoE 后端,并在 NVIDIA 与 AMD 硬件上验证。同时支持原生多模态输入、工具调用、推理解析和思考模式控制等智能体工作负载。推荐理由:M3把1M上下文从‘理论上能做’变成了‘今天就能部署’,MSA稀疏注意力是关键,开源社区和推理框架的深度合作值得关注。

6月12日周五

18:24Kimi.ai70Kimi 发布并开源最新代码模型 Kimi-K2.7-CodeKimi 发布并开源最新代码模型 Kimi-K2.7-Code。相比 K2.6,其在 Kimi Code Bench v2 上提升 +21.8%,Program Bench 提升 +11.0%,MLS Bench Lite 提升 +31.5%。推理效率改进,推理 token 使用量降低 30%,长时编码任务中指令遵循和端到端成功率均提升。6x 高速模式即将推出,即日起可通过 Kimi API 和 Kimi Code 使用。推荐理由:月之暗面这次把编码模型做到 K2.7 还直接开源,Bench 提升不小,关键是把「想太多」的毛病治了,推理 token 省了三成,做 coding agent 的可以立刻换上试试。

6月11日周四

00:40Google DeepMind:Blog(RSS)72DiffusionGemma:文本生成速度提升4倍的开源扩散模型Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。推荐理由:DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

6月10日周三

16:28IT之家(RSS)72摩尔线程开源 MusaCoder 代码大模型,9B/27B 参数基于国产 GPU 全链路训练摩尔线程发布并开源 MusaCoder 代码大模型,含 9B 和 27B 两个参数规模,是业内首个基于国产 GPU 算力底座完成全链路训练与验证的开源模型。后训练流程在基于 MTT S5000 的夸娥智算集群上完成,支持从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2%、Avg.@8 88.60% 超越 Claude Opus、DeepSeek-V4 Pro、GLM-5.1、Kimi K2.6 等主流 SOTA 代码模型。推荐理由:摩尔线程这个模型直接瞄准GPU底层算子,KernelBench分数压过了不少主流大模型,虽然场景窄,但在国产硬件自建软件生态的路上,迈出了挺关键一步。
04:55Hugging Face:Blog(RSS)73Cohere发布North Mini Code:面向开发者的开源编码模型Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。推荐理由:Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。

6月9日周二

11:40公众号:小米 MiMo80小米 MiMo 与 TileRT 联合发布 UltraSpeed 模式,1T 模型输出突破 1000 tokens/s小米 MiMo 与 TileRT 联合发布 MiMo-V2.5-Pro-UltraSpeed 模式,使 1T 参数旗舰模型输出速度首次突破 1000 tokens/s。模型侧采用 FP4 混合量化(仅量化 MoE Expert)与 DFlash 块级 masked 并行推测解码(coding 场景平均接受长度 6.30 tokens);系统侧 TileRT 引入常驻内核引擎与异构流水线协作。API 限时开放(2026 年 6 月 9 日至 23 日),定价为 MiMo-V2.5-Pro 的 3 倍,速度提升约 10 倍。FP4 权重与 DFlash 模型 checkpoint 已开源至 HuggingFace。推荐理由:万亿模型首次在通用GPU上突破1000 tokens/s,不是专用硬件的胜利而是模型与系统Codesign的胜利,做实时AI应用的都应该盯紧这一套方案。
01:01Hacker News 热门(buzzing.cc 中文翻译)74小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。推荐理由:小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。

6月5日周五

02:54Google AI Developers70Google Magenta RealTime 2 (MRT2) 实时音乐模型发布Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日周四

22:46SenseTime69SenseNova U1 开源统一模型:原生图文生成商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为“非常令人印象深刻”。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。推荐理由:商汤这回把图文统一模型开源了,SenseNova U1的infographic功能比市面上大多数文生图工具更懂文字和布局,做内容的朋友可以上手试试。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月19日

星期日 · 2 条
21:00
公众号:昆仑万维(天工)精选
72
昆仑万维宣布2026为"世界模型元年",发布Matrix-Game 3.5等模型

昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。

具身智能多模态开源生态模型发布
另有 1 家信源报道公众号:昆仑万维(天工)
推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。
16:29
Qwen@Alibaba_Qwen精选
75
Qwen3.8 开源发布,2.4T 参数模型上线

Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀

开源生态模型发布
另有 11 家信源报道X:Berry Xia (@berryxia)X:通义千问 / Qwen (@Alibaba_Qwen)X:Nathan Lambert (@natolambert)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:小互 (@xiaohu)X:邵猛 (@shao__meng)X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Vista (@vista8)
推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月17日

星期五 · 2 条
13:48
AYi@AYi_AInotes精选
76
Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头

Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。

AYi: Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的...

开源生态模型发布编码
另有 2 家信源报道X:阿易 AI Notes (@AYi_AInotes)X:SemiAnalysis (@SemiAnalysis_)
推荐理由:K3登顶前端榜只是表象,更值得关注的是Moonshot将价格拉至前沿区间,这是中国模型首次不以低价取胜,而是在长上下文编码赛道与闭源巨头正面叫板,定价逻辑的转变可能重塑竞争格局。
08:00
HuggingFace Daily Papers(社区热门论文)精选
73
NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

arXiv多模态开源生态模型发布

推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

7月14日

星期二 · 2 条
17:00
公众号:腾讯混元精选
73
腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能

腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。

开源生态模型发布部署/工程
另有 6 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:腾讯混元 (@TencentHunyuan)X:Testing Catalog (@testingcatalog)IT之家(RSS)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)
推荐理由:295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。
09:05
SenseTime@SenseTime_AI精选
74
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

arXivGitHub多模态开源生态
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

7月13日

星期一 · 1 条
19:20
公众号:腾讯混元精选
76
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

arXivGitHub多模态开源生态

推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月11日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
70
GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。

Hugging Face多模态开源生态模型发布

推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

7月10日

星期五 · 1 条
12:01
公众号:龙猫LongCat(美团)精选
74
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

GitHub开源生态推理模型发布

推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

7月9日

星期四 · 2 条
15:16
IT之家(RSS)精选
73
蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0

蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。

具身智能多模态开源生态模型发布

推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
08:57
MarkTechPost(RSS)精选
70
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型

Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。

具身智能开源生态模型发布

推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。

7月8日

星期三 · 1 条
09:43
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Pulpie:用于清理网络的Pareto最优模型

Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。

Hugging Face开源生态数据/训练模型发布

推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。

7月6日

星期一 · 1 条
15:20
公众号:腾讯混元精选
70
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

智能体GitHubHugging Face开源生态
另有 1 家信源报道X:腾讯混元 (@TencentHunyuan)
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。

7月5日

星期日 · 1 条
22:21
Meituan LongCat@Meituan_LongCat精选
81
美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码

美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B–56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。

Meituan LongCat: 推出 LongCat-2.0 🐱 1.6T 参数 · MoE 架构,约 48B 活跃参数 · 1M 上下文窗口 这是 @OpenRouter 上 Owl Alpha 背后的完整模型--现已可用。 从零开始为智能体编程构建: ◆ LongC...

智能体开源生态模型发布编码
另有 1 家信源报道MarkTechPost(RSS)
推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月1日

星期三 · 1 条
16:32
MarkTechPost(RSS)精选
73
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。

开源生态推理模型发布部署/工程

推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。

6月30日

星期二 · 3 条
13:53
公众号:龙猫LongCat(美团)精选
82
美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型

美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。

开源生态推理模型发布编码
另有 8 家信源报道X:邵猛 (@shao__meng)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)公众号:卡尔的AI沃茨X:硅基流动 SiliconFlow (@SiliconFlowAI)X:美团 LongCat (@Meituan_LongCat)
推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。
05:26
Emad@EMostaque精选
79
美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。

Meituan LongCat: 你们有些人猜对了。👀 Owl Alpha 已经上线 @OpenRouter -- 那就是我们。 自上线以来,Owl Alpha 的日活量已跻身全球前三,并在 Hermes Agent 上排名第一,在 Claude Code 上排名第二,在...

开源生态数据/训练模型发布

推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
00:00
Google Research:Blog(网页)精选
76
Google Research 推出 TabFM:用于表格数据的零样本基础模型

Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。

Google开源生态数据/训练模型发布

推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。

6月28日

星期日 · 1 条
16:10
The Decoder:AI News(RSS)精选
70
新浪开源VibeThinker-3B:推理可压缩,事实知识不能

新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200–333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型已开源。

Hugging Face开源生态推理模型发布

推荐理由:VibeThinker-3B 用 3B 参数在数学编程上匹敌百倍大模型,推理可压缩而知识不能的假设值得深思。对做推理应用的人来说是个信号。

6月26日

星期五 · 1 条
20:05
Chubby♨️@kimmonismus精选
77
Ornith-1.0 是专为智能体编程设计的开源大语言模型家族,提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种尺寸。基于 gemma4 和 qwen3.5 后训练,采用强化学习联合优化任务脚手架与解决方案的自我改进策略。在多个编码基准上取得开源模型最优:Terminal-Bench 2.1(77.5)、SWE-Bench Verified(82.4)/ Pro(62.2)/ Multilingual(78.9)、NL2Repo(48.2)、SWE Atlas(QnA 41.2 / RF 42.6 / TW 39.1)、ClawEval(77.1)。所有模型以 MIT 许可证开源,支持商业与研究使用。主推文称其 397B 版本性能媲美甚至超越 Claude Opus 4.8。

Ornith: Aloha! 🌺 大家好,欢迎认识 Ornith-1.0,这是一个专为智能体编程而设计的开源大语言模型系列。 Ornith-1.0 覆盖了完整的参数规模,包括 9B Dense、31B Dense、35B MoE 和 397B MoE。在...

开源生态模型发布编码
另有 1 家信源报道X:Berry Xia (@berryxia)
推荐理由:宣称在 agentic coding 上超越 Claude Opus 4.8 的开源 397B 模型,MIT 协议,benchmark 数字漂亮,但如果属实将彻底改变 agent 开发格局,目前最需要独立验证,谨慎对待「好得不像真的」时刻。

6月25日

星期四 · 1 条
14:04
MarkTechPost(RSS)精选
73
百度发布Unlimited OCR:3B参数MoE模型,KV缓存恒定实现长文档高效解析

百度推出Unlimited OCR,一个3B参数的MoE模型,推理时仅激活500M参数。其核心创新Reference Sliding Window Attention(R-SWA)将KV缓存大小固定为Lm + n(n默认128),内存和延迟不随输出长度增长。模型基于DeepSeek OCR继续训练4000步,支持32K最大长度,通过DeepEncoder实现16倍token压缩。在OmniDocBench v1.5上整体得分93.23,超出DeepSeek OCR基线6.22分;v1.6得分93.92为最高。Base模式下吞吐达5580 TPS,比DeepSeek OCR提升12.7%,6000 token输出时延迟低35%。适用于整本书转录等场景,代码与权重已在HuggingFace开源。

多模态开源生态模型发布

推荐理由:Baidu这个OCR模型用R-SWA把KV缓存压成常量,长文档解析终于不用越跑越慢了。MIT开源,3B总参但推理只消500M,做文档管线的可以直接接。

6月24日

星期三 · 1 条
01:37
Krea@krea_ai精选
71
我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report

Krea: 今天,我们发布了 Krea 2 的开放权重。 欢迎 Krea 2 Raw 和 Krea 2 Turbo:前者是一个来自中期训练、未经知识蒸馏、旨在用于微调的模型,后者则是具有广泛美学多样性的快速蒸馏版本。 详情如下 👇

图像生成开源生态模型发布
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:Krea AI (@krea_ai)
推荐理由:Krea 2 开源了两个图像模型权重,一个未蒸馏适合微调,一个快速蒸馏版覆盖多样审美。对于做图像生成应用和模型融合的团队,这次开放权重比很多大厂都实在。

6月23日

星期二 · 1 条
14:10
公众号:京东JoyAI精选
73
京东全栈开源JoyAI-VL-Interaction,从"一问一答"走向"边看边说"

京东近日开源全球首个全栈交互模型JoyAI-VL-Interaction,获vLLM-Omni原生支持。该模型能持续观察视频流、主动判断关键事件并实时响应,支持将复杂任务委托后台Agent处理。在58个真人盲评中,对比豆包视频通话助手胜率77.6%,对比Gemini视频通话助手胜率87.9%,监控预警场景达100%胜率。开源内容包括模型权重、交互数据集、训练方案及完整可部署系统,支持摄像头、直播流等视频输入及语音交互、长期记忆、vLLM部署,适用于安防监控、老人看护、直播讲解等实时场景。

多模态开源生态模型发布部署/工程
另有 1 家信源报道IT之家(RSS)
推荐理由:京东这个实时交互模型不是又一个刷榜模型,它把「什么时候该说话」变成了模型自己的判断。全栈开源且对比豆包、Gemini 胜率惊人,做安防、看护、直播的开发者可以直接试了。

6月18日

星期四 · 2 条
11:43
HuggingFace Daily Papers(社区热门论文)精选
74
Sumi:从头训练的7B开源均匀扩散语言模型

Sumi(日语“墨”)是一个完全开源的7B参数均匀扩散语言模型,从零开始在1.5T模型token上预训练。它在知识、推理和编程评测中与同等token预算的自回归模型表现相当,但在常识推理benchmark上略逊,教育密集型数据混合可能是原因之一。Sumi开放模型权重、检查点及完整训练配方(含公开语料数据混合说明),为社区提供首个大规模均匀扩散模型的基准参考。

arXivHugging Face开源生态数据/训练

推荐理由:Sumi 是第一个完全从零预训练的大规模均匀扩散语言模型,填补了社区在这方向的研究空白,做扩散语言模型的人终于有个可以摸的起点。
10:40
公众号:通义实验室(千问)精选
75
首个统一科学大模型 LOGOS 正式开源

LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域专用方法:口袋条件配体生成纯序列范式首次超越3D扩散模型,超越NatureLM(8×7B);逆合成预测Top-1准确率74.8%;口袋位点识别仅靠序列达58.5% Top-n准确率;MOF材料生成NBB提升至17.78%。模型采用统一词汇表将蛋白质、小分子等编码为离散Token,通过空间交互离散化实现无需3D坐标的序列预测。预训练与下游任务形式与目标一致,跨领域知识迁移经实验验证有效。已完整开源模型权重、推理代码与技术报告。

开源生态数据/训练模型发布
另有 1 家信源报道IT之家(RSS)
推荐理由:LOGOS用一套统一科学语法把蛋白质、小分子、材料等塞进同一个LLM框架,纯序列建模就干过了专用扩散模型,参数量却只有NatureLM的1/56,做AI4S的得认真看一眼。

6月17日

星期三 · 3 条
17:38
Hugging Face:Blog(RSS)精选
83
GLM-5.2:为长周期任务而生

GLM-5.2 发布,支持 1M token 上下文,采用 IndexShare 架构——每 4 个稀疏注意力层共用一个轻量索引器,将 1M 上下文下每 token FLOPs 降低 2.9 倍;MTP 层改进使推测解码接受长度提升 20%。长周期编码基准上,FrontierSWE 落后 Opus 4.8 仅 1%、领先 GPT-5.5 1%;PostTrainBench 仅次于 Opus 4.8;SWE-Marathon 落后 Opus 4.8 13% 但排名第二。标准编码测试 Terminal-Bench 2.1 获 81.0 分(GLM-5.1 为 63.5),接近 Opus 4.8 的 85.0。模型引入努力级别控制以平衡性能与延迟。MIT 开源许可,无地域限制。

开源生态推理模型发布编码
另有 13 家信源报道IT之家(RSS)X:邵猛 (@shao__meng)The Decoder:AI News(RSS)Simon Willison 博客智谱:研究(网页内嵌数据)X:智谱 Z.ai (@Zai_org)公众号:智谱(GLM)X:歸藏 (@op7418)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Oran Ge (@oran_ge)X:硅基流动 SiliconFlow (@SiliconFlowAI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:GLM-5.2 是第一个在长程编码基准上直逼 Opus 4.8 的开源模型,MIT 许可无地域限制,开源生态终于有了能打硬仗的长上下文工具。
16:05
MarkTechPost(RSS)精选
70
MiniMax 发布 MSA 稀疏注意力方法,开源推理内核并推出 MiniMax-M3 模型

MiniMax 发布 MSA(MiniMax Sparse Attention),一种构建在 Grouped Query Attention 上的稀疏注意力方法。它将注意力分解为索引分支与主分支:索引分支以块粒度(默认 128 token)为每个 GQA 组选择 16 个 token 块(固定预算 2048 个键值 token),主分支仅在这些块上执行精确 softmax 注意力。MSA 在 109B 参数 MoE 模型上训练,开源了面向 NVIDIA SM100 GPU 的推理内核 fmha_sm100(MIT 许可,支持 BF16/FP8/NVFP4/FP4),并发布生产模型 MiniMax-M3。MSA-PT 在 MMLU、GSM8K、HumanEval、RULER-8K、RULER-32K 上分别达 67.2、77.7、64.0、84.2、77.5,与全注意力基线持平。128K 上下文下,其 exp-free Top-k 选择比 torch.topk 快 5.1 倍。

开源生态推理模型发布部署/工程

推荐理由:MiniMax 把长上下文注意力从 O(N) 压到固定每查询 2048 token,还同时开源高效内核与生产模型,对做长上下文 agent 的团队是即时可用的方法,遗憾是只限 SM100 GPU。
15:36
jietang@jietang精选
72
GLM-5.2 开源登顶全球评测,与 Opus 4.8 持平

智谱今日开源 GLM-5.2,在 Artificial Analysis 综合评测中以 51 分排名全球前三、开源模型第一,与 Claude Opus 4.8 持平。该模型在 Code Arena 前端代码生成中获 1,595 分排名第二,在 DesignArena 设计编码场景中以 1,360 分夺冠,并在软件工程基准 FrontierSWE 中位列第三。

开源生态模型发布编码
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Nathan Lambert:Interconnects(RSS)
推荐理由:智谱GLM-5.2在多个硬核基准上压过所有开源模型,直接跟Claude Opus对标,做模型选型的得重新看看国产开源了。

6月16日

星期二 · 1 条
12:39
Qwen:Blog Retrieval(API)精选
72
Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力

Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。

具身智能开源生态数据/训练模型发布
另有 4 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:通义千问 / Qwen (@Alibaba_Qwen)公众号:通义实验室(千问)MarkTechPost(RSS)
推荐理由:Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。

6月14日

星期日 · 1 条
07:48
🚨 AI News | TestingCatalog@testingcatalog精选
78
智谱发布最强开源模型GLM-5.2,面向所有GLM Coding Plan用户(Lite/Pro/Max)开放。该模型支持真正可用的100万上下文窗口,在长程任务独立完成方面保持领先,适合构建复杂AI智能体应用,也是国产最强编码模型的核心引擎。面对外部封锁限制,智谱强调科学全球性、AGI不应被高墙垄断,采取激进开源态度。GLM-5.2的开源与API预计下周同步上线。

jietang: GLM-5.2 is Fully Open, Frontier Intelligence Belongs to Everyone Today, the sudden restriction of certain frontier model...

开源生态模型发布编码
另有 13 家信源报道IT之家(RSS)X:邵猛 (@shao__meng)The Decoder:AI News(RSS)Simon Willison 博客智谱:研究(网页内嵌数据)X:智谱 Z.ai (@Zai_org)公众号:智谱(GLM)X:歸藏 (@op7418)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Oran Ge (@oran_ge)X:硅基流动 SiliconFlow (@SiliconFlowAI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:智谱发布 GLM-5.2,把 1M 上下文和强编码能力装进开源模型,在当前地缘限制下这种激进开放是难得的立场,做 agent 的值得上手一试。

6月13日

星期六 · 2 条
17:54
公众号:智谱(GLM)精选
70
智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源

GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

开源生态模型发布编码
另有 13 家信源报道IT之家(RSS)X:邵猛 (@shao__meng)The Decoder:AI News(RSS)Simon Willison 博客智谱:研究(网页内嵌数据)X:智谱 Z.ai (@Zai_org)公众号:智谱(GLM)X:歸藏 (@op7418)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Oran Ge (@oran_ge)X:硅基流动 SiliconFlow (@SiliconFlowAI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:智谱把最强大模型全量开放且开源,这事本身就在打脸那些收回权限的闭源模型,做中文编码的开发者可以认真看看。
05:43
MiniMax (official)@MiniMax_AI精选
82
MiniMax M3 发布,具备前沿编码与智能体能力,原生图像视频输入和计算机使用,1M-token 上下文。核心采用 MSA 稀疏注意力:每个 query 评分 128-token KV 块,仅对 top 块做注意力。vLLM 当日即支持 M3,包括专用 MSA prefill/decode 核、前缀缓存与分块 prefill、BF16 和 MXFP8 检查点、Hopper 与 Blackwell 的 MoE 后端,并在 NVIDIA 与 AMD 硬件上验证。同时支持原生多模态输入、工具调用、推理解析和思考模式控制等智能体工作负载。

vLLM: 🎉 Congrats to @MiniMax_AI on releasing MiniMax M3! Frontier coding and agentic capabilities, native image and video inp...

多模态开源生态推理模型发布
另有 2 家信源报道X:MiniMax (@MiniMax_AI)公众号:MiniMax(稀宇科技)
推荐理由:M3把1M上下文从‘理论上能做’变成了‘今天就能部署’,MSA稀疏注意力是关键,开源社区和推理框架的深度合作值得关注。

6月12日

星期五 · 1 条
18:24
Kimi.ai@Kimi_Moonshot精选
70
Kimi 发布并开源最新代码模型 Kimi-K2.7-Code

Kimi 发布并开源最新代码模型 Kimi-K2.7-Code。相比 K2.6,其在 Kimi Code Bench v2 上提升 +21.8%,Program Bench 提升 +11.0%,MLS Bench Lite 提升 +31.5%。推理效率改进,推理 token 使用量降低 30%,长时编码任务中指令遵循和端到端成功率均提升。6x 高速模式即将推出,即日起可通过 Kimi API 和 Kimi Code 使用。

开源生态推理模型发布编码
另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:月之暗面这次把编码模型做到 K2.7 还直接开源,Bench 提升不小,关键是把「想太多」的毛病治了,推理 token 省了三成,做 coding agent 的可以立刻换上试试。

6月11日

星期四 · 1 条
00:40
Google DeepMind:Blog(RSS)精选
72
DiffusionGemma:文本生成速度提升4倍的开源扩散模型

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

Google开源生态推理模型发布
另有 6 家信源报道X:Testing Catalog (@testingcatalog)X:Google DeepMind (@GoogleDeepMind)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)Google Developers Blog(RSS)MarkTechPost(RSS)
推荐理由:DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

6月10日

星期三 · 2 条
16:28
IT之家(RSS)精选
72
摩尔线程开源 MusaCoder 代码大模型,9B/27B 参数基于国产 GPU 全链路训练

摩尔线程发布并开源 MusaCoder 代码大模型,含 9B 和 27B 两个参数规模,是业内首个基于国产 GPU 算力底座完成全链路训练与验证的开源模型。后训练流程在基于 MTT S5000 的夸娥智算集群上完成,支持从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2%、Avg.@8 88.60% 超越 Claude Opus、DeepSeek-V4 Pro、GLM-5.1、Kimi K2.6 等主流 SOTA 代码模型。

开源生态模型发布编码

推荐理由:摩尔线程这个模型直接瞄准GPU底层算子,KernelBench分数压过了不少主流大模型,虽然场景窄,但在国产硬件自建软件生态的路上,迈出了挺关键一步。
04:55
Hugging Face:Blog(RSS)精选
73
Cohere发布North Mini Code:面向开发者的开源编码模型

Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。

智能体开源生态模型发布编码

推荐理由:Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。

6月9日

星期二 · 2 条
11:40
公众号:小米 MiMo精选
80
小米 MiMo 与 TileRT 联合发布 UltraSpeed 模式,1T 模型输出突破 1000 tokens/s

小米 MiMo 与 TileRT 联合发布 MiMo-V2.5-Pro-UltraSpeed 模式,使 1T 参数旗舰模型输出速度首次突破 1000 tokens/s。模型侧采用 FP4 混合量化(仅量化 MoE Expert)与 DFlash 块级 masked 并行推测解码(coding 场景平均接受长度 6.30 tokens);系统侧 TileRT 引入常驻内核引擎与异构流水线协作。API 限时开放(2026 年 6 月 9 日至 23 日),定价为 MiMo-V2.5-Pro 的 3 倍,速度提升约 10 倍。FP4 权重与 DFlash 模型 checkpoint 已开源至 HuggingFace。

开源生态推理模型发布部署/工程
另有 2 家信源报道X:小米 MiMo (@XiaomiMiMo)IT之家(RSS)
推荐理由:万亿模型首次在通用GPU上突破1000 tokens/s,不是专用硬件的胜利而是模型与系统Codesign的胜利,做实时AI应用的都应该盯紧这一套方案。
01:01
Hacker News 热门(buzzing.cc 中文翻译)精选
74
小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。

arXiv开源生态推理模型发布

推荐理由:小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。

6月5日

星期五 · 1 条
02:54
Google AI Developers@googleaidevs精选
70
Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

Google Magenta Project: Introducing Magenta RealTime 2 (MRT2): the live music model you can play as an instrument. MRT2 offers MIDI and prompt c...

Google多模态开源生态模型发布
另有 1 家信源报道IT之家(RSS)
推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日

星期四 · 1 条
22:46
SenseTime@SenseTime_AI精选
69
SenseNova U1 开源统一模型:原生图文生成

商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为“非常令人印象深刻”。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。

图像生成多模态开源生态模型发布
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤这回把图文统一模型开源了,SenseNova U1的infographic功能比市面上大多数文生图工具更懂文字和布局,做内容的朋友可以上手试试。