内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 591 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「模型发布」清除

8月15日周六

06:03Nathan Lambert:Interconnects(RSS)62同事件GLM-5.3:中国实验室如何跟上前沿步伐同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》

8月14日周五

19:31公众号:小红书技术(dots.llm)79精选dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
13:41公众号:智谱(GLM)73精选GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
01:22Google DeepMind:Blog(RSS)72精选Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型
00:52MiniMax:Blog(网页)63精选MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

8月13日周四

19:20公众号:DeepSeek(深度求索)73同事件DeepSeek-V4-Pro 正式版上线同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
19:16DeepSeek:API 更新日志81精选DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强
18:01公众号:小红书技术(dots.llm)75精选小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
08:45Sakana AI:Blog(网页)32Sakana Chatがアップデート:「Sakana Fugu」と新世代「Sakana Namazu」が利用可能に
02:23Cursor Blog70精选Cursor 与 SpaceXAI 联合发布 Grok 4.6
00:09xAI:News(网页)77精选xAI 发布 Grok 4.6,强化长时运行智能体能力

8月12日周三

22:18Google DeepMind:Blog(RSS)35Google DeepMind 推出手语转文本模型 SL2T,为聋哑及听障用户带来新功能
01:45Microsoft AI:官方博客(网页)24MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost

8月11日周二

21:51LMSYS:Blog(Chatbot Arena 团队)74精选SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
21:13NVIDIA Blog(RSS)75同事件NVIDIA 发布 Nemotron 3.5 Lightning 与 NeMo Switchyard,提升智能体 AI 效率同一事件,精选展示《NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务》
21:13NVIDIA Blog(RSS)76精选NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
18:01公众号:蚂蚁百灵(Ling)75精选Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
17:21公众号:蚂蚁百灵(Ling)72精选Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
07:44Microsoft AI:官方博客(网页)30MAI-Image-2.6 launches at No. 2 on Arena ahead of Google, Meta and xAI
02:37OpenAI:官网动态(RSS · 排除企业/客户案例)55精选OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型

8月10日周一

19:51LMSYS:Blog(Chatbot Arena 团队)72精选SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

8月7日周五

20:31公众号:蚂蚁百灵(Ling)75精选蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署
01:11OpenAI:官网动态(RSS · 排除企业/客户案例)53精选ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限

8月6日周四

21:12NVIDIA Blog(RSS)71精选NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

8月5日周三

18:00OpenAI:官网动态(RSS · 排除企业/客户案例)49OpenAI 推出 GPT-Daybreak 加速防御者安全能力
12:12字节 Seed:Research Feed(网页内嵌数据)78精选字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
02:31Black Forest Labs:Blog(网页)43FLUX 3 Video, Part 1: Generation

8月4日周二

23:12NVIDIA Blog(RSS)68精选NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型
21:05Google Blog:AI(RSS)45Google 发布 Gemini 3.6 Flash 等三款新模型及 Gemini Robotics ER 2
16:20公众号:腾讯混元65精选腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

8月3日周一

16:19公众号:火山引擎47火山引擎 Doubao-Seed-Evolving 再升级:检索更准、幻觉更少
10:44公众号:MiniMax(稀宇科技)75精选MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
10:10Qwen:Blog Retrieval(API)89精选Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

7月31日周五

17:59MiniMax:Blog(网页)78精选MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频
13:43公众号:火山引擎53Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向
12:06字节 Seed:Research Feed(网页内嵌数据)80精选字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑
01:27OpenAI:官网动态(RSS · 排除企业/客户案例)66精选GPT-5.6 如何推进性价比前沿
00:00DeepSeek:API 更新日志72精选DeepSeek-V4-Flash 正式版 API 上线公测

7月30日周四

23:27Google DeepMind:Blog(RSS)60精选Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
00:26Google DeepMind:Blog(RSS)63精选Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「模型发布」 · 591 条清除

8月15日

星期六 · 1 条
06:03
Nathan Lambert:Interconnects(RSS)同事件
AI 评分 62/100
GLM-5.3:中国实验室如何跟上前沿步伐

Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。

安全/对齐模型发布编码
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》

8月14日

星期五 · 4 条
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

智能体Hugging Face多模态开源生态
另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
13:41
公众号:智谱(GLM)精选
AI 评分 73/100
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力

智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。

开源生态模型发布编码
另有 8 家信源报道The Decoder:AI News(RSS)X:智谱 Z.ai (@Zai_org)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Kim (@kimmonismus)IT之家(RSS)
推荐理由:把网络安全能力作为开源卖点,价值在于让缺乏闭源安全服务的中小团队也能开展漏洞审计,改变防御能力只集中在少数机构的现状。
01:22
Google DeepMind:Blog(RSS)精选
AI 评分 72/100
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

智能体Google模型发布编码
另有 16 家信源报道X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)MarkTechPost(RSS)X:Gemini (@GeminiApp)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)X:Ammaar Reshi (@ammaar)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)
推荐理由:相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。
00:52
MiniMax:Blog(网页)精选
AI 评分 63/100
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

多模态开源生态模型发布
另有 2 家信源报道X:MiniMax (@MiniMax_AI)IT之家(RSS)
推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。

8月13日

星期四 · 6 条
19:20
公众号:DeepSeek(深度求索)同事件
AI 评分 73/100
DeepSeek-V4-Pro 正式版上线

DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择“专家模式”使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。

智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
19:16
DeepSeek:API 更新日志精选
AI 评分 81/100
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

智能体DeepSeek模型发布
另有 10 家信源报道IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:DeepSeek (@deepseek_ai)Hacker News 热门(buzzing.cc 中文翻译)X:SemiAnalysis (@SemiAnalysis_)X:X.PIN (@thexpin)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)
推荐理由:峰谷定价把闲时成本降至高峰一半,适合批量推理、评估任务等可延迟工作负载调整执行时间,为降低 API 支出提供空间。
18:01
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

开源生态模型发布语音

推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。
08:45
Sakana AI:Blog(网页)
AI 评分 32/100
Sakana Chatがアップデート:「Sakana Fugu」と新世代「Sakana Namazu」が利用可能に
产品更新模型发布
02:23
Cursor Blog精选
AI 评分 70/100
Cursor 与 SpaceXAI 联合发布 Grok 4.6

Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

智能体模型发布编码
另有 6 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。
00:09
xAI:News(网页)精选
AI 评分 77/100
xAI 发布 Grok 4.6,强化长时运行智能体能力

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

智能体xAI模型发布编码
另有 9 家信源报道MarkTechPost(RSS)X:Kim (@kimmonismus)X:Elon Musk (@elonmusk, xAI)IT之家(RSS)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:Testing Catalog (@testingcatalog)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。

8月12日

星期三 · 2 条
22:18
Google DeepMind:Blog(RSS)
AI 评分 35/100
Google DeepMind 推出手语转文本模型 SL2T,为聋哑及听障用户带来新功能

Google DeepMind 发布手语转文本(SL2T)模型,为聋哑及听障用户提供新的手语功能。该模型是此次发布的突破性技术核心,旨在将手语实时转化为文本,帮助用户更顺畅地沟通。目前尚未公布具体参数规模、基准测试分数或可用性细节。

DeepMind多模态模型发布
01:45
Microsoft AI:官方博客(网页)
AI 评分 24/100
MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost
Microsoft模型发布编码

8月11日

星期二 · 7 条
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 74/100
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

智能体推理模型发布

推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。
21:13
NVIDIA Blog(RSS)同事件
AI 评分 75/100
NVIDIA 发布 Nemotron 3.5 Lightning 与 NeMo Switchyard,提升智能体 AI 效率

NVIDIA 扩展 Nemotron 3 模型家族,推出 300 亿参数混合专家模型 Nemotron 3.5 Lightning,面向高吞吐智能体工作负载,输出速度最高提升 4 倍,智能体任务完成速度提升 30%。同时发布开源模型路由库 NeMo Switchyard,可将任务成本降至 Opus 4.8 单独运行的近三分之一,并支持在 RTX PC、DGX 等本地设备部署。

智能体MCP/工具开源/仓库模型发布
同一事件,精选展示《NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务》
21:13
NVIDIA Blog(RSS)精选
AI 评分 76/100
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

推理模型发布端侧
另有 7 家信源报道IT之家(RSS)MarkTechPost(RSS)X:阿易 AI Notes (@AYi_AInotes)X:洪明 (@hongming731)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)
推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。
18:01
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

智能体Hugging Face模型发布端侧

推荐理由:1.3B 激活参数在 Mac 上实测首 Token 低于 100 毫秒,比只看参数量的轻量叙事更有参考价值,端侧 Agent 的落地边界因此更具体。
17:21
公众号:蚂蚁百灵(Ling)精选
AI 评分 72/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

智能体开源生态推理模型发布
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
07:44
Microsoft AI:官方博客(网页)
AI 评分 30/100
MAI-Image-2.6 launches at No. 2 on Arena ahead of Google, Meta and xAI
Microsoft图像生成模型发布
02:37
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 55/100
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型

OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。

OpenAI安全/对齐模型发布
另有 4 家信源报道The Decoder:AI News(RSS)X:Tibo (@thsottiaux)TechCrunch:AI(RSS)X:Greg Brockman (@gdb)
推荐理由:GPT-5.6-Cyber 将大模型能力引入授权的漏洞研究与验证流程,安全团队可借助模型自动化分析,缩短从漏洞发现到修复的窗口。

8月10日

星期一 · 1 条
19:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。

智能体Meta多模态模型发布

推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。

8月7日

星期五 · 2 条
20:31
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

推理模型发布部署/工程
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
01:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 53/100
ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限

ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。

OpenAI模型发布
另有 6 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Kim (@kimmonismus)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)
推荐理由:这次更新把 Sol 的准确度和一致性提升后开放给免费用户,同时 Luna 的无限日常聊天让非付费用户也能稳定使用基础能力,减少了因模型切换造成的体验落差。

8月6日

星期四 · 1 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

具身智能多模态开源生态模型发布

推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日

星期三 · 3 条
18:00
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 49/100
OpenAI 推出 GPT-Daybreak 加速防御者安全能力

OpenAI 发布 GPT-Daybreak,面向防御者的前沿网络模型,覆盖从广泛防御工作到高级安全研究。该模型旨在加速安全团队的分析与响应效率,具体参数、基准分数及可用性细节尚未公布。

OpenAI安全/对齐模型发布
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

多模态模型发布视频语音
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
02:31
Black Forest Labs:Blog(网页)
AI 评分 43/100
FLUX 3 Video, Part 1: Generation
多模态模型发布视频

8月4日

星期二 · 3 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

具身智能开源生态推理模型发布
另有 2 家信源报道IT之家(RSS)X:Jensen Huang (@JensenHuang)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
21:05
Google Blog:AI(RSS)
AI 评分 45/100
Google 发布 Gemini 3.6 Flash 等三款新模型及 Gemini Robotics ER 2

Google 在 7 月推出三款新 Gemini 模型——Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向生产级 AI 智能体,主打更高 token 效率、更低延迟和更可靠性能。

Google产品更新模型发布行业动态
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

模型发布语音部署/工程
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。

8月3日

星期一 · 3 条
16:19
公众号:火山引擎
AI 评分 47/100
火山引擎 Doubao-Seed-Evolving 再升级:检索更准、幻觉更少

火山引擎升级 Doubao-Seed-Evolving,聚焦 Coding 与 Agent 能力,提升复杂仓库修复、跨文件修改等工程任务稳定性,增强信息检索、缺失召回与多工具并行调用能力,并改善幻觉控制以减少基于错误检索结果的作答。该模型已上线火山 Agent Plan,单月套餐限时 9.9 元起,参与「体验奖励计划」调用成本立减 20%。

智能体模型发布编码
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

多模态模型发布视频
另有 3 家信源报道X:MiniMax (@MiniMax_AI)The Decoder:AI News(RSS)X:Kim (@kimmonismus)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

智能体多模态模型发布编码
另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Testing Catalog (@testingcatalog)X:阿易 AI Notes (@AYi_AInotes)X:Nathan Lambert (@natolambert)X:Kim (@kimmonismus)公众号:数字生命卡兹克
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

7月31日

星期五 · 5 条
17:59
MiniMax:Blog(网页)精选
AI 评分 78/100
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

多模态开源生态模型发布
另有 4 家信源报道X:Testing Catalog (@testingcatalog)X:MiniMax (@MiniMax_AI)X:Artificial Analysis (@ArtificialAnlys)X:X.PIN (@thexpin)
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
13:43
公众号:火山引擎
AI 评分 53/100
Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向

火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。

具身智能模型发布视频
另有 7 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

多模态模型发布视频
另有 7 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。
01:27
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

OpenAI推理模型发布部署/工程
另有 13 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Kim (@kimmonismus)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)X:Nathan Lambert (@natolambert)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)Simon Willison 博客
推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。
00:00
DeepSeek:API 更新日志精选
AI 评分 72/100
DeepSeek-V4-Flash 正式版 API 上线公测

DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。

智能体DeepSeek模型发布编码
另有 5 家信源报道X:阿易 AI Notes (@AYi_AInotes)X:DeepSeek (@deepseek_ai)X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)
推荐理由:DeepSeek V4-Flash 正式版 Agent 能力大幅跃升,多个编码 agent 基准分数翻倍,对做代码助手的团队是个高性价比的生产力入口。虽然是 Flash 版,但后训练打磨的成果让人更期待 Pro 正式版。

7月30日

星期四 · 2 条
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

DeepMind具身智能多模态模型发布
另有 4 家信源报道IT之家(RSS)Ars Technica:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Testing Catalog (@testingcatalog)
推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
00:26
Google DeepMind:Blog(RSS)精选
AI 评分 63/100
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。

DeepMindGoogle多模态模型发布
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。
已加载 40 条