Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,162条收录
614条精选
● 持续更新
近期焦点近 14 天 · 按多源报道热度

8月15日

星期六 · 1 条
02:22
Google Gemini@GeminiApp精选
AI 评分 66/100
Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

Google Gemini: Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...

另有 15 家信源报道X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)MarkTechPost(RSS)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)X:Ammaar Reshi (@ammaar)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。

8月14日

星期五 · 6 条
23:22
Qwen@Alibaba_Qwen精选
AI 评分 71/100
通义千问开源 Qwen3.8 系列模型

通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。

另有 9 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)Simon Willison 博客Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:官方称 27B 稠密多模态模型整体表现超过 Qwen3.7-Plus,262K 原生上下文可扩至 1M,Apache 2.0 协议下本地部署轻量应用多了一个更高效的选择。
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
13:41
公众号:智谱(GLM)精选
AI 评分 73/100
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力

智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。

另有 9 家信源报道X:智谱 Z.ai (@Zai_org)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)Nathan Lambert:Interconnects(RSS)MarkTechPost(RSS)The Decoder:AI News(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Kim (@kimmonismus)IT之家(RSS)
推荐理由:把网络安全能力作为开源卖点,价值在于让缺乏闭源安全服务的中小团队也能开展漏洞审计,改变防御能力只集中在少数机构的现状。
13:22
SiliconFlow@SiliconFlowAI精选
AI 评分 65/100
DeepSeek V4 Pro 登陆硅基流动,1M 上下文

DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

另有 7 家信源报道X:DeepSeek (@deepseek_ai)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)Simon Willison 博客IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)
推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。
01:22
Google DeepMind:Blog(RSS)精选
AI 评分 72/100
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

另有 15 家信源报道X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)MarkTechPost(RSS)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)X:Ammaar Reshi (@ammaar)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。
00:52
MiniMax:Blog(网页)精选
AI 评分 63/100
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

另有 2 家信源报道X:MiniMax (@MiniMax_AI)IT之家(RSS)
推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。

8月13日

星期四 · 5 条
18:01
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。


推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。
07:30
DeepSeek:API 更新日志精选
AI 评分 81/100
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

另有 11 家信源报道X:Kim (@kimmonismus)X:DeepSeek (@deepseek_ai)Hacker News 热门(buzzing.cc 中文翻译)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)IT之家(RSS)X:X.PIN (@thexpin)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)
推荐理由:峰谷定价把闲时成本降至高峰一半,适合批量推理、评估任务等可延迟工作负载调整执行时间,为降低 API 支出提供空间。
07:30
公众号:数字生命卡兹克精选
AI 评分 69/100
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验

DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

另有 5 家信源报道X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)X:X.PIN (@thexpin)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:把准 Fable 级 Agent 能力压到输出百万 token 0.87 美元,与 50 美元的 Fable 5 形成数量级差距,团队对自动化任务的成本核算可能因此改变。
02:23
Cursor Blog精选
AI 评分 70/100
Cursor 与 SpaceXAI 联合发布 Grok 4.6

Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

另有 6 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。
00:46

8月12日

星期三 · 2 条
23:48
xAI:News(网页)精选
AI 评分 77/100
xAI 发布 Grok 4.6,强化长时运行智能体能力

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

另有 9 家信源报道X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:Testing Catalog (@testingcatalog)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)
推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。
15:13
IT之家(RSS)精选
AI 评分 71/100
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI

LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。

8月11日

星期二 · 5 条
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 74/100
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。


推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。
21:13
NVIDIA Blog(RSS)精选
AI 评分 76/100
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

另有 8 家信源报道MarkTechPost(RSS)X:阿易 AI Notes (@AYi_AInotes)X:洪明 (@hongming731)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)NVIDIA Blog(RSS)
推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。
18:01
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。


推荐理由:1.3B 激活参数在 Mac 上实测首 Token 低于 100 毫秒,比只看参数量的轻量叙事更有参考价值,端侧 Agent 的落地边界因此更具体。
17:21
公众号:蚂蚁百灵(Ling)精选
AI 评分 72/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
02:37
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 55/100
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型

OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。

另有 4 家信源报道X:Tibo (@thsottiaux)The Decoder:AI News(RSS)X:Greg Brockman (@gdb)TechCrunch:AI(RSS)
推荐理由:GPT-5.6-Cyber 将大模型能力引入授权的漏洞研究与验证流程,安全团队可借助模型自动化分析,缩短从漏洞发现到修复的窗口。

8月10日

星期一 · 4 条
19:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。


推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。
18:16
AI at Meta@AIatMeta精选
AI 评分 58/100
推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的智能体工作流优化。与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 GPU 的 PC)上运行。秉承我们长期分享基础 AI 研究的传统,我们以宽松的 Apache 2.0 许可证发布模型权重。
另有 15 家信源报道Simon Willison 博客TechCrunch:AI(RSS)X:Testing Catalog (@testingcatalog)IT之家(RSS)Ars Technica:AI(RSS)X:Artificial Analysis (@ArtificialAnlys)X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:Mark Zuckerberg (@finkd)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)The Decoder:AI News(RSS)Artificial Intelligence News(RSS)MarkTechPost(RSS)
推荐理由:将一个 30B 模型以 Apache 2.0 许可完全开源并针对本地智能体优化,为需要离线运行或数据不出设备的 Agent 应用提供了更轻量的选择。
08:14
MarkTechPost(RSS)精选
AI 评分 75/100
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。


推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

8月7日

星期五 · 2 条
15:10
IT之家(RSS)精选
AI 评分 71/100
谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时

谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:将气旋预报时效提前24小时并开源全套模型权重,气象机构可据此提升预警窗口,影响紧急预案规划。
01:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 53/100
ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限

ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。

另有 6 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Kim (@kimmonismus)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)
推荐理由:这次更新把 Sol 的准确度和一致性提升后开放给免费用户,同时 Luna 的无限日常聊天让非付费用户也能稳定使用基础能力,减少了因模型切换造成的体验落差。

8月6日

星期四 · 1 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日

星期三 · 5 条
16:35
MarkTechPost(RSS)精选
AI 评分 79/100
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

另有 1 家信源报道IT之家(RSS)
推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08
Qwen@Alibaba_Qwen精选
AI 评分 68/100
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 is now live on Qwen Cloud! Ranked #1 among Chinese models and #2 among mainstream models in Arena. ai'...

另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
02:00
OpenRouter@OpenRouter精选
AI 评分 66/100
@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。
00:07
SenseTime@SenseTime_AI精选
AI 评分 67/100
商汤 SenseNova U1 开源:统一推理与图像生成

商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月4日

星期二 · 4 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
23:04
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
UEmbed:统一稀疏与稠密的多模态嵌入模型

UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。


推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。

8月3日

星期一 · 3 条
23:03
SenseTime@SenseTime_AI精选
AI 评分 68/100
商汤发布 SenseNova U1.5-Lite-Preview 开源模型

商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。

另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)公众号:数字生命卡兹克X:Testing Catalog (@testingcatalog)
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月1日

星期六 · 1 条
05:59
Artificial Analysis@ArtificialAnlys精选
AI 评分 78/100
DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。

另有 14 家信源报道X:DeepSeek (@deepseek_ai)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)Simon Willison 博客X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)公众号:卡尔的AI沃茨X:硅基流动 SiliconFlow (@SiliconFlowAI)X:X.PIN (@thexpin)X:Kim (@kimmonismus)X:Elvis Saravia (@omarsar0, DAIR.AI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:DeepSeek 把 V4 Flash 的智能效率往前推了一步,MIT 许可让商业应用毫无顾虑,做轻量级部署的团队可以立刻换上。

7月31日

星期五 · 1 条
17:59
MiniMax:Blog(网页)精选
AI 评分 78/100
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

另有 4 家信源报道X:MiniMax (@MiniMax_AI)X:Testing Catalog (@testingcatalog)X:X.PIN (@thexpin)X:Artificial Analysis (@ArtificialAnlys)
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。