内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月31日 · 周五
最新精选
全部模型产品行业论文教程观点

今天7月31日 周五

01:27OpenAI:官网动态(RSS · 排除企业/客户案例)66GPT-5.6 如何推进性价比前沿OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。

7月30日周四

23:27Google DeepMind:Blog(RSS)60Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
23:16Google DeepMind71Google DeepMind 发布 Gemini Robotics 2 物理 AIOne brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。推荐理由:这是谷歌把通用大模型能力注入机器人的关键一步,全身智能和灵巧操作如果能兑现,制造业的自动化想象会彻底改写。
03:56OpenAI:官网动态(RSS · 排除企业/客户案例)77GPT-5.6 如何融合前沿智能与效率OpenAI 发布 GPT-5.6 模型家族,旗舰款 Sol 开启最大推理时在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5,成本不到后者一半。Terra 智能持平 GPT-5.5 但价格减半,Luna 定价比 Sol 低 80%。该系列通过负载均衡、推测解码等全栈优化实现更高 token 效率。推荐理由:GPT-5.6不是一次常规升级,Sol以不到一半的成本超越Claude Fable 5,对API成本敏感的开发者是实质性利好,效率优化从底层内核到推理全栈都有体现。
00:26Google DeepMind:Blog(RSS)63Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。

7月29日周三

04:56OpenAI Developers65OpenAI 推出两款新转录模型 API我们在 API 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。推荐理由:OpenAI 正式把转录拆成实时和异步两个模型,这是一个信号,语音 AI 的落地正在从通用走向场景专用,做语音产品的都该看一眼。

7月28日周二

16:58MarkTechPost(RSS)71Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。推荐理由:微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。
13:25Hacker News 热门(buzzing.cc 中文翻译)71FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTAFeyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。

7月27日周一

23:31公众号:月之暗面(Kimi)85Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。

7月25日周六

06:22Midjourney:Updates(RSS)73Midjourney V8.2 发布:专注美学提升与个性化理解Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。
01:24Anthropic:Newsroom(网页)92Anthropic 发布 Claude Opus 5Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。推荐理由:Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

7月24日周五

19:50HuggingFace Daily Papers(社区热门论文)77SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。
14:50Hacker News 热门(buzzing.cc 中文翻译)75FLUX 3 x mimic:新一代视频动作模型Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。推荐理由:Flux 3 证明了一个基础模型能同时生成视频和驱动机器人,Audi 产线的真实部署验证了物理 AI 从实验室走向量产,是基础模型走向通用世界理解的扎实一步。
00:00蚂蚁百灵:Developer Blog(网页)55蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。推荐理由:蚂蚁把124B模型的激活参数压到5.1B,还敢对标上代1T旗舰,如果实测不翻车,这个智能密度对端侧和低成本部署是个真信号。

7月23日周四

20:52Qwen79通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。
17:25Google AI:DEV 作者专属(RSS)73Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。
13:53Hacker News 热门(buzzing.cc 中文翻译)70Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。
00:00Black Forest Labs:Blog(网页)59FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. FLUX 3, our new multimodal frontier model, jointly learns from images, video, and audio to build one representation of the world. Now available in Early Access. July 23, 2026 Read more推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日周三

20:52Qwen73通义千问发布Qwen-Image-3.0:主打"真实"的第三代图像生成模型通义千问发布第三代图像生成模型Qwen-Image-3.0,核心关键词为“真实”。模型支持最长4.5k token的提示词,可一次性生成复杂布局(如报纸、试卷、3×3信息图),并能渲染10px级文字、完整LaTeX论文页面及逼真皮肤纹理。它还支持12种语言、100多种艺术风格,并具备实时网络检索能力,旨在成为设计、教育等领域的实用生产力工具。推荐理由:Qwen-Image 3.0 不再只追求画质,而是把图像生成变成排版工具,支持4.5k token提示和10px可读文本,设计、电商、教育团队可以直接用来出稿,是今年最实用的图像模型更新。
08:49IT之家(RSS)72小红书大模型 dots-note-3.0 以满分获 IMO 2026 金牌,第三题解法获冠军选手称赞小红书大模型 dots-note-3.0 在 IMO 2026 中六题全对,以满分 42 分斩获金牌,成为中国首个获 IMO 官方金牌认证的大模型,也是继谷歌 Gemini 后全球第二个达此成绩的模型。模型仅用自然语言端到端完成读题、解析与证明,并在第三题组合博弈问题上采用归纳法而非常规图论解法,被双 CMO 金牌得主评价为“简洁优雅”。该模型即将开源。推荐理由:中国大模型首次 IMO 满分,题目比去年还难,金牌线降了 6 分。小红书 dots-note-3.0 不仅全对,第三题解法还让冠军选手叫绝,做推理的同行该认真看看了。
00:22Josh Woodward69Google 发布三款新模型:3.6 Flash、3.5 Flash-Lite 与 3.5 Flash CyberGoogle 推出三款新模型,旨在提升性能、降低延迟和成本。其中,3.6 Flash 在复杂编码任务上 token 用量最高减少 65%,3.5 Flash-Lite 速度达 350 输出 token/秒。3.6 Flash 和 3.5 Flash-Lite 已在 Gemini 应用上线,3.5 Pro 进入合作伙伴测试。推荐理由:Google一口气扔出三个Gemini Flash新模型,3.6 Flash把复杂编码token砍了65%,做Agent的成本敏感型选手可以直接收益,Cyber模型专攻漏洞修复是个有意思的细分信号。

7月21日周二

23:22Google DeepMind:Blog(RSS)57Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。推荐理由:Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。
19:10公众号:小红书技术(dots.llm)81小红书 dots 模型获 IMO 2026 满分金牌小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
14:22Qwen:Blog Retrieval(API)77通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。
00:49Hugging Face:Blog(RSS)70NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月20日周一

23:00Sakana AI:Blog(网页)60Introducing Fugu-Cyber: our new orchestration model that achieves state-of-the-art performance on real-world cybersecurity benchmarks推荐理由:Sakana AI 把 AI 编排带到网络安全领域,Fugu-Cyber 在真实基准上的 SOTA 成绩值得安全从业者认真看看,但具体细节还没公开,别急着上手。
22:00公众号:昆仑万维(天工)64昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。推荐理由:昆仑万维这次开源的Matrix-Game 3.5在记忆和几何一致性上给出了一套可插拔的方案,不是纯炫技,全球开发者能直接复用到自己的视频基座上,做游戏和仿真的该关注一下。
17:10公众号:通义实验室(千问)70通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
15:48IT之家(RSS)70上海科学智能研究院开放科学多模态基础模型"神珍"上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日周日

22:10公众号:面壁智能(MiniCPM)77面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。推荐理由:面壁智能在具身智能上的第一步,用1.5B模型做到了3-4B的水平,且推理成本更低、支持断网本地部署,对机器人开发者是个可用的新起点。
22:10OpenBMB71面壁智能开源 MiniCPM-Robot 具身智能模型系列面壁智能开源首个具身AI模型系列 MiniCPM-Robot,包含 1.5B 参数的通用视觉-语言-动作(VLA)模型 MiniCPM-RobotManip 和用于目标跟踪的 MiniCPM-RobotTrack。同时发布高性能推理框架 PhyAI,旨在让机器人实现理解、记忆与行动。推荐理由:面壁智能把1.5B的VLA模型完整开源,让个人开发者也能在真实机器人上跑操作和跟踪,这个开放程度在具身领域很罕见,做机器人的可以直接 clone 跑一下。
21:30公众号:面壁智能(MiniCPM)68MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。
21:00公众号:昆仑万维(天工)72昆仑万维宣布2026为"世界模型元年",发布Matrix-Game 3.5等模型昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。
16:59Qwen69通义千问 Qwen3.8 开源发布在即Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有高达 2.4T 参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀推荐理由:Qwen 3.8 放出 2.4T 参数并声称性能仅次于 Fable 5,关键是即将开源权重,这让私有部署团队有了新选项,但真正实力还得等跑分验证。
16:29Qwen75Qwen3.8 开源发布,2.4T 参数模型上线Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月18日周六

05:10Greg Brockman65GPT-5.6 Sol 在网络安全领域达 SOTAGPT-5.6 Sol 是网络安全领域的最先进模型。在将其应用于发现和修复新型漏洞方面,看到了显著成果。推荐理由:Greg Brockman 亲自为 GPT-5.6 的网络攻防能力站台,这是 OpenAI 首次把模型明确打进漏洞挖掘场景,做安全与工具链的人需要盯紧这条线。

7月17日周五

16:13MarkTechPost(RSS)70NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
15:20公众号:通义实验室(千问)69通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:10数字生命卡兹克75Kimi K3 2.8万亿参数模型发布,7月27日开源月之暗面发布Kimi K3,参数量达2.8万亿,支持百万上下文,将于7月27日全面开源。在AA智能评分中K3位列第三,仅次于Claude Fable 5和GPT-5.6 Sol;Agent能力上,BrowseComp、Automation Bench、SpreadsheetBench 2三项均获第一。K3定位为全面水桶模型,在Coding、多模态等各领域均能排至第二或第三。推荐理由:卡兹克带着跑分和真实项目跑了一夜,K3在Coding、Agent、前端上的体感已能跟GPT-5.6 Sol有来有回,国内首个万亿开源模型,值得每一个用不了国外模型的人立刻上手。
13:48AYi76Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。推荐理由:K3登顶前端榜只是表象,更值得关注的是Moonshot将价格拉至前沿区间,这是中国模型首次不以低价取胜,而是在长上下文编码赛道与闭源巨头正面叫板,定价逻辑的转变可能重塑竞争格局。
精选
2026年7月31日星期五 · AI 自动挑选的高价值内容
全部模型产品行业论文教程观点

7月31日

星期五 · 1 条
01:27
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
66
GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

OpenAI推理模型发布部署/工程
另有 9 家信源报道X:Kim (@kimmonismus)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)X:Nathan Lambert (@natolambert)X:Sam Altman (@sama)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)
推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。

7月30日

星期四 · 4 条
23:27
Google DeepMind:Blog(RSS)精选
60
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

DeepMind具身智能多模态模型发布
另有 3 家信源报道Ars Technica:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Testing Catalog (@testingcatalog)
推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
23:16
Google DeepMind@GoogleDeepMind精选
71
One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
DeepMind具身智能模型发布
另有 6 家信源报道Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)X:Google AI (@GoogleAI)MarkTechPost(RSS)The Verge:AI(RSS)X:Kim (@kimmonismus)
推荐理由:这是谷歌把通用大模型能力注入机器人的关键一步,全身智能和灵巧操作如果能兑现,制造业的自动化想象会彻底改写。
03:56
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
77
GPT-5.6 如何融合前沿智能与效率

OpenAI 发布 GPT-5.6 模型家族,旗舰款 Sol 开启最大推理时在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5,成本不到后者一半。Terra 智能持平 GPT-5.5 但价格减半,Luna 定价比 Sol 低 80%。该系列通过负载均衡、推测解码等全栈优化实现更高 token 效率。

OpenAI推理模型发布部署/工程

推荐理由:GPT-5.6不是一次常规升级,Sol以不到一半的成本超越Claude Fable 5,对API成本敏感的开发者是实质性利好,效率优化从底层内核到推理全栈都有体现。
00:26
Google DeepMind:Blog(RSS)精选
63
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。

DeepMindGoogle多模态模型发布
另有 2 家信源报道The Decoder:AI News(RSS)IT之家(RSS)
推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。

7月29日

星期三 · 1 条
04:56
OpenAI Developers@OpenAIDevs精选
65
我们在 API 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。
OpenAI模型发布语音
另有 4 家信源报道The Decoder:AI News(RSS)X:小互 (@xiaohu)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:OpenAI 正式把转录拆成实时和异步两个模型,这是一个信号,语音 AI 的落地正在从通用走向场景专用,做语音产品的都该看一眼。

7月28日

星期二 · 2 条
16:58
MarkTechPost(RSS)精选
71
Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。

Microsoft安全/对齐开源/仓库模型发布
另有 4 家信源报道X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)TechCrunch:AI(RSS)X:Satya Nadella (@satyanadella)IT之家(RSS)
推荐理由:微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。
13:25
Hacker News 热门(buzzing.cc 中文翻译)精选
71
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。

GitHubHugging Face开源生态数据/训练

推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。

7月27日

星期一 · 1 条
23:31
公众号:月之暗面(Kimi)精选
85
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。

GitHubHugging Face多模态开源生态
另有 18 家信源报道X:Kimi.ai (@Kimi_Moonshot)The Decoder:AI News(RSS)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Artificial Analysis (@ArtificialAnlys)公众号:数字生命卡兹克X:歸藏 (@op7418)X:Berry Xia (@berryxia)X:Kim (@kimmonismus)The Verge:AI(RSS)X:宝玉 (@dotey)X:Rohan Paul (@rohanpaul_ai)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:AK (@_akhaliq)X:Elvis Saravia (@omarsar0, DAIR.AI)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)X:小互 (@xiaohu)
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。

7月25日

星期六 · 2 条
06:22
Midjourney:Updates(RSS)精选
73
Midjourney V8.2 发布:专注美学提升与个性化理解

Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

图像生成模型发布
另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。
01:24
Anthropic:Newsroom(网页)精选
92
Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

Anthropic安全/对齐推理模型发布
另有 22 家信源报道X:Claude (@claudeai)X:Thariq (@trq212)Simon Willison 博客X:Yuchen Jin (@Yuchenj_UW)X:Berry Xia (@berryxia)X:Kim (@kimmonismus)MarkTechPost(RSS)The Decoder:AI News(RSS)X:歸藏 (@op7418)TechCrunch:AI(RSS)公众号:卡尔的AI沃茨X:宝玉 (@dotey)X:Boris Cherny (@bcherny)X:Rohan Paul (@rohanpaul_ai)X:邵猛 (@shao__meng)公众号:数字生命卡兹克X:小北 (@frxiaobei)X:AI Safety Memes (@AISafetyMemes)The Verge:AI(RSS)X:Claude Devs (@ClaudeDevs)X:Testing Catalog (@testingcatalog)IT之家(RSS)
推荐理由:Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

7月24日

星期五 · 3 条
19:50
HuggingFace Daily Papers(社区热门论文)精选
77
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

模型发布端侧视频

推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。
14:50
Hacker News 热门(buzzing.cc 中文翻译)精选
75
FLUX 3 x mimic:新一代视频动作模型

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

具身智能多模态模型发布
另有 8 家信源报道X:歸藏 (@op7418)X:邵猛 (@shao__meng)X:Berry Xia (@berryxia)IT之家(RSS)X:Emad Mostaque (@EMostaque)MarkTechPost(RSS)X:Deedy Das (@deedydas)The Decoder:AI News(RSS)
推荐理由:Flux 3 证明了一个基础模型能同时生成视频和驱动机器人,Audi 产线的真实部署验证了物理 AI 从实验室走向量产,是基础模型走向通用世界理解的扎实一步。
00:00
蚂蚁百灵:Developer Blog(网页)精选
55
蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

推理模型发布
另有 3 家信源报道IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)公众号:蚂蚁百灵(Ling)
推荐理由:蚂蚁把124B模型的激活参数压到5.1B,还敢对标上代1T旗舰,如果实测不翻车,这个智能密度对端侧和低成本部署是个真信号。

7月23日

星期四 · 4 条
20:52
Qwen@Alibaba_Qwen精选
79
通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

模型发布语音

推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。
17:25
Google AI:DEV 作者专属(RSS)精选
73
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

Google多模态推理模型发布

推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。
13:53
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

开源/仓库推理模型发布端侧

推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。
00:00
Black Forest Labs:Blog(网页)精选
59
FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. FLUX 3, our new multimodal frontier model, jointly learns from images, video, and audio to build one representation of the world. Now available in Early Access. July 23, 2026 Read more
图像生成多模态模型发布

推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日

星期三 · 3 条
20:52
Qwen@Alibaba_Qwen精选
73
通义千问发布Qwen-Image-3.0:主打"真实"的第三代图像生成模型

通义千问发布第三代图像生成模型Qwen-Image-3.0,核心关键词为“真实”。模型支持最长4.5k token的提示词,可一次性生成复杂布局(如报纸、试卷、3×3信息图),并能渲染10px级文字、完整LaTeX论文页面及逼真皮肤纹理。它还支持12种语言、100多种艺术风格,并具备实时网络检索能力,旨在成为设计、教育等领域的实用生产力工具。

图像生成多模态模型发布
另有 3 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:swyx (@swyx)The Decoder:AI News(RSS)
推荐理由:Qwen-Image 3.0 不再只追求画质,而是把图像生成变成排版工具,支持4.5k token提示和10px可读文本,设计、电商、教育团队可以直接用来出稿,是今年最实用的图像模型更新。
08:49
IT之家(RSS)精选
72
小红书大模型 dots-note-3.0 以满分获 IMO 2026 金牌,第三题解法获冠军选手称赞

小红书大模型 dots-note-3.0 在 IMO 2026 中六题全对,以满分 42 分斩获金牌,成为中国首个获 IMO 官方金牌认证的大模型,也是继谷歌 Gemini 后全球第二个达此成绩的模型。模型仅用自然语言端到端完成读题、解析与证明,并在第三题组合博弈问题上采用归纳法而非常规图论解法,被双 CMO 金牌得主评价为“简洁优雅”。该模型即将开源。

推理模型发布
另有 3 家信源报道X:小互 (@xiaohu)X:Rohan Paul (@rohanpaul_ai)X:歸藏 (@op7418)
推荐理由:中国大模型首次 IMO 满分,题目比去年还难,金牌线降了 6 分。小红书 dots-note-3.0 不仅全对,第三题解法还让冠军选手叫绝,做推理的同行该认真看看了。
00:22
Josh Woodward@joshwoodward精选
69
Google 推出三款新模型,旨在提升性能、降低延迟和成本。其中,3.6 Flash 在复杂编码任务上 token 用量最高减少 65%,3.5 Flash-Lite 速度达 350 输出 token/秒。3.6 Flash 和 3.5 Flash-Lite 已在 Gemini 应用上线,3.5 Pro 进入合作伙伴测试。

Google DeepMind: We're rolling out three new models to make AI agents faster, smarter, and cheaper at scale: 🔵 Gemini 3.6 Flash: It uses...

DeepMindGoogle模型发布编码
另有 21 家信源报道X:小互 (@xiaohu)MarkTechPost(RSS)Ars Technica:AI(RSS)The Verge:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)X:Jeff Dean (@JeffDean)X:fofr (@fofrAI)IT之家(RSS)X:Berry Xia (@berryxia)X:宝玉 (@dotey)X:Google AI (@GoogleAI)X:Artificial Analysis (@ArtificialAnlys)X:Logan Kilpatrick (@OfficialLoganK)X:Google DeepMind (@GoogleDeepMind)Google DeepMind:Blog(RSS)Artificial Intelligence News(RSS)TechCrunch:AI(RSS)The Decoder:AI News(RSS)X:Gemini (@GeminiApp)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Google一口气扔出三个Gemini Flash新模型,3.6 Flash把复杂编码token砍了65%,做Agent的成本敏感型选手可以直接收益,Cyber模型专攻漏洞修复是个有意思的细分信号。

7月21日

星期二 · 4 条
23:22
Google DeepMind:Blog(RSS)精选
57
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

DeepMindGoogle模型发布
另有 21 家信源报道X:小互 (@xiaohu)MarkTechPost(RSS)Ars Technica:AI(RSS)The Verge:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)X:Jeff Dean (@JeffDean)X:fofr (@fofrAI)IT之家(RSS)X:Berry Xia (@berryxia)X:宝玉 (@dotey)X:Google AI (@GoogleAI)X:Artificial Analysis (@ArtificialAnlys)X:Logan Kilpatrick (@OfficialLoganK)X:Google DeepMind (@GoogleDeepMind)Google DeepMind:Blog(RSS)Artificial Intelligence News(RSS)TechCrunch:AI(RSS)The Decoder:AI News(RSS)X:Gemini (@GeminiApp)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。
19:10
公众号:小红书技术(dots.llm)精选
81
小红书 dots 模型获 IMO 2026 满分金牌

小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

开源/仓库推理模型发布

推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
14:22
Qwen:Blog Retrieval(API)精选
77
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

图像生成多模态模型发布

推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。
00:49
Hugging Face:Blog(RSS)精选
70
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

具身智能多模态模型发布端侧

推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月20日

星期一 · 4 条
23:00
Sakana AI:Blog(网页)精选
60
Introducing Fugu-Cyber: our new orchestration model that achieves state-of-the-art performance on real-world cybersecurity benchmarks
智能体模型发布
另有 1 家信源报道MarkTechPost(RSS)
推荐理由:Sakana AI 把 AI 编排带到网络安全领域,Fugu-Cyber 在真实基准上的 SOTA 成绩值得安全从业者认真看看,但具体细节还没公开,别急着上手。
22:00
公众号:昆仑万维(天工)精选
64
昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5

昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。

开源生态模型发布视频

推荐理由:昆仑万维这次开源的Matrix-Game 3.5在记忆和几何一致性上给出了一套可插拔的方案,不是纯炫技,全球开发者能直接复用到自己的视频基座上,做游戏和仿真的该关注一下。
17:10
公众号:通义实验室(千问)精选
70
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。

多模态模型发布语音

推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
15:48
IT之家(RSS)精选
70
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

GitHubHugging Face多模态开源/仓库

推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日

星期日 · 6 条
22:10
公众号:面壁智能(MiniCPM)精选
77
面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。

具身智能多模态模型发布

推荐理由:面壁智能在具身智能上的第一步,用1.5B模型做到了3-4B的水平,且推理成本更低、支持断网本地部署,对机器人开发者是个可用的新起点。
22:10
OpenBMB@OpenBMB精选
71
面壁智能开源 MiniCPM-Robot 具身智能模型系列

面壁智能开源首个具身AI模型系列 MiniCPM-Robot,包含 1.5B 参数的通用视觉-语言-动作(VLA)模型 MiniCPM-RobotManip 和用于目标跟踪的 MiniCPM-RobotTrack。同时发布高性能推理框架 PhyAI,旨在让机器人实现理解、记忆与行动。

具身智能开源生态模型发布

推荐理由:面壁智能把1.5B的VLA模型完整开源,让个人开发者也能在真实机器人上跑操作和跟踪,这个开放程度在具身领域很罕见,做机器人的可以直接 clone 跑一下。
21:30
公众号:面壁智能(MiniCPM)精选
68
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。

数据/训练模型发布端侧

推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。
21:00
公众号:昆仑万维(天工)精选
72
昆仑万维宣布2026为"世界模型元年",发布Matrix-Game 3.5等模型

昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。

具身智能多模态开源生态模型发布

推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。
16:59
Qwen@Alibaba_Qwen精选
69
通义千问 Qwen3.8 开源发布在即

Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有高达 2.4T 参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀

开源生态模型发布

推荐理由:Qwen 3.8 放出 2.4T 参数并声称性能仅次于 Fable 5,关键是即将开源权重,这让私有部署团队有了新选项,但真正实力还得等跑分验证。
16:29
Qwen@Alibaba_Qwen精选
75
Qwen3.8 开源发布,2.4T 参数模型上线

Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀

开源生态模型发布

推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月18日

星期六 · 1 条
05:10
Greg Brockman@gdb精选
65
GPT-5.6 Sol 是网络安全领域的最先进模型。在将其应用于发现和修复新型漏洞方面,看到了显著成果。

AI Security Institute: On our cyber range "The Last Ones", GLM-5.2 matches Opus 4.5, released ~7 months before it, while DeepSeek's V4-Pro fall...

OpenAI安全/对齐模型发布

推荐理由:Greg Brockman 亲自为 GPT-5.6 的网络攻防能力站台,这是 OpenAI 首次把模型明确打进漏洞挖掘场景,做安全与工具链的人需要盯紧这条线。

7月17日

星期五 · 4 条
16:13
MarkTechPost(RSS)精选
70
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

检索增强数据/训练模型发布

推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
15:20
公众号:通义实验室(千问)精选
69
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。

多模态模型发布视频

推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:10
数字生命卡兹克@Khazix0918精选
75
Kimi K3 2.8万亿参数模型发布,7月27日开源

月之暗面发布Kimi K3,参数量达2.8万亿,支持百万上下文,将于7月27日全面开源。在AA智能评分中K3位列第三,仅次于Claude Fable 5和GPT-5.6 Sol;Agent能力上,BrowseComp、Automation Bench、SpreadsheetBench 2三项均获第一。K3定位为全面水桶模型,在Coding、多模态等各领域均能排至第二或第三。

智能体模型发布编码

推荐理由:卡兹克带着跑分和真实项目跑了一夜,K3在Coding、Agent、前端上的体感已能跟GPT-5.6 Sol有来有回,国内首个万亿开源模型,值得每一个用不了国外模型的人立刻上手。
13:48
AYi@AYi_AInotes精选
76
Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头

Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。

AYi: Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的...

开源生态模型发布编码

推荐理由:K3登顶前端榜只是表象,更值得关注的是Moonshot将价格拉至前沿区间,这是中国模型首次不以低价取胜,而是在长上下文编码赛道与闭源巨头正面叫板,定价逻辑的转变可能重塑竞争格局。