内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 696 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「推理」清除

8月25日周二

22:57Hacker News 热门(buzzing.cc 中文翻译)39Qwen 3.8-Flash-Next 将于明天发布(125B a6B)
14:54X.PIN54汤森路透推出首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建

8月24日周一

23:18elvis32Ox Alpha 登顶 OpenRouter 且免费可用
04:27TechCrunch:AI(RSS)34神秘"隐身模型"Ox Alpha 背后是谁?

8月22日周六

12:54AI Notkilleveryoneism Memes ⏸️39神秘模型Ox Alpha登顶编程榜,@weidai11警告AI接管或已开始
11:58Sundar Pichai48Gemini 3.7 Flash首周破增长纪录
09:18Rohan Paul26Ox Alpha 单次生成完整 Three.js 3D 世界
03:18Chubby♨️26GLM 5.3 Flash 疑现身,加速竞赛开启

8月21日周五

21:07OpenBMB69精选面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型
15:25Hacker News 热门(buzzing.cc 中文翻译)46Ox Alpha 发布:面向编码与智能体任务的免费推理模型
02:55MarkTechPost(RSS)46Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变
02:24Hacker News 热门(buzzing.cc 中文翻译)79已收录DiffusionGemma 技术报告:Google DeepMind 开源离散扩散模型,单卡 H100 每秒生成约 1500 token
01:06Hugging Face:Blog(RSS)61精选Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

8月20日周四

22:48elvis53dots3-note 预览版:长任务自评模型
02:54Hacker News 热门(buzzing.cc 中文翻译)56Ornith-1.5:从自我构建到自我优化

8月19日周三

23:18🚨 AI News | TestingCatalog44Ornith-1.5 开源模型家族发布,对标 Opus 4.8
23:18DogeDesigner63Grok 4.6 登陆 Amazon Bedrock
15:54X.PIN67同事件智谱AI推出GLM-5.3 API,聚焦复杂编程与网络安全同一事件,精选展示《GLM-5.3上线:AA智能指数60分并列开源第一,成本更低》
14:44Dongxi 东锡 NLP44唐杰谈 Scaling Law:GLM-5.3 后训练实验
13:28jietang56唐杰谈缩放定律:GLM-5.3 后训练实验

8月18日周二

04:05OpenRouter41Sakana Namazu 登陆 OpenRouter,基于 Kimi K2.6

8月15日周六

02:22Google Gemini66精选Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户
00:52Qwen54Qwen3.8-2.4T-A95B上线DeepInfra
00:22Chubby♨️42Qwen3.8-27B 本地运行 Opus 4.6 Max 级能力

8月14日周五

23:54Alibaba Cloud50Qwen3.8-Max 上线 Together AI,2.4T 参数支持 1M 上下文
23:54Alibaba Cloud66Qwen 3.8-Max 登陆 Modal 支持百万上下文
23:21IT之家(RSS)66同事件阿里开源 Qwen3.8-27B 模型,编程、办公场景表现超越 Qwen3.7-Plus同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》
21:51Hacker News 热门(buzzing.cc 中文翻译)61同事件DeepSeek 峰谷电价更新:V4-Pro 正式发布,API 引入峰谷定价同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
19:31公众号:小红书技术(dots.llm)79精选dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
16:52Chubby♨️45GLM-5.3 发布:后训练带来网络安全能力跃升
13:22SiliconFlow65精选DeepSeek V4 Pro 登陆硅基流动,1M 上下文
03:52Rohan Paul61同事件Gemini 3.7 Flash 发布,API 价格减半同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
03:22Artificial Analysis72同事件Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
02:52Elon Musk32Grok 4.6 登顶 GPQA Diamond 评测
01:52MarkTechPost(RSS)59同事件Google 发布 Gemini 3.7 Flash:主打编程与智能体,输入 token 定价 $0.75/1M同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
01:18OpenAI50OpenAI 预览 GPT-5.6 Sol 超快模式

8月13日周四

21:15AYi67DeepSeek-V4-Pro 发布,Agent 成本打穿地板
20:51🚨 AI News | TestingCatalog52DeepSeek-V4-Pro 发布,主打 Agent 升级
20:20Chubby♨️52DeepSeek-V4-Pro 正式发布,支持可调推理强度
19:50DeepSeek65同事件DeepSeek 发布 V4-Pro 与 V4-Flash 升级同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「推理」 · 696 条清除

8月25日

星期二 · 2 条
22:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 39/100
Qwen 3.8-Flash-Next 将于明天发布(125B a6B)

通义千问(Qwen)宣布 Qwen 3.8-Flash-Next 将于明天发布,该模型参数规模为 125B a6B。模型页面已上线 ModelScope 平台,引发 Hacker News 社区关注,目前获得 103 个 HN 点赞。

推理模型发布
14:54
X.PIN@thexpin
AI 评分 54/100
汤森路透推出首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建

汤森路透推出其首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建,总研发投入约 4000 万美元。该模型与帝国理工学院联合重训以保障安全与政治中立,并用自有内容进一步训练。Thomson 在斯坦福 LegalBench 得分 0.823,在 Harvey 法律智能体基准上接近 Opus 4.8。

推理数据/训练模型发布
另有 3 家信源报道The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)

8月24日

星期一 · 2 条
23:18
elvis@omarsar0
AI 评分 32/100
这是个很棒的模型。我用它搭配 Pi 玩得很开心。你可以在我们的 harness 游乐场免费测试 Ox Alpha 搭配 Pi 或 Hermes Agent:https://academy.dair.ai/dashboard/playground

Pi: Ox Alpha is currently the most popular model on @OpenRouter and is free to use! A reasoning model designed for coding, s...

智能体多模态推理模型发布
04:27
TechCrunch:AI(RSS)
AI 评分 34/100
神秘"隐身模型"Ox Alpha 背后是谁?

名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上线,被描述为面向编程、持续智能体工作和生产负载的推理模型,Stripe CEO Patrick Collison 称其“非常出色”。该模型由匿名第三方提供,引发关于其背后开发者的广泛猜测,焦点集中在中国的 Z.ai(GLM 模型)或微软未发布的 MAI 版本上。

推理模型发布编码

8月22日

星期六 · 4 条
12:54
AI Notkilleveryoneism Memes ⏸️@AISafetyMemes
AI 评分 39/100
神秘模型Ox Alpha在OpenRouter上击败Fable和Sol登顶编程榜,却无人知晓其开发者。该模型拥有1M token上下文窗口,支持文本、图像和视频输入,免费一周,日处理能力达100万亿token,在DeepSWE子集上得分80%。

MTS: SITUATION EXPLAINED: A stealth model on OpenRouter is beating Fable and Sol on coding, and nobody knows who made it. • O...

安全/对齐推理编码
11:58
Sundar Pichai@sundarpichai
AI 评分 48/100
Gemini 3.7 Flash 在发布首周便打破了此前 Gemini 的增长纪录,成为我们迄今增长最快的模型。很高兴看到开发者社区的热情!现在它也已在 Search 和 @Geminiapp 中运行。

ARC Prize: Gemini 3.7 Flash from @Google on ARC-AGI (Verified): - ARC-AGI-2: 84.6%, $0.25/task - ARC-AGI-1: 95.5%, $0.12/task Gemin...

Google推理模型发布
09:18
Rohan Paul@rohanpaul_ai
AI 评分 26/100
Ox Alpha 单次生成完整 Three.js 3D 世界

Ox Alpha 在一次提示下生成 64,745 个输出 token,单次响应产出完整 Three.js dreamcore 3D 场景的全部程序化代码,无需外部素材。该模型支持 1M 上下文窗口、约 131k 最大输出 token,可处理文本+图像+视频输入并输出文本,定位为面向编码、长程智能体软件工程及生产负载的推理模型。aimlapi 正免费提供 Ox Alpha。

AI/ML API: NEW OX ALPHA FEELS CRAZY 🤯 We asked Ox Alpha to build a dreamcore 3D world in three.js — one prompt, one shot. No asset...

多模态推理模型发布编码
03:18
Chubby♨️@kimmonismus
AI 评分 26/100
据 @synthwavedd 爆料,OpenRouter 上的神秘模型 "Ox Alpha" 疑为即将推出的 GLM 5.3 Flash。若属实,这款 Flash 模型性能将超越 Fable 和 GPT Sol 等顶级模型,zAI 的后训练能力令西方模型相形见绌。Kimi k3.1 或也将发布,行业加速竞赛一触即发。

Chubby♨️: No way! @synthwavedd says that the secret Model "Ox Alpha" on OpenRouter is the upcoming GLM 5.3 Flash A Flash model (!!...

推理模型发布

8月21日

星期五 · 5 条
21:07
OpenBMB@OpenBMB精选
AI 评分 69/100
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

开源生态推理数据/训练模型发布

推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。
15:25
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 46/100
Ox Alpha 发布:面向编码与智能体任务的免费推理模型

Ox Alpha 是一款面向编码、持续性智能体工作和生产负载的推理模型,现已免费开放使用。该模型支持 1,048,576 token 的上下文窗口,最大输出 131,072 token。

推理模型发布编码
02:55
MarkTechPost(RSS)
AI 评分 46/100
Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变

Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。

推理模型发布部署/工程
02:24
Hacker News 热门(buzzing.cc 中文翻译)已收录
AI 评分 79/100
DiffusionGemma 技术报告:Google DeepMind 开源离散扩散模型,单卡 H100 每秒生成约 1500 token

Google DeepMind 推出 DiffusionGemma,一个基于 Gemma 4 26B A4B MoE 模型微调而来的实验性开放权重文本扩散模型。

DeepMindGoogle开源生态推理
01:06
Hugging Face:Blog(RSS)精选
AI 评分 61/100
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

推理模型发布部署/工程

推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

8月20日

星期四 · 2 条
22:48
elvis@omarsar0
AI 评分 53/100
dots3-note 预览版是一个开放权重模型,专为运行数小时、有时甚至数天的任务而构建。→ 280B 总参数 / 16B 激活参数 → 512K 上下文 → 文本、视觉和语音 → 推理、编码和工具使用但最有趣的部分不是模型规模。而是模型如何在长任务完成之前学会评估自身进展。🧵
多模态开源生态推理模型发布
02:54
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 56/100
Ornith-1.5:从自我构建到自我优化

Ornith-1.5 发布,将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。

推理模型发布端侧编码
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)

8月19日

星期三 · 5 条
23:18
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 44/100
Ornith 发布 Ornith-1.5 开源模型家族,含 397B MoE、35B MoE 和 9B dense 三个版本,性能对标 Claude Opus 4.8 和 GLM 5.2。

Ornith: Aloha! 🌺Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with sel...

推理模型发布编码
23:18
DogeDesigner@cb_doge
AI 评分 63/100
Grok 4.6 登陆 Amazon Bedrock

Grok 4.6 旗舰模型现已上线 Amazon Bedrock,支持 500K-token 上下文窗口、文本与图像输入,以及 Low 至 xHigh 四档可配置推理强度。该模型面向长时运行智能体、编程与知识工作,提供客户端工具调用、结构化输出及流式响应。定价为全球区域每百万 token 输入 $2、输出 $6、缓存读取 $0.50,覆盖所有提供 Bedrock 的 AWS 区域。

xAI推理模型发布编码
15:54
X.PIN@thexpin同事件
AI 评分 67/100
智谱AI推出GLM-5.3 API,聚焦复杂编程与网络安全

智谱AI发布新基础模型GLM-5.3的API,聚焦复杂编程、网络安全防御与长周期任务。该模型在Artificial Analysis Intelligence Index上得分60,进入全球前沿模型梯队,与Anthropic Claude Fable 5、OpenAI GPT-5.6 Sol等闭源模型并列,并与月之暗面Kimi K3持平。

推理模型发布编码
同一事件,精选展示《GLM-5.3上线:AA智能指数60分并列开源第一,成本更低》
14:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 44/100
唐杰(@jietang)发文反思 Scaling Law,指出参数量并非唯一关键,需结合数据、算力与推理成本综合考量,并回顾 Kaplan 与 Chinchilla 的演进。智谱 GLM-5.3 作为受控实验发布,与 GLM-5.2 基础、架构及参数量相同,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止一个旋钮。

jietang: Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...

推理数据/训练模型发布
13:28
jietang@jietang
AI 评分 56/100
唐杰谈缩放定律:GLM-5.3 后训练实验

唐杰发文反思缩放定律,指出参数规模需与数据、算力、推理成本等维度协同考量,Chinchilla 最优比例并非终点。他宣布 GLM-5.3 作为受控实验:与 GLM-5.2 同架构、同参数,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止参数一个旋钮。

推理数据/训练模型发布

8月18日

星期二 · 1 条
04:05
OpenRouter@OpenRouter
AI 评分 41/100
Sakana AI 的 Sakana Namazu 已在 OpenRouter 上线。Sakana Namazu 基于 Kimi K2.6 构建,是一款专业模型,将深厚的日本文化理解与高性能推理能力相结合,并整合了网络搜索与代码执行,以处理业务场景中的复杂任务。https://openrouter.ai/sakana/sakana-namazu
推理搜索模型发布

8月15日

星期六 · 3 条
02:22
Google Gemini@GeminiApp精选
AI 评分 66/100
Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

Google Gemini: Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...

Google推理模型发布
另有 13 家信源报道Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Ammaar Reshi (@ammaar)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:fofr (@fofrAI)
推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。
00:52
Qwen@Alibaba_Qwen
AI 评分 54/100
顶级智能,一次 API 调用即可获得。Qwen3.8-2.4T-A95B 现已上线 DeepInfra,随时支持你的创意构建。🥳 快来 DeepInfra 深入了解吧!@DeepInfra

DeepInfra: New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE — 2.4T total params, 95B active, 512 experts. B...

推理模型发布编码部署/工程
00:22
Chubby♨️@kimmonismus
AI 评分 42/100
Qwen 发布 Qwen3.8-27B 紧凑开源多模态模型,仅 27B 参数即在智能体编码、计算机使用等基准上超越 Claude Opus 4.6 Max。支持图像、视频、可配置推理,原生 262K 上下文窗口可扩展至 1M,Apache 2.0 许可可自托管。基准结果为 Qwen 自测,尚待独立验证。

Chubby♨️: Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight multimodal model that rep...

开源生态推理模型发布

8月14日

星期五 · 12 条
23:54
Alibaba Cloud@alibaba_cloud
AI 评分 50/100
Qwen3.8-Max 已在 Together AI 平台上线,Together AI 作为 Day 0 首发合作伙伴。该开源权重 MoE 模型拥有 2.4T 总参数、95B 激活参数和 1M 上下文窗口,并具备强大的编程与智能体能力。

Together AI: Qwen3.8-2.4T-A95B is live on Together AI. The Qwen team’s new open-weight MoE packs 2.4T total parameters with 95B activ...

开源生态推理模型发布
23:54
Alibaba Cloud@alibaba_cloud
AI 评分 66/100
Qwen 3.8-Max 已在 Modal 上线,支持完整 1M 上下文窗口,并配备定制的 DFlash 投机解码器。很高兴看到我们的发布合作伙伴 Modal 从第一天起就全力投入!⚡️ 2.4T 参数。1M 上下文。而且,依然只需一次 Modal 调用即可使用。@modal

Modal: Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...

推理模型发布部署/工程
23:21
IT之家(RSS)同事件
AI 评分 66/100
阿里开源 Qwen3.8-27B 模型,编程、办公场景表现超越 Qwen3.7-Plus

阿里千问大模型公众号宣布正式开源 Qwen3.8-27B,所有开发者、科研机构和企业均可自由下载、部署和使用。该模型为原生多模态稠密模型,支持 262K 原生上下文,可通过 YaRN 技术外推至 1M Tokens。较 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,表现超越 Qwen3.7-Plus,并新增 reasoning_effort 功能以按任务难度控制思考深度。

多模态推理模型发布
同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》
21:51
Hacker News 热门(buzzing.cc 中文翻译)同事件
AI 评分 61/100
DeepSeek 峰谷电价更新:V4-Pro 正式发布,API 引入峰谷定价

DeepSeek 今日发布 V4-Pro,主打 Agent 能力升级,支持灵活推理强度(低/高/最大三档),并原生支持 OpenAI Responses API,可一键适配 Codex。V4-Pro 已上线应用/网页端(Expert Mode)及 API,模型名称不变。API 同步引入峰谷定价,谷时价格较峰时低 50%,新价格于 2026 年 8 月 16 日 16:00 UTC 生效。

智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

智能体Hugging Face多模态开源生态
另有 2 家信源报道X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
16:52
Chubby♨️@kimmonismus
AI 评分 45/100
GLM-5.3 发布:后训练带来网络安全能力跃升

智谱发布 GLM-5.3,与 GLM-5.2 共用同一 743B 基础模型,全部性能提升来自扩展后训练(更多可执行环境、更长任务、更强验证器与强化学习)。网络评估中 ExploitBench 从 24.4% 升至 54.4%,两小时完成 105 个 ExploitGym 任务(GLM-5.2 为 29 个),权重计划两周后开源。作者预计美国政府将扩大监管框架以涵盖开源模型。

Chubby♨️: WHAT: Zai just launched GLM-5.3, and its biggest leap may be in cybersecurity. The 743B base model remains unchanged (!)...

开源生态推理模型发布
13:22
SiliconFlow@SiliconFlowAI精选
AI 评分 65/100
DeepSeek V4 Pro 登陆硅基流动,1M 上下文

DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

智能体DeepSeek推理模型发布
另有 3 家信源报道IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)Simon Willison 博客
推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。
03:52
Rohan Paul@rohanpaul_ai同事件
AI 评分 61/100
Gemini 3.7 Flash 发布,API 价格减半

Google 在 3.6 Flash 发布仅 3 周后推出 Gemini 3.7 Flash,入门 API 价格减半至 $0.75/$3.75(每百万输入/输出 token),2027 年 1 月 1 日起恢复为 $1.50/$7.50。

Sundar Pichai: Our Flash models are workhorses that offer performance at a great price. So, we're shipping updates fast to get them in ...

Google推理模型发布编码
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
03:22
Artificial Analysis@ArtificialAnlys同事件
AI 评分 72/100
Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿

Google 发布 Gemini 3.7 Flash,在 Artificial Analysis 智能指数上得分 56,较 3.6 Flash 提升 4 分,并登上智能 vs. 单任务耗时帕累托前沿。

Google推理模型发布评测/基准
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
02:52
Elon Musk@elonmusk
AI 评分 32/100
试试 Grok 4.6Grok 4.6 再次夺冠。👑Grok 4.6 在 GPQA Diamond 上以 94.9% 的得分位居第一,击败了 GPT-5.6、Gemini 3.1 Pro、Claude Opus 5 以及 Artificial Analysis 测试的所有其他模型。

DogeDesigner: Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating GPT-5.6, Gemini 3.1 Pr...

xAI推理模型发布
01:52
MarkTechPost(RSS)同事件
AI 评分 59/100
Google 发布 Gemini 3.7 Flash:主打编程与智能体,输入 token 定价 $0.75/1M

Google 推出 Gemini 3.7 Flash,这是对 3.6 Flash 的算法改进而非新预训练模型,支持 1M-token 上下文窗口和最高 64K 输出 token。

Google推理模型发布编码
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
01:18
OpenAI@OpenAI
AI 评分 50/100
预览超快模式:GPT-5.6 Sol 速度提升最高达 14 倍。该模式将率先在 OpenAI API 中向特定客户群体推出,并随着算力增长逐步向更多企业开放。
OpenAI推理模型发布

8月13日

星期四 · 4 条
21:15
AYi@AYi_AInotes
AI 评分 67/100
DeepSeek-V4-Pro 发布,Agent 成本打穿地板

DeepSeek 正式发布 V4-Pro 0813,Agent 基准全面追平第一梯队:Terminal Bench 87.9、Cybergym 83.3,DeepSWE 从 12.8 跃升至 62.7。

DeepSeek: We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...

智能体DeepSeek推理模型发布
另有 7 家信源报道Simon Willison 博客The Decoder:AI News(RSS)X:X.PIN (@thexpin)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志
20:51
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 52/100
DeepSeek 发布 DeepSeek-V4-Pro,已在 DeepSeek Chat"Expert Mode"及 API 上线。该模型带来重大 Agent 升级,支持灵活推理强度(低/高/最大),并原生支持 OpenAI Responses API,针对 Codex 优化且可一键配置。模型名称保持不变。

DeepSeek: We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...

智能体DeepSeek推理模型发布
另有 7 家信源报道IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)Simon Willison 博客The Decoder:AI News(RSS)X:X.PIN (@thexpin)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志
20:20
Chubby♨️@kimmonismus
AI 评分 52/100
DeepSeek-V4-Pro 正式发布,支持可调推理强度

DeepSeek-V4-Pro 正式发布,支持低/高/最大三档可调推理强度,V4-Flash 同样获得该控制。模型新增原生 OpenAI Responses API 支持及 Codex 一键配置,现有 API 模型名称保持不变。V4-Pro 已通过 API 及 App/Web 的 Expert Mode 上线,官方称智能体升级带来显著生产收益,但未公布独立基准数据。

DeepSeek: We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...

智能体DeepSeek推理模型发布
另有 6 家信源报道The Decoder:AI News(RSS)X:X.PIN (@thexpin)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志
19:50
DeepSeek@deepseek_ai同事件
AI 评分 65/100
我们今天正式发布 DeepSeek-V4-Pro!🚀🔷 重大 Agent 升级,带来强劲的生产环境性能提升!🔷 V4-Pro 与 V4-Flash 支持灵活推理强度:简单任务用低强度,日常 Agent 工作流用高强度,复杂任务用最高强度。🔷 原生支持 OpenAI Responses API,针对 Codex 优化,一键即可完成配置。V4 Pro 现已上线 App 和网页端,可通过"专家模式"体验。V4 Pro 也已通过 API 提供。模型名称保持不变--具体配置请参阅 API 文档。
智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
已加载 40 条