内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「推理」清除

今天8月15日 周六

12:01公众号:百度智能云(文心)46百度千帆 Token Plan 权益升级:夜间调用 2 折,DeepSeek-V4-Flash-0731 上线
09:52Artificial Analysis65DeepSeek V4 Pro 0813 发布:涨价 264%,智能仅微升
09:22Rohan Paul40AlphaSense:Kimi 每 token 更便宜但单题成本更高
02:22Google Gemini66精选Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户
01:22Qwen31Qwen3.8 借助 TokenSpeed 实现大规模部署
01:21elvis52Faraday 27B 智能体超越 Claude Opus 4.8 与 GPT-5.5
00:52Qwen54Qwen3.8-2.4T-A95B上线DeepInfra
00:22Chubby♨️42Qwen3.8-27B 本地运行 Opus 4.6 Max 级能力

8月14日周五

23:54Alibaba Cloud50Qwen3.8-Max 上线 Together AI,2.4T 参数支持 1M 上下文
23:54Alibaba Cloud66Qwen 3.8-Max 登陆 Modal 支持百万上下文
23:21IT之家(RSS)46理想汽车探索自研云端推理芯片,沿用智驾芯片数据流架构
23:21IT之家(RSS)57中国医生用 GPT-5.6 破解 22 年数学难题,Crouzeix 本人确认正确
23:21IT之家(RSS)66同事件阿里开源 Qwen3.8-27B 模型,编程、办公场景表现超越 Qwen3.7-Plus同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》
22:51TechCrunch:AI(RSS)46Kog 如何从传统 GPU 中榨取更多推理性能
22:22The Decoder:AI News(RSS)54GPT-5.6 Sol 推出 Ultrafast 模式,推理速度提升 14 倍,由 Cerebras 提供支持
22:22OpenBMB56面壁智能等发布 SciDC:规则约束减少模型幻觉
21:51Hacker News 热门(buzzing.cc 中文翻译)61同事件DeepSeek 峰谷电价更新:V4-Pro 正式发布,API 引入峰谷定价同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
21:22François Chollet48ARC 3 公开演示集非评测集,榜首仅 2.70%
20:52François Chollet37ARC-AGI-3 顶尖方案:LLM 引导符号世界模型合成
19:52Rohan Paul36AI 数学证明洪流倒逼学界重估学术评价
19:31公众号:小红书技术(dots.llm)79精选dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
16:52Chubby♨️45GLM-5.3 发布:后训练带来网络安全能力跃升
15:52Alibaba Cloud35阿里云Qwen助ReN3降本增效
13:22SiliconFlow65精选DeepSeek V4 Pro 登陆硅基流动,1M 上下文
11:22MarkTechPost(RSS)63构建推理型 LLM:SupraLabs 推理语料库的流式处理、筛选与微调实用指南
10:21IT之家(RSS)50杨元庆:联想曾凭 PC 普及成为"PC 之王",相信 AI 时代历史将重演
09:51Hacker News 热门(buzzing.cc 中文翻译)55Cerebras 与 OpenAI 推出 GPT-5.6 Sol Ultrafast 超快模式
09:02HuggingFace Daily Papers(社区热门论文)51从原子证据到逻辑组合:面向复合选项的结构化组合推理
07:19IT之家(RSS)58OpenAI 推 GPT-5.6 Sol Ultrafast 模式,每秒生成 750 个词元、提速 14 倍
06:02Dongxi 东锡 NLP30马东锡 NLP:SSI 或正构建可反复改进"工作区"的模型
03:52Rohan Paul61同事件Gemini 3.7 Flash 发布,API 价格减半同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
03:48TechCrunch:AI(RSS)52OpenAI 推出 Ultrafast 模式,让 GPT 5.6 Sol 以 14 倍速度运行
03:34Databricks:Blog(RSS)42Unity AI Gateway 智能路由:以 30%+ 更低单任务成本匹配前沿模型质量
03:22Artificial Analysis72同事件Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
02:52Elon Musk32Grok 4.6 登顶 GPQA Diamond 评测
02:45Cerebras:Blog(网页)14OpenAI's GPT-5.6-Sol-Ultrafast: The World's Fastest Frontier Model. Learn more >>
02:19OpenAI:官网动态(RSS · 排除企业/客户案例)80精选GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能
01:52Sherwin Wu43GPT-5.6 Sol Ultrafast 发布,速度达 750 tokens/秒
01:52MarkTechPost(RSS)59同事件Google 发布 Gemini 3.7 Flash:主打编程与智能体,输入 token 定价 $0.75/1M同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
01:52DogeDesigner42Grok 4.6 登顶 GPQA Diamond 评测
已加载 40 条
全部 AI 动态
2026年8月15日星期六 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
标签「推理」 · 3249 条清除

8月15日

星期六 · 8 条
12:01
公众号:百度智能云(文心)
AI 评分 46/100
百度千帆 Token Plan 权益升级:夜间调用 2 折,DeepSeek-V4-Flash-0731 上线

8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。

智能体DeepSeek产品更新推理
09:52
Artificial Analysis@ArtificialAnlys
AI 评分 65/100
DeepSeek V4 Pro 0813 发布:涨价 264%,智能仅微升

DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。

智能体DeepSeek推理模型发布
09:22
Rohan Paul@rohanpaul_ai
AI 评分 40/100
AlphaSense:Kimi 每 token 更便宜但单题成本更高

AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是“完成 token 数 × token 价格”,token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。

智能体Anthropic推理现象/趋势
02:22
Google Gemini@GeminiApp精选
AI 评分 66/100
Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

Google Gemini: Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...

Google推理模型发布
另有 13 家信源报道Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Ammaar Reshi (@ammaar)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:fofr (@fofrAI)
推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。
01:22
Qwen@Alibaba_Qwen
AI 评分 31/100
通义千问 Qwen3.8 已通过 TokenSpeed 推理引擎实现大规模运行,延迟低、速度快。LightSeek 作为 Day-0 开源推理引擎合作伙伴,针对该 2.4T 参数模型优化了跨节点 DP/EP 扩展,性能比 TP16 快 30% 以上,并采用 DSpark 投机解码与单 CUDA graph 优化。

LightSeek Foundation: We're proud to be the Day 0 open-source inference engine partner for @Alibaba_Qwen 3.8. To serve this 2.4T-parameter mod...

推理行业动态部署/工程
01:21
elvis@omarsar0
AI 评分 52/100
Faraday 27B 智能体超越 Claude Opus 4.8 与 GPT-5.5

DAIR.AI 推出的 27B 参数智能体 Faraday 在论文复现任务中击败 Claude Opus 4.8 和 GPT-5.5。其方法 Replica 将论文复现转化为可扩展的 RL 任务空间,通过自动生成的评分器提供低噪声奖励信号。Faraday 将编码智能体作为工具调用,展现出更科学的推理路径,指向无需复杂框架即可将长周期科研能力训练进模型权重。

智能体推理论文/研究
00:52
Qwen@Alibaba_Qwen
AI 评分 54/100
顶级智能,一次 API 调用即可获得。Qwen3.8-2.4T-A95B 现已上线 DeepInfra,随时支持你的创意构建。🥳 快来 DeepInfra 深入了解吧!@DeepInfra

DeepInfra: New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE - 2.4T total params, 95B active, 512 experts. B...

推理模型发布编码部署/工程
00:22
Chubby♨️@kimmonismus
AI 评分 42/100
Qwen 发布 Qwen3.8-27B 紧凑开源多模态模型,仅 27B 参数即在智能体编码、计算机使用等基准上超越 Claude Opus 4.6 Max。支持图像、视频、可配置推理,原生 262K 上下文窗口可扩展至 1M,Apache 2.0 许可可自托管。基准结果为 Qwen 自测,尚待独立验证。

Chubby♨️: Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight multimodal model that rep...

开源生态推理模型发布

8月14日

星期五 · 32 条
23:54
Alibaba Cloud@alibaba_cloud
AI 评分 50/100
Qwen3.8-Max 已在 Together AI 平台上线,Together AI 作为 Day 0 首发合作伙伴。该开源权重 MoE 模型拥有 2.4T 总参数、95B 激活参数和 1M 上下文窗口,并具备强大的编程与智能体能力。

Together AI: Qwen3.8-2.4T-A95B is live on Together AI. The Qwen team's new open-weight MoE packs 2.4T total parameters with 95B activ...

开源生态推理模型发布
23:54
Alibaba Cloud@alibaba_cloud
AI 评分 66/100
Qwen 3.8-Max 已在 Modal 上线,支持完整 1M 上下文窗口,并配备定制的 DFlash 投机解码器。很高兴看到我们的发布合作伙伴 Modal 从第一天起就全力投入!⚡️ 2.4T 参数。1M 上下文。而且,依然只需一次 Modal 调用即可使用。@modal

Modal: Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...

推理模型发布部署/工程
23:21
IT之家(RSS)
AI 评分 46/100
理想汽车探索自研云端推理芯片,沿用智驾芯片数据流架构

理想汽车正探索自研云端推理芯片,采用与智驾芯片相同的数据流架构,项目仍处早期阶段。该芯片可承接部分GPU上的推理任务,包括智驾模型数据处理、测试、仿真及大语言模型请求处理。一种路径是复用车端NPU计算设计,将多个AI计算晶粒封装并配套高带宽内存与高速互联,以分摊研发成本。

推理行业动态
23:21
IT之家(RSS)
AI 评分 57/100
中国医生用 GPT-5.6 破解 22 年数学难题,Crouzeix 本人确认正确

北京协和医院神经外科博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了困扰数学界 22 年的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend 与华盛顿大学教授 Anne Greenbaum 公开披露此事,并表示猜想提出者 Michel Crouzeix 本人已审阅论文手稿并确认证明正确。

OpenAI推理论文/研究
23:21
IT之家(RSS)同事件
AI 评分 66/100
阿里开源 Qwen3.8-27B 模型,编程、办公场景表现超越 Qwen3.7-Plus

阿里千问大模型公众号宣布正式开源 Qwen3.8-27B,所有开发者、科研机构和企业均可自由下载、部署和使用。该模型为原生多模态稠密模型,支持 262K 原生上下文,可通过 YaRN 技术外推至 1M Tokens。较 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,表现超越 Qwen3.7-Plus,并新增 reasoning_effort 功能以按任务难度控制思考深度。

多模态推理模型发布
同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》
22:51
TechCrunch:AI(RSS)
AI 评分 46/100
Kog 如何从传统 GPU 中榨取更多推理性能

法国初创公司 Kog 正押注通过软件优化从企业现有的标准数据中心 GPU(如 AMD MI300X 和 NVIDIA H200)中挖掘更多推理性能,其演示实现了每秒 3,000 token 的推理速度,并承诺“30 倍更快的 LLM 推理”。基于早期反馈,Kog 预计软件工程将是首个应用场景,并计划在 9 月前以 10 倍速度运行首个大模型,以推动 A 轮融资。

推理行业动态部署/工程
22:22
The Decoder:AI News(RSS)
AI 评分 54/100
GPT-5.6 Sol 推出 Ultrafast 模式,推理速度提升 14 倍,由 Cerebras 提供支持

OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,输出速度最高达每秒 750 token,较此前提升 14 倍,加速由 Cerebras 提供支持,双方今年早些时候签署了百亿美元合作协议。该服务初期仅通过 OpenAI API 向特定客户开放,OpenAI 计划随算力增长逐步扩大访问。OpenAI 已在内部将该模式用于事件响应,并计划将速度作为新的定价杠杆。

OpenAI产品更新推理部署/工程
另有 1 家信源报道OpenAI:官网动态(RSS · 排除企业/客户案例)
22:22
OpenBMB@OpenBMB
AI 评分 56/100
面壁智能等发布 SciDC:规则约束减少模型幻觉

面壁智能(OpenBMB)联合清华NLP、南京大学等发布 SciDC,将科学知识转化为解码约束,使本地部署的领域模型只能在专家规则定义的可行域内生成。该方法无需微调,在工业配方设计、临床诊断等任务上平均准确率提升 +11.6(Qwen3-4B 42.5→54.1,Qwen3-14B 51.4→63.0),真实医疗记录上 Qwen3-14B 精确匹配从 33.5% 提升至 45.1%。

arXivGitHub推理论文/研究
21:51
Hacker News 热门(buzzing.cc 中文翻译)同事件
AI 评分 61/100
DeepSeek 峰谷电价更新:V4-Pro 正式发布,API 引入峰谷定价

DeepSeek 今日发布 V4-Pro,主打 Agent 能力升级,支持灵活推理强度(低/高/最大三档),并原生支持 OpenAI Responses API,可一键适配 Codex。V4-Pro 已上线应用/网页端(Expert Mode)及 API,模型名称不变。API 同步引入峰谷定价,谷时价格较峰时低 50%,新价格于 2026 年 8 月 16 日 16:00 UTC 生效。

智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
21:22
François Chollet@fchollet
AI 评分 48/100
ARC 3 公开演示集非评测集,榜首仅 2.70%

François Chollet 提醒,ARC 3 公开游戏集仅用于演示格式与提升参与度,不应作为训练数据或评测集,其分数不代表真实基准表现。私有评测集难度与新颖性显著更高。当前 Kaggle 榜首分数为 2.70%,基于半私有集,最终将以完全私有集评分。

推理评测/基准
20:52
François Chollet@fchollet
AI 评分 37/100
ARC-AGI-3 顶尖方案:LLM 引导符号世界模型合成

François Chollet 指出,ARC-AGI-3 上所有顶尖方案均采用 LLM 引导的符号世界模型合成法,即通过编写可执行代码来编码对世界因果机制的理解。

Jeremy Berman: In one pass Opus wrote 269 programs (~12,700 lines). It built parsers for all 25 games, searching functions for 23, and ...

大佬观点推理
19:52
Rohan Paul@rohanpaul_ai
AI 评分 36/100
AI 数学证明洪流倒逼学界重估学术评价

彭博社报道,AI 生成数学证明的速度可能远超人类理解其后果的能力,对大学构成挑战。学术地位目前基于论文、引用和定理等可量化产出,而非更慢的解释与判断工作。未来人类专长需转向上游,选择有价值的问题,数学界或需重新奖励解释结果、判断意义和教学等稀缺工作。

推理现象/趋势
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

智能体Hugging Face多模态开源生态
另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
16:52
Chubby♨️@kimmonismus
AI 评分 45/100
GLM-5.3 发布:后训练带来网络安全能力跃升

智谱发布 GLM-5.3,与 GLM-5.2 共用同一 743B 基础模型,全部性能提升来自扩展后训练(更多可执行环境、更长任务、更强验证器与强化学习)。网络评估中 ExploitBench 从 24.4% 升至 54.4%,两小时完成 105 个 ExploitGym 任务(GLM-5.2 为 29 个),权重计划两周后开源。作者预计美国政府将扩大监管框架以涵盖开源模型。

Chubby♨️: WHAT: Zai just launched GLM-5.3, and its biggest leap may be in cybersecurity. The 743B base model remains unchanged (!)...

开源生态推理模型发布
15:52
Alibaba Cloud@alibaba_cloud
AI 评分 35/100
受监管的AI不仅需要强大的模型,还需要成本控制、低延迟和本地数据合规。借助阿里云的通义千问(Qwen),ReN3在东南亚地区将推理成本降低了40%,输出质量提升了30%,响应速度加快了30%。了解更多:https://click.alibabacloud.com/m/20000002325/在阿里云Model Studio上试用Qwen:https://click.alibabacloud.com/m/20000002333/#AlibabaCloudSG #Qwen #EnterpriseAI #LighthouseCustomerStories
推理行业动态部署/工程
13:22
SiliconFlow@SiliconFlowAI精选
AI 评分 65/100
DeepSeek V4 Pro 登陆硅基流动,1M 上下文

DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

智能体DeepSeek推理模型发布
另有 7 家信源报道X:DeepSeek (@deepseek_ai)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)Simon Willison 博客X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)
推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。
11:22
MarkTechPost(RSS)
AI 评分 63/100
构建推理型 LLM:SupraLabs 推理语料库的流式处理、筛选与微调实用指南

本教程构建了处理 SupraLabs 推理语料库的端到端工作流:从 Hugging Face Hub 流式采样 8,000 条数据,分析来源分布、token 长度与推理占比,并应用质量过滤器剔除不合格样本。

Hugging Face推理教程/实践数据/训练
10:21
IT之家(RSS)
AI 评分 50/100
杨元庆:联想曾凭 PC 普及成为"PC 之王",相信 AI 时代历史将重演

联想集团发布 2026 财年第一财季报告,营收 269.43 亿美元,同比增长 43%,归母净亏损 6.09 亿美元;AI 相关收入同比增长 60% 至 85 亿美元,占总收入 35%。杨元庆称算力分配正从 80% 训练转向更合理的 80% 推理、20% 训练,并强调混合式 AI 与私域 AI 的增长空间,相信联想在 AI 时代将重演 PC 普及阶段的成功。

推理行业动态
09:51
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 55/100
Cerebras 与 OpenAI 推出 GPT-5.6 Sol Ultrafast 超快模式

Cerebras 与 OpenAI 在 OpenAI API 中推出 Ultrafast Mode 服务层级,由 Cerebras 驱动 GPT-5.6 Sol,输出速度最高达每秒 750 token,且不牺牲质量。

OpenAI产品更新推理
09:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
从原子证据到逻辑组合:面向复合选项的结构化组合推理

大语言模型在需要按显式逻辑运算符组合原子判断的选项上常出错。新框架将每个选项分解为原子答案并分别评分,再用运算符约束的整数线性规划组合分数,使模型无需直接面对复合选项。在LOGICAL-COMMONSENSEQA上Macro-F1从48.3提升至77.0,在新增的LOGICAL-SATA基准上从47.0提升至75.6,NEITHER/NOR选项提升最大。

推理论文/研究
07:19
IT之家(RSS)
AI 评分 58/100
OpenAI 推 GPT-5.6 Sol Ultrafast 模式,每秒生成 750 个词元、提速 14 倍

OpenAI 以预览形式为最强模型 GPT-5.6 Sol 推出 Ultrafast(超高速)模式,输出速度为标准处理的 14 倍,最高每秒生成 750 个词元。该模式由 Cerebras 提供,面向事故响应、金融研究、客服语音交互等实时性要求高的场景,目前仅向一小批客户开放有限预览。

OpenAI产品更新推理
06:02
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 30/100
马东锡 NLP:SSI 或正构建可反复改进"工作区"的模型

马东锡 NLP 认为“工作区”是模型作答前内部持有、评估和修正想法的区域,SSI 或正构建能反复改进该工作区、判断思考方向并保留有用发现的模型。其推荐 BIGAI 研究团队的博客《Reasoning as Value-Guided Latent-Space Optimization》,阐释模型如何利用额外测试时计算改进隐藏状态。

Anthropic大佬观点推理
03:52
Rohan Paul@rohanpaul_ai同事件
AI 评分 61/100
Gemini 3.7 Flash 发布,API 价格减半

Google 在 3.6 Flash 发布仅 3 周后推出 Gemini 3.7 Flash,入门 API 价格减半至 $0.75/$3.75(每百万输入/输出 token),2027 年 1 月 1 日起恢复为 $1.50/$7.50。

Sundar Pichai: Our Flash models are workhorses that offer performance at a great price. So, we're shipping updates fast to get them in ...

Google推理模型发布编码
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
03:48
TechCrunch:AI(RSS)
AI 评分 52/100
OpenAI 推出 Ultrafast 模式,让 GPT 5.6 Sol 以 14 倍速度运行

OpenAI 推出名为 Ultrafast 的新模式,可让 GPT 5.6 Sol 以标准处理 14 倍的速度工作,每秒输出高达 750 个 token。该模式由 OpenAI 与芯片厂商 Cerebras 合作驱动,目前以预览形式向小部分客户开放,OpenAI 表示将随“容量增长”扩大访问范围。

OpenAI产品更新推理
另有 1 家信源报道OpenAI:官网动态(RSS · 排除企业/客户案例)
03:34
Databricks:Blog(RSS)
AI 评分 42/100
Unity AI Gateway 智能路由:以 30%+ 更低单任务成本匹配前沿模型质量

Databricks 在 Unity AI Gateway 中推出智能路由功能,可在编码任务中自动匹配模型与执行框架,以 30% 以上的单任务成本降幅实现前沿模型质量。该功能面向 2026 年日益多样化的模型与工具生态,帮助用户在不牺牲性能的前提下优化推理开支。

产品更新推理部署/工程
03:22
Artificial Analysis@ArtificialAnlys同事件
AI 评分 72/100
Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿

Google 发布 Gemini 3.7 Flash,在 Artificial Analysis 智能指数上得分 56,较 3.6 Flash 提升 4 分,并登上智能 vs. 单任务耗时帕累托前沿。

Google推理模型发布评测/基准
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
02:52
Elon Musk@elonmusk
AI 评分 32/100
试试 Grok 4.6Grok 4.6 再次夺冠。👑Grok 4.6 在 GPQA Diamond 上以 94.9% 的得分位居第一,击败了 GPT-5.6、Gemini 3.1 Pro、Claude Opus 5 以及 Artificial Analysis 测试的所有其他模型。

DogeDesigner: Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating GPT-5.6, Gemini 3.1 Pr...

xAI推理模型发布
02:45
Cerebras:Blog(网页)
AI 评分 14/100
OpenAI's GPT-5.6-Sol-Ultrafast: The World's Fastest Frontier Model. Learn more >>
OpenAI推理行业动态
02:19
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

智能体MCP/工具OpenAI推理

推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。
01:52
Sherwin Wu@sherwinwu
AI 评分 43/100
Cerebras 预览 GPT-5.6 Sol Ultrafast 模式,生成速度最高 750 tokens/秒,比标准处理快 14 倍。该模式跑完 Humanity's Last Exam 仅用 11 小时 11 分,比 Claude Fable 5 快近 7 倍且准确率相当。用户称瓶颈已从模型转向工具本身。

Cerebras: Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at u...

OpenAI产品更新推理
01:52
MarkTechPost(RSS)同事件
AI 评分 59/100
Google 发布 Gemini 3.7 Flash:主打编程与智能体,输入 token 定价 $0.75/1M

Google 推出 Gemini 3.7 Flash,这是对 3.6 Flash 的算法改进而非新预训练模型,支持 1M-token 上下文窗口和最高 64K 输出 token。

Google推理模型发布编码
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》
01:52
DogeDesigner@cb_doge
AI 评分 42/100
Grok 4.6 再次获胜。👑Grok 4.6 以 94.9% 的分数在 GPQA Diamond 上夺得第一名,击败了 GPT-5.6、Gemini 3.1 Pro、Claude Opus 5 以及 Artificial Analysis 测试的所有其他模型。
xAI推理评测/基准
已加载 40 条