8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。
8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。
DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。
AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是“完成 token 数 × token 价格”,token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。
Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...
另有 13 家信源报道Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Ammaar Reshi (@ammaar)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:fofr (@fofrAI)We're proud to be the Day 0 open-source inference engine partner for @Alibaba_Qwen 3.8. To serve this 2.4T-parameter mod...
DAIR.AI 推出的 27B 参数智能体 Faraday 在论文复现任务中击败 Claude Opus 4.8 和 GPT-5.5。其方法 Replica 将论文复现转化为可扩展的 RL 任务空间,通过自动生成的评分器提供低噪声奖励信号。Faraday 将编码智能体作为工具调用,展现出更科学的推理路径,指向无需复杂框架即可将长周期科研能力训练进模型权重。
New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE - 2.4T total params, 95B active, 512 experts. B...
Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight multimodal model that rep...
Qwen3.8-2.4T-A95B is live on Together AI. The Qwen team's new open-weight MoE packs 2.4T total parameters with 95B activ...
Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...
理想汽车正探索自研云端推理芯片,采用与智驾芯片相同的数据流架构,项目仍处早期阶段。该芯片可承接部分GPU上的推理任务,包括智驾模型数据处理、测试、仿真及大语言模型请求处理。一种路径是复用车端NPU计算设计,将多个AI计算晶粒封装并配套高带宽内存与高速互联,以分摊研发成本。
北京协和医院神经外科博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了困扰数学界 22 年的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend 与华盛顿大学教授 Anne Greenbaum 公开披露此事,并表示猜想提出者 Michel Crouzeix 本人已审阅论文手稿并确认证明正确。
阿里千问大模型公众号宣布正式开源 Qwen3.8-27B,所有开发者、科研机构和企业均可自由下载、部署和使用。该模型为原生多模态稠密模型,支持 262K 原生上下文,可通过 YaRN 技术外推至 1M Tokens。较 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,表现超越 Qwen3.7-Plus,并新增 reasoning_effort 功能以按任务难度控制思考深度。
同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》法国初创公司 Kog 正押注通过软件优化从企业现有的标准数据中心 GPU(如 AMD MI300X 和 NVIDIA H200)中挖掘更多推理性能,其演示实现了每秒 3,000 token 的推理速度,并承诺“30 倍更快的 LLM 推理”。基于早期反馈,Kog 预计软件工程将是首个应用场景,并计划在 9 月前以 10 倍速度运行首个大模型,以推动 A 轮融资。
OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,输出速度最高达每秒 750 token,较此前提升 14 倍,加速由 Cerebras 提供支持,双方今年早些时候签署了百亿美元合作协议。该服务初期仅通过 OpenAI API 向特定客户开放,OpenAI 计划随算力增长逐步扩大访问。OpenAI 已在内部将该模式用于事件响应,并计划将速度作为新的定价杠杆。
另有 1 家信源报道OpenAI:官网动态(RSS · 排除企业/客户案例)面壁智能(OpenBMB)联合清华NLP、南京大学等发布 SciDC,将科学知识转化为解码约束,使本地部署的领域模型只能在专家规则定义的可行域内生成。该方法无需微调,在工业配方设计、临床诊断等任务上平均准确率提升 +11.6(Qwen3-4B 42.5→54.1,Qwen3-14B 51.4→63.0),真实医疗记录上 Qwen3-14B 精确匹配从 33.5% 提升至 45.1%。
DeepSeek 今日发布 V4-Pro,主打 Agent 能力升级,支持灵活推理强度(低/高/最大三档),并原生支持 OpenAI Responses API,可一键适配 Codex。V4-Pro 已上线应用/网页端(Expert Mode)及 API,模型名称不变。API 同步引入峰谷定价,谷时价格较峰时低 50%,新价格于 2026 年 8 月 16 日 16:00 UTC 生效。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》François Chollet 提醒,ARC 3 公开游戏集仅用于演示格式与提升参与度,不应作为训练数据或评测集,其分数不代表真实基准表现。私有评测集难度与新颖性显著更高。当前 Kaggle 榜首分数为 2.70%,基于半私有集,最终将以完全私有集评分。
François Chollet 指出,ARC-AGI-3 上所有顶尖方案均采用 LLM 引导的符号世界模型合成法,即通过编写可执行代码来编码对世界因果机制的理解。
In one pass Opus wrote 269 programs (~12,700 lines). It built parsers for all 25 games, searching functions for 23, and ...
彭博社报道,AI 生成数学证明的速度可能远超人类理解其后果的能力,对大学构成挑战。学术地位目前基于论文、引用和定理等可量化产出,而非更慢的解释与判断工作。未来人类专长需转向上游,选择有价值的问题,数学界或需重新奖励解释结果、判断意义和教学等稀缺工作。
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)智谱发布 GLM-5.3,与 GLM-5.2 共用同一 743B 基础模型,全部性能提升来自扩展后训练(更多可执行环境、更长任务、更强验证器与强化学习)。网络评估中 ExploitBench 从 24.4% 升至 54.4%,两小时完成 105 个 ExploitGym 任务(GLM-5.2 为 29 个),权重计划两周后开源。作者预计美国政府将扩大监管框架以涵盖开源模型。
WHAT: Zai just launched GLM-5.3, and its biggest leap may be in cybersecurity. The 743B base model remains unchanged (!)...
DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。
另有 7 家信源报道X:DeepSeek (@deepseek_ai)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)Simon Willison 博客X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)本教程构建了处理 SupraLabs 推理语料库的端到端工作流:从 Hugging Face Hub 流式采样 8,000 条数据,分析来源分布、token 长度与推理占比,并应用质量过滤器剔除不合格样本。
联想集团发布 2026 财年第一财季报告,营收 269.43 亿美元,同比增长 43%,归母净亏损 6.09 亿美元;AI 相关收入同比增长 60% 至 85 亿美元,占总收入 35%。杨元庆称算力分配正从 80% 训练转向更合理的 80% 推理、20% 训练,并强调混合式 AI 与私域 AI 的增长空间,相信联想在 AI 时代将重演 PC 普及阶段的成功。
Cerebras 与 OpenAI 在 OpenAI API 中推出 Ultrafast Mode 服务层级,由 Cerebras 驱动 GPT-5.6 Sol,输出速度最高达每秒 750 token,且不牺牲质量。
大语言模型在需要按显式逻辑运算符组合原子判断的选项上常出错。新框架将每个选项分解为原子答案并分别评分,再用运算符约束的整数线性规划组合分数,使模型无需直接面对复合选项。在LOGICAL-COMMONSENSEQA上Macro-F1从48.3提升至77.0,在新增的LOGICAL-SATA基准上从47.0提升至75.6,NEITHER/NOR选项提升最大。
OpenAI 以预览形式为最强模型 GPT-5.6 Sol 推出 Ultrafast(超高速)模式,输出速度为标准处理的 14 倍,最高每秒生成 750 个词元。该模式由 Cerebras 提供,面向事故响应、金融研究、客服语音交互等实时性要求高的场景,目前仅向一小批客户开放有限预览。
马东锡 NLP 认为“工作区”是模型作答前内部持有、评估和修正想法的区域,SSI 或正构建能反复改进该工作区、判断思考方向并保留有用发现的模型。其推荐 BIGAI 研究团队的博客《Reasoning as Value-Guided Latent-Space Optimization》,阐释模型如何利用额外测试时计算改进隐藏状态。
Google 在 3.6 Flash 发布仅 3 周后推出 Gemini 3.7 Flash,入门 API 价格减半至 $0.75/$3.75(每百万输入/输出 token),2027 年 1 月 1 日起恢复为 $1.50/$7.50。
Our Flash models are workhorses that offer performance at a great price. So, we're shipping updates fast to get them in ...
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》OpenAI 推出名为 Ultrafast 的新模式,可让 GPT 5.6 Sol 以标准处理 14 倍的速度工作,每秒输出高达 750 个 token。该模式由 OpenAI 与芯片厂商 Cerebras 合作驱动,目前以预览形式向小部分客户开放,OpenAI 表示将随“容量增长”扩大访问范围。
另有 1 家信源报道OpenAI:官网动态(RSS · 排除企业/客户案例)Databricks 在 Unity AI Gateway 中推出智能路由功能,可在编码任务中自动匹配模型与执行框架,以 30% 以上的单任务成本降幅实现前沿模型质量。该功能面向 2026 年日益多样化的模型与工具生态,帮助用户在不牺牲性能的前提下优化推理开支。
Google 发布 Gemini 3.7 Flash,在 Artificial Analysis 智能指数上得分 56,较 3.6 Flash 提升 4 分,并登上智能 vs. 单任务耗时帕累托前沿。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating GPT-5.6, Gemini 3.1 Pr...
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at u...
Google 推出 Gemini 3.7 Flash,这是对 3.6 Flash 的算法改进而非新预训练模型,支持 1M-token 上下文窗口和最高 64K 输出 token。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》