8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。
8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)Databricks 在 Unity AI Gateway 中推出智能路由功能,可在编码任务中自动匹配模型与执行框架,以 30% 以上的单任务成本降幅实现前沿模型质量。该功能面向 2026 年日益多样化的模型与工具生态,帮助用户在不牺牲性能的前提下优化推理开支。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择“专家模式”使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。
LiteRT 与轻量级 Gemma 开源模型简化了在 Raspberry Pi 上部署安全、实时的边缘 AI。LiteRT 优化 CPU 和 GPU 性能,为 Gemma4 等模型提供快速 token 速度,支持机器人实时本地推理。开发者可通过轻量级 LiteRT CLI 工具快速转换、量化和运行模型,Hailo AI 加速器支持也即将推出。
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
另有 8 家信源报道X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)X:Artificial Analysis (@ArtificialAnlys)X:阿易 AI Notes (@AYi_AInotes)X:洪明 (@hongming731)The Decoder:AI News(RSS)IT之家(RSS)NVIDIA Blog(RSS)蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。
另有 7 家信源报道X:Deedy Das (@deedydas)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Anthropic (@AnthropicAI)TechCrunch:AI(RSS)X:Kim (@kimmonismus)OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
另有 1 家信源报道X:OpenRouter (@OpenRouter)现代大语言模型通过长思维链实现强大推理能力,但推理计算成本高昂。投机解码(Speculative Decoding)用快速但不精确的草稿模型提议 token,再由更强的目标模型并行验证,以加速推理。然而,语义等价步骤中的 token 不匹配会导致不必要的拒绝,传统 token 级投机解码因此受限。
纯神经网络主要依赖 GPU 进行并行矩阵运算,而经典计算多用 CPU,神经符号 AI 则通常两者兼需。2012 年至 2023 年中,商业 AI 几乎完全由 GPU 驱动,如今这一格局正在改变。
腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。
另有 1 家信源报道IT之家(RSS)苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦“同名电影《盗火线》中哪位演员获得过奥斯卡奖”这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。
Cursor Router 通过 Compass 复杂度预测器和基于真实开发者流量的任务分类法,为每个对话轮次匹配最合适的模型。Auto Intelligence 模式在用户满意度超过 Fable 的同时成本降低 68%,Auto Balance 模式以低于 Opus 4.8 成本 41% 实现更优表现。系统从实时流量中学习模型在不同任务类别上的表现差异,以数据驱动方式替代基准分数推断。
Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。
小红书针对“问一问”多图场景,从 Prefill 与 Decode 两端优化多模态推理:动态 Vision Token 压缩减少冗余视觉输入,SERE 专家重路由配合关键专家保护降低 Decode 阶段专家计算与权重搬运。
SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)更智能的AI模型可能将算力价格推高至当前的10倍。智能提升带来的推理成本增长,将直接传导至算力市场定价。这一趋势源于模型能力与计算资源需求的正向关联,而非单一技术突破。
Gary Marcus 称 OpenAI 的 Astra 可能并非其宣传的突破,Anthropic 数学家 Levent Alpöge 用已公开的 Fable 模型在 24 小时内复现了 OpenAI 半数结果,质疑其真实进展。
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。
腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
另有 13 家信源报道X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:OpenAI Developers (@OpenAIDevs)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Tibo (@thsottiaux)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)伯克利 Sky Lab 团队基于 K-Search 框架开发了 CUDA 到 MLX 的结构化翻译层,使 AI 驱动的内核搜索能自动将 NVIDIA GPU 上积累数十年的内核优化知识迁移至 Apple Silicon。
OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。
OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。
腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
SGLang 和 Miles 为月之暗面开源的 2.8T 参数模型 Kimi K3 提供发布当日支持,分别负责推理和 RL 训练。K3 采用 69 层 KDA 线性注意力与 24 层 MLA 交错的混合架构,在 SGLang 上单卡 batch-1 解码速度达约 113 tok/s,结合 DSpark 推测解码可达约 423 tok/s。
同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》SGLang 在 issue #15194 中提出量化栈重构,将检查点解析、参数注册、权重加载、后处理与内核执行拆分为独立可复用组件。新架构以 Quant Config、Method、Scheme、Kernel 四层划分,使 AWQ、GPTQ、Compressed-Tensors 等检查点格式可共享同一后端内核,并支持 CUDA、Ascend NPU、CPU 等硬件独立演进。
Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。
另有 1 家信源报道公众号:数字生命卡兹克