通义千问(Qwen)宣布 Qwen 3.8-Flash-Next 将于明天发布,该模型参数规模为 125B a6B。模型页面已上线 ModelScope 平台,引发 Hacker News 社区关注,目前获得 103 个 HN 点赞。
通义千问(Qwen)宣布 Qwen 3.8-Flash-Next 将于明天发布,该模型参数规模为 125B a6B。模型页面已上线 ModelScope 平台,引发 Hacker News 社区关注,目前获得 103 个 HN 点赞。
汤森路透推出其首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建,总研发投入约 4000 万美元。该模型与帝国理工学院联合重训以保障安全与政治中立,并用自有内容进一步训练。Thomson 在斯坦福 LegalBench 得分 0.823,在 Harvey 法律智能体基准上接近 Opus 4.8。
另有 3 家信源报道The Decoder:AI News(RSS)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Ox Alpha is currently the most popular model on @OpenRouter and is free to use! A reasoning model designed for coding, s...
名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上线,被描述为面向编程、持续智能体工作和生产负载的推理模型,Stripe CEO Patrick Collison 称其“非常出色”。该模型由匿名第三方提供,引发关于其背后开发者的广泛猜测,焦点集中在中国的 Z.ai(GLM 模型)或微软未发布的 MAI 版本上。
SITUATION EXPLAINED: A stealth model on OpenRouter is beating Fable and Sol on coding, and nobody knows who made it. • O...
Gemini 3.7 Flash from @Google on ARC-AGI (Verified): - ARC-AGI-2: 84.6%, $0.25/task - ARC-AGI-1: 95.5%, $0.12/task Gemin...
Ox Alpha 在一次提示下生成 64,745 个输出 token,单次响应产出完整 Three.js dreamcore 3D 场景的全部程序化代码,无需外部素材。该模型支持 1M 上下文窗口、约 131k 最大输出 token,可处理文本+图像+视频输入并输出文本,定位为面向编码、长程智能体软件工程及生产负载的推理模型。aimlapi 正免费提供 Ox Alpha。
NEW OX ALPHA FEELS CRAZY 🤯 We asked Ox Alpha to build a dreamcore 3D world in three.js — one prompt, one shot. No asset...
No way! @synthwavedd says that the secret Model "Ox Alpha" on OpenRouter is the upcoming GLM 5.3 Flash A Flash model (!!...
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。
Ox Alpha 是一款面向编码、持续性智能体工作和生产负载的推理模型,现已免费开放使用。该模型支持 1,048,576 token 的上下文窗口,最大输出 131,072 token。
Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。
Google DeepMind 推出 DiffusionGemma,一个基于 Gemma 4 26B A4B MoE 模型微调而来的实验性开放权重文本扩散模型。
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
Ornith-1.5 发布,将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)Aloha! 🌺Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with sel...
Grok 4.6 旗舰模型现已上线 Amazon Bedrock,支持 500K-token 上下文窗口、文本与图像输入,以及 Low 至 xHigh 四档可配置推理强度。该模型面向长时运行智能体、编程与知识工作,提供客户端工具调用、结构化输出及流式响应。定价为全球区域每百万 token 输入 $2、输出 $6、缓存读取 $0.50,覆盖所有提供 Bedrock 的 AWS 区域。
智谱AI发布新基础模型GLM-5.3的API,聚焦复杂编程、网络安全防御与长周期任务。该模型在Artificial Analysis Intelligence Index上得分60,进入全球前沿模型梯队,与Anthropic Claude Fable 5、OpenAI GPT-5.6 Sol等闭源模型并列,并与月之暗面Kimi K3持平。
同一事件,精选展示《GLM-5.3上线:AA智能指数60分并列开源第一,成本更低》Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...
唐杰发文反思缩放定律,指出参数规模需与数据、算力、推理成本等维度协同考量,Chinchilla 最优比例并非终点。他宣布 GLM-5.3 作为受控实验:与 GLM-5.2 同架构、同参数,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止参数一个旋钮。
Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...
另有 13 家信源报道Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Ammaar Reshi (@ammaar)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:fofr (@fofrAI)New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE — 2.4T total params, 95B active, 512 experts. B...
Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight multimodal model that rep...
Qwen3.8-2.4T-A95B is live on Together AI. The Qwen team’s new open-weight MoE packs 2.4T total parameters with 95B activ...
Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...
阿里千问大模型公众号宣布正式开源 Qwen3.8-27B,所有开发者、科研机构和企业均可自由下载、部署和使用。该模型为原生多模态稠密模型,支持 262K 原生上下文,可通过 YaRN 技术外推至 1M Tokens。较 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,表现超越 Qwen3.7-Plus,并新增 reasoning_effort 功能以按任务难度控制思考深度。
同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》DeepSeek 今日发布 V4-Pro,主打 Agent 能力升级,支持灵活推理强度(低/高/最大三档),并原生支持 OpenAI Responses API,可一键适配 Codex。V4-Pro 已上线应用/网页端(Expert Mode)及 API,模型名称不变。API 同步引入峰谷定价,谷时价格较峰时低 50%,新价格于 2026 年 8 月 16 日 16:00 UTC 生效。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 2 家信源报道X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)智谱发布 GLM-5.3,与 GLM-5.2 共用同一 743B 基础模型,全部性能提升来自扩展后训练(更多可执行环境、更长任务、更强验证器与强化学习)。网络评估中 ExploitBench 从 24.4% 升至 54.4%,两小时完成 105 个 ExploitGym 任务(GLM-5.2 为 29 个),权重计划两周后开源。作者预计美国政府将扩大监管框架以涵盖开源模型。
WHAT: Zai just launched GLM-5.3, and its biggest leap may be in cybersecurity. The 743B base model remains unchanged (!)...
DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。
另有 3 家信源报道IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)Simon Willison 博客Google 在 3.6 Flash 发布仅 3 周后推出 Gemini 3.7 Flash,入门 API 价格减半至 $0.75/$3.75(每百万输入/输出 token),2027 年 1 月 1 日起恢复为 $1.50/$7.50。
Our Flash models are workhorses that offer performance at a great price. So, we're shipping updates fast to get them in ...
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Google 发布 Gemini 3.7 Flash,在 Artificial Analysis 智能指数上得分 56,较 3.6 Flash 提升 4 分,并登上智能 vs. 单任务耗时帕累托前沿。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating GPT-5.6, Gemini 3.1 Pr...
Google 推出 Gemini 3.7 Flash,这是对 3.6 Flash 的算法改进而非新预训练模型,支持 1M-token 上下文窗口和最高 64K 输出 token。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》DeepSeek 正式发布 V4-Pro 0813,Agent 基准全面追平第一梯队:Terminal Bench 87.9、Cybergym 83.3,DeepSWE 从 12.8 跃升至 62.7。
We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 7 家信源报道Simon Willison 博客The Decoder:AI News(RSS)X:X.PIN (@thexpin)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 7 家信源报道IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)Simon Willison 博客The Decoder:AI News(RSS)X:X.PIN (@thexpin)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志DeepSeek-V4-Pro 正式发布,支持低/高/最大三档可调推理强度,V4-Flash 同样获得该控制。模型新增原生 OpenAI Responses API 支持及 Codex 一键配置,现有 API 模型名称保持不变。V4-Pro 已通过 API 及 App/Web 的 Expert Mode 上线,官方称智能体升级带来显著生产收益,但未公布独立基准数据。
We’re launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 6 家信源报道The Decoder:AI News(RSS)X:X.PIN (@thexpin)IT之家(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Rohan Paul (@rohanpaul_ai)DeepSeek:API 更新日志