So I asked Grok Build to make a trailer for my video game It booted the game, played it, recorded the screen, edited the...
So I asked Grok Build to make a trailer for my video game It booted the game, played it, recorded the screen, edited the...
国家超算互联网于 8 月 14 日上线 DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)及智能体框架 DeepSeek Harness。该模型增强了 Agent 能力,生产环境性能提升显著,整体性能可与 Claude Fable 5、Opus-4.8 相媲美。DeepSeek Harness 开发者预览版(v0.1)已面向全球开放测试,并以 MIT 协议开源。
小红书(RedNote)开源大语言模型 dots3-note preview,主打长时程生活智能体场景。该模型为 280B MoE、16B 激活参数,512K 上下文窗口,支持文本、视觉、音频多模态,并引入针对长时任务 RL 训练的新方法 TEMPO。模型权重与两个生活智能体基准 VibeSearchBench、VibeLifeBench 已在 Hugging Face 开源。
Introducing dots3-note preview - a small but mighty step toward long-horizon agency in real life. 🔹 280B MoE with 16B a...
🚀 Day-0 Support! @Alibaba_Qwen has open-sourced Qwen3.8-2.4T-A95B - and it's now live on SiliconFlow. ⚡ With 2.4T param...
另有 4 家信源报道X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)Qwen3.8-2.4T-A95B is now live on Fireworks with Day-0 support! This 2.4T parameter MoE model is built for autonomous age...
The king of small models is back! Qwen3.8-27B from @Alibaba_Qwen is open source, and Day-0 support is live in SGLang: - ...
Qwen3.8-2.4T-A95B is now live on Fireworks with Day-0 support! This 2.4T parameter MoE model is built for autonomous age...
Qwen3.8-2.4T-A95B is now live on Fireworks with Day-0 support! This 2.4T parameter MoE model is built for autonomous age...
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved throug...
Qwen3.8-2.4T-A95B is live on Together AI. The Qwen team's new open-weight MoE packs 2.4T total parameters with 95B activ...
Qwen3.8-2.4T-A95B is now live on Fireworks with Day-0 support! This 2.4T parameter MoE model is built for autonomous age...
DeepSeek 今日发布 V4-Pro,主打 Agent 能力升级,支持灵活推理强度(低/高/最大三档),并原生支持 OpenAI Responses API,可一键适配 Codex。V4-Pro 已上线应用/网页端(Expert Mode)及 API,模型名称不变。API 同步引入峰谷定价,谷时价格较峰时低 50%,新价格于 2026 年 8 月 16 日 16:00 UTC 生效。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)Introducing GLM-5.3: Built to Code. Ready for Cyber Defense. - Top-tier coding and agentic capabilities, achieved throug...
DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。
另有 2 家信源报道IT之家(RSS)Simon Willison 博客Intern-S2-Preview 是一系列科学智能体基础模型,支持多模态科学理解、推理、生成及长周期任务。其训练流程涵盖科学多模态预训练、监督微调、可扩展多任务强化学习及智能体强化学习,并采用部分回滚、自适应长度正则化等技术提升稳定性。Intern-S2-Preview-397B 在多项科学、多模态及智能体基准上取得领先结果,其时间序列模块提升了 SciTS 上的信号理解与预测能力。
谷歌推出专为编程与 Agents 场景打造的 Gemini 3.7 Flash 模型,距 3.6 Flash 发布仅约三周,在软件工程、知识工作及网页开发工作流方面大幅提升。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Writer 周四推出新旗舰模型 Palmyra X6,基于 Z.ai 开源模型 GLM-5.2 构建,结合框架基础设施升级,预计可为客户在基础任务上削减高达 50% 的成本。该公司同时发布标准智能体框架的重大升级,两项功能即日起对客户开放。Writer 研究显示,框架效率优化比模型选择更能可靠降低成本,测试中成本平均下降 40%。
Gemini 3.7 Flash official released. Surprisingly solid jump over 3.6! FrontierCode: 43.6% vs. 34.4% DeepSWE: 65.3% vs. 4...
ICYMI refresh your model catalogs. Grok 4.6 is out 🛸 Built for long-running agent tasks, with stronger capabilities acr...
Gemini Spark, available to Google AI Pro and Ultra subscribers in over 160 countries, will be using Gemini 3.7 Flash sta...
Google AI 推出 Gemini 3.7 Flash,定位编码与智能体场景的主力模型。该模型已集成至 Gemini App 的 Spark 功能,可跨 Gmail、Google 日历和 Google 文档处理多步骤复杂任务。3.7 Flash 年底前提供半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Google 发布 Gemini 3.7 Flash,定位为面向编码和智能体任务的高性能模型,具备更强的指令遵循、首遍代码准确率与智能体任务执行能力。官方演示其构建复杂 3D 网页游戏,涵盖 Three.js 引擎逻辑、Nano Banana 素材生成与程序化音频集成。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Google 在 3.6 Flash 发布仅 3 周后推出 Gemini 3.7 Flash,在软件工程、知识工作和网页开发方面显著提升,尤其擅长编码和智能体任务。其入门价格仅为 3.6 Flash 原价的一半,已上线 Antigravity、Gemini API、Gemini Enterprise 等平台。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Our Flash models are workhorses that offer performance at a great price. So, we're shipping updates fast to get them in ...
Google 今日推出 Gemini 3.7 Flash,取代三周前发布的 3.6 Flash,主打改进的编码与智能体性能,并以更低“入门价”应对竞品低价。
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
另有 11 家信源报道X:Logan Kilpatrick (@OfficialLoganK)X:Ammaar Reshi (@ammaar)X:Rohan Paul (@rohanpaul_ai)X:Demis Hassabis (@demishassabis)MarkTechPost(RSS)X:Gemini (@GeminiApp)X:Google DeepMind (@GoogleDeepMind)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)DeepSeek 将旗舰模型 V4-Pro 移出测试阶段,新构建版本 V4-Pro-0813 在 Terminal Bench 2.1 上得分从 72.1 升至 87.9,DeepSWE 从 12.8 升至 62.7,但整体排名仍落后于 Claude Opus 5。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》DeepSeek 正式发布 V4-Pro 0813,Agent 基准全面追平第一梯队:Terminal Bench 87.9、Cybergym 83.3,DeepSWE 从 12.8 跃升至 62.7。
We're launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 4 家信源报道Simon Willison 博客X:X.PIN (@thexpin)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)We're launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 4 家信源报道IT之家(RSS)Simon Willison 博客X:X.PIN (@thexpin)X:Rohan Paul (@rohanpaul_ai)DeepSeek-V4-Pro 正式发布,支持低/高/最大三档可调推理强度,V4-Flash 同样获得该控制。模型新增原生 OpenAI Responses API 支持及 Codex 一键配置,现有 API 模型名称保持不变。V4-Pro 已通过 API 及 App/Web 的 Expert Mode 上线,官方称智能体升级带来显著生产收益,但未公布独立基准数据。
We're launching DeepSeek-V4-Pro today! 🚀 🔷 Major Agent upgrades with strong production gains! 🔷 Flexible reasoning ef...
另有 3 家信源报道X:X.PIN (@thexpin)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择“专家模式”使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
另有 3 家信源报道X:X.PIN (@thexpin)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)SpaceXAI 发布 Grok 4.6,这是基于 Grok 4.5 的后训练升级而非更大规模的基础模型,支持 500K 上下文 token、文本与图像输入,并新增 xhigh 推理强度档位。
同一事件,精选展示《xAI 发布 Grok 4.6,强化长时运行智能体能力》韩国 AI 实验室 Upstage 推出面向复杂智能体任务的商用大模型 Solar Pro 4,上下文窗口 512K,最高输出 128K token。定价为每百万 tokens 输入 0.3 美元、输出 1.2 美元,缓存读取 0.06 美元。该模型在 Agent Arena 排名第 44,与 MiniMax M2.7 同级,是首个登上该榜单的韩国实验室。
另有 1 家信源报道X:Artificial Analysis (@ArtificialAnlys)