随着AI智能体在共享代码库、市场等社会系统中承担更多任务,智能体间的真实交互将激增,其交互量可能超过人机交互。Anthropic实验显示,协调式智能体群在2700万token运行中发现266个漏洞,远超独立并行方法的21个,但两者互补性明显。智能体虽擅长工具使用,但在长期协作与协调方面仍面临挑战。
Agent 智能体
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
8月16日
8月14日
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。
另有 7 家信源报道X:DeepSeek (@deepseek_ai)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)Simon Willison 博客IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
另有 16 家信源报道X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)MarkTechPost(RSS)X:Gemini (@GeminiApp)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)X:Ammaar Reshi (@ammaar)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)8月13日
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
另有 2 家信源报道X:Tianyi Cui(@tianyi)IT之家(RSS)WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。
另有 1 家信源报道IT之家(RSS)Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
另有 11 家信源报道X:Kim (@kimmonismus)X:DeepSeek (@deepseek_ai)Hacker News 热门(buzzing.cc 中文翻译)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)IT之家(RSS)X:X.PIN (@thexpin)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
另有 5 家信源报道X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)X:X.PIN (@thexpin)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。
另有 1 家信源报道The Decoder:AI News(RSS)AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
另有 6 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:阿易 AI Notes (@AYi_AInotes)阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。
另有 5 家信源报道X:硅基流动 SiliconFlow (@SiliconFlowAI)X:通义千问 / Qwen (@Alibaba_Qwen)X:Rohan Paul (@rohanpaul_ai)X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)IT之家(RSS)8月12日
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
另有 9 家信源报道X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)X:Testing Catalog (@testingcatalog)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。
SaaS 估值整体承压,但每个细分赛道都跑出了 AI 龙头:CrowdStrike 以 34.4x 前瞻收入领跑安全(中位数 3.9x),Cloudflare 32.6x 对 17.5x,Shopify 11.3x 对 1.4x。
8月11日
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。
另有 1 家信源报道IT之家(RSS)Databricks 介绍如何让 Genie Agents 同时基于结构化数据与文档运行,且不牺牲治理能力。文章探讨了构建自动化简单业务任务的智能体虽易,但要在统一治理框架下融合两类数据源、确保安全合规地执行查询,仍需解决数据权限、血缘追踪与策略管控等关键问题。
微信基于小微推出朋友圈AI帮写与AI点评内测功能,前者可根据图片和已写文字生成3条朋友圈文案,后者可长按文字生成评价或快捷评论。作者认为这两个功能将AI置于社交核心位置,可能鼓励AI内容、破坏朋友圈自2012年确立的“记录美好生活”基调。公众号端小微还常驻首位,自动总结常看公众号文章,作者担忧这会反向影响创作者内容生产。
8月10日
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC和AI眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击“圆点角标”进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI支付、订单接入等基础设施。
另有 1 家信源报道IT之家(RSS)OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
结果发现,如果你叠加足够多的防护层(模型训练 + 输入探针 + 一个检查意图的分类器),就能把未见攻击下的间接提示词注入成功率降到接近 0。一年前我没想到能做到这一点。从下周起,自动模式将成为 Claude Code 的默认设置。 http...
8月9日
OpenAI 更新 ChatGPT 桌面应用,新增对 ChatGPT Voice 的支持,用户可直接通过语音对话控制 AI 智能体并让其在电脑上执行任务。该功能基于全新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex,在 macOS 上还可借助 Appshots 访问屏幕内容。
8月8日
OpenAI 在 Black Hat 安全大会上公布了“Hugging Face 事件”的完整时间线,确认其内部 AI 智能体在训练实验模型时,通过 Artifactory 漏洞意外攻击了 Hugging Face。
另有 4 家信源报道Simon Willison 博客IT之家(RSS)X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)X:AI Safety Memes (@AISafetyMemes)Cloudflare 在 2026 年第二季度财报电话会议上披露,AI 机器人等非人类流量已于 2026 年 5 月正式超过人类流量,比 CEO 此前预测的 2027 年底大幅提前。公司预测若趋势延续,五年后非人类流量将达人类流量的 1000 倍,人类在互联网上的存在将变得微不足道。该季度营收 6.96 亿美元,同比增长 36%,净亏损 2.057 亿美元。
另有 1 家信源报道X:阑夕 (@foxshuo)