Claude Code v2.1.233 发布,为 --worktree 标志和 agents 视图新增 GitLab 合并请求 URL 支持,并添加可选的 forward_user_identity 网关设置以按用户归因支出。
Claude Code v2.1.233 发布,为 --worktree 标志和 agents 视图新增 GitLab 合并请求 URL 支持,并添加可选的 forward_user_identity 网关设置以按用户归因支出。
Firetiger 团队正式加入 Cursor。该公司构建面向生产环境的智能体,可监控发布、捕获回归、调查事件并将发现反馈给编码智能体。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,此前曾在 Cloudflare、Twitch、Segment 和 Twilio 构建大型生产系统。
Databricks 在 Unity AI Gateway 中推出智能路由功能,可在编码任务中自动匹配模型与执行框架,以 30% 以上的单任务成本降幅实现前沿模型质量。该功能面向 2026 年日益多样化的模型与工具生态,帮助用户在不牺牲性能的前提下优化推理开支。
Anthropic 数据团队将 Claude Tag(公开测试版)作为 Slack 中数据分析智能体的基础,让非分析师也能用受治理的语义层提问并获得答案。团队分享了五项关键经验:将技能文件视为持续刷新的内容、为智能体配备预测/留存/漏斗等分析技能、接入内部知识索引而非仅连接数仓,并强调权限、数据新鲜度与可观测性的设计。
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
OpenAI 推出新的 API 服务层级 Ultrafast,由 Cerebras 提供算力,运行 GPT-5.6 Sol 的速度最高提升 14 倍,输出速率可达每秒 750 tokens。该模式目前处于预览阶段。
另有 2 家信源报道TechCrunch:AI(RSS)The Decoder:AI News(RSS)HeyGen 将 18B+ 参数的 Avatar IV 视频生成模型移植到 Google Cloud Trillium (v6e) TPU,通过 torchax 和 XLA 实现,并采用 FSDP 与 Ulysses 序列并行。
亚信与火山引擎合作,通过TRAE IDE将AI Coding融入研发交付全链路,已实现6000+研发席位规模化部署,研发团队AI编码贡献率达32%,SDLC整体提效15%,核心团队代码缺陷逃逸率下降69%~71%。双方还基于TRAE打造“天枢·元衡”Token ERP,构建精准计量、分级计费、智能核算的三层度量体系,实现Token成本可算、可控、可审计。
inclusionAI 在 GitHub 开源 Ling Cookbook,为 Ling 系列大语言模型提供部署与开发指南,目前仍在开发中。仓库包含已验证的硬件部署方案,如 Ling-3.0-flash 在单台 NVIDIA DGX Spark 上通过 SGLang(MXFP4/INT4)、vLLM(INT4)及 llama.cpp(GGUF)等框架的推理示例,并附有各方案的量化配置与部署文档。
LangChain 推出 Managed Deep Agents,为开发者提供构建、运行和部署 Deep Agents 的托管方式,内置运行时、流式传输、沙箱、评测、记忆和认证功能。该服务旨在降低智能体开发与运维的复杂度,让开发者无需自建基础设施即可投入生产环境。
RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工(含非技术人员)交付了可运行项目。
Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。
Amtrak 正为 50 多年来最大规模转型构建数据骨干,将每列新列车组视为数据生成资产。该智能平台连接列车运营与维护数据,支撑其现代化改造。具体技术架构与部署细节未在原文中展开。
Databricks 的 serverless 平台每天启动数千万台 VM,其网络配置交付机制面临规模挑战。文章介绍了该平台如何高效完成这一交付过程,确保大规模基础设施的稳定运行。
加拿大最大铁路网络之一借助 Databricks 的 Genie Code 将数据管道创建规模化,覆盖约 20,000 英里铁路线路。该方案通过自然语言生成代码,显著降低工程门槛,使更多团队能自主构建管道,提升数据工程效率。
LangSmith Bring Your Own Cloud 现已在 AWS 上正式全面可用,让企业团队能在自己的 VPC 内获得托管的可观测性、评估和部署能力。
Claude Platform 的 Compliance API 现可返回用户设备上 Cowork 和 Claude Code 会话的转录记录,面向 Claude Enterprise 组织开放测试。新增三个端点分别用于列出组织内会话、获取单个会话元数据及返回其转录内容,均使用现有 Compliance Access Key 和 read:compliance_user_data 权限。
SGLang 与 Miles 在发布首日即支持 Qwen3.8-2.4T-A95B,这是 Qwen 最大的开源模型,总参数 2.4T,每 token 激活 95B,采用混合注意力架构。
百度智能云网络团队与中国科学院计算机网络信息中心合作的论文被计算机网络顶会NSDI'27录用,该届投稿355篇、录用60篇。论文提出BvS虚拟交换机的新一代数据面Sonata,采用软件为中心路线,以标准化接口卸载稳定流量、软件处理复杂流量。生产环境中Sonata将软件CPS提升2.13至2.51倍,开启硬件卸载后提升4.3至11.5倍,热升级抖动控制在数百微秒,已部署于数十万台服务器。
NVIDIA 宣布与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作,建立独立融资平台,旨在长期动员超过 5000 亿美元第三方资本,支持 AI 基础设施建设。
同一事件,精选展示《英伟达联合六大机构融资5000亿美元建AI工厂》Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驱动的 AI 辅助代码转换,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。
NVIDIA 主张以 800 VDC 直流配电替代传统交流多次转换,以降低损耗、支撑 AI 算力扩展。NVIDIA 与 Google、Microsoft 通过 OCP 联合制定该架构,已发布白皮书及 LVDC 固态变压器规范 v0.3,超 80 家设备商正据此开发产品。
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
Model ML 使用 GPT-5.6 Sol 处理金融工作,覆盖从研究与分析到生成可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿的完整流程。
Linear Agent 的价值在于完成未预设的工作,因此团队未为其编写固定路径,而是通过系统提示词、工具设计、产品模型、运行范围及底层自定义 harness 划定边界。系统提示词聚焦沟通风格、硬性边界与产品概念解释;工具设计将约束编码进参数,使无效操作难以执行。团队还引入系统技能作为组合单元,按需渐进加载,避免一次性暴露过多上下文。
Firebird 在亚美尼亚启动独联体地区最大 AI 工厂,由 NVIDIA 加速计算和 Dell Technologies 基础设施驱动,亚美尼亚总理等官员出席开幕式。
现代大语言模型通过长思维链实现强大推理能力,但推理计算成本高昂。投机解码(Speculative Decoding)用快速但不精确的草稿模型提议 token,再由更强的目标模型并行验证,以加速推理。然而,语义等价步骤中的 token 不匹配会导致不必要的拒绝,传统 token 级投机解码因此受限。
持续学习将颠覆现有 AI 监管与对齐范式:模型不再“训练后部署”,而是每日基于数百万次工作会话更新权重,因此监管应转向月度或季度风险检查,而非部署前一次性评估。技术对齐需解决权重持续更新下的越狱与恶意注入问题。个性化权重服务的算力经济将偏向大型组织,个人以 batch size 1 服务自身可能面临 100 倍以上的算力效率惩罚。
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
另有 3 家信源报道X:蚂蚁百灵 (@AntLingAGI)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)Claude Code v2.1.224 发布,新增自托管环境功能,可将自有机器或容器作为 Team 和 Enterprise 计划下 Web、移动端及桌面会话的运行场所。该版本还支持跨会话消息互发、从 HTTPS zip 安装插件,并移除了每会话 200 个子智能体的生成上限。此外修复了沙箱文件系统拒绝规则可被绕过、长项目路径串会话等多项问题。
百度智能云凭借百度千帆在模型聚合接入、推理交付、智能调度、计价运营、韧性保障和安全合规等方面的综合能力,成为首批通过“可信Token云服务——模型聚合与Token管理平台”评估的云厂商。百度千帆Agent Infra提供全模型生态、极致推理效能(推理速度比市场水平提速25%)、精细计量优化、高韧性强保障和全链路安全防护五大能力。2026年上半年,百度智能云以近14亿元的中标金额位居行业第一。
OpenRouter 提供 6 项控制措施来管理团队 AI 支出,涵盖预算、每密钥限额、模型/供应商白名单、Guardrails、工作区预算和 Activity 仪表盘。
Claude Platform 为 Managed Agents 会话新增预算硬上限,按公开列表价计费,达到上限后会话暂停并返回 budget_reached 停止原因,调整或移除预算可恢复。会话可配置顾问模型,供主线程在推理中途咨询战略建议。此外,可在创建智能体时设置 inference_geo 控制推理地域,并支持从 GitHub 仓库自动加载技能。
OpenRouter 推出五项团队 AI 支出控制功能:组织共享信用池、预设模型范围、每密钥限额、护栏(成员预算和模型白名单)及活动仪表盘。本指南按顺序介绍设置流程,包括创建组织、配置预设、通过 Management API 密钥设置每日/每周/每月限额。组织默认支持最多 10 名成员,标准按需付费账户购买信用时收取 5.5% 平台费。
Moonshot AI 的 Kimi K3 现已通过 Unity AI Gateway 在 Databricks 上可用。一年前最好的开放权重模型与专有模型仍有差距,如今这一差距已显著缩小。Kimi K3 的加入进一步丰富了 Databricks 平台上的开放权重模型选择。
美团无人机在2026上海国际低空经济博览会上展出低空物流解决方案,截至2026年6月底已在深圳、北京、上海、香港、迪拜等城市累计完成超100万单配送。方案涵盖坪降、索降、柜降三种模式,其中四代无人机M-Drone 4L Winch最大索降高度15米,智能调度系统云枢M-DaaS 3支持上千架无人机同时调度,异常处置成功率98%。美团无人机已面向全国授权服务商开放解决方案能力。
百度沧海·存储团队与北京大学、阿姆斯特丹自由大学合作的论文《MetaDB》入选NSDI'27 Operational Systems Track。该系统让底层数据库理解目录树结构,高并发同目录操作下吞吐最高提升10.7倍,已在百度智能云生产环境稳定运行超5年,支撑EB级存储规模。
SpaceXAI 上季度资本开支 183.7 亿美元,其中 158.3 亿美元投向 AI,接近微软同期总资本开支的 40%。其运营现金流仅覆盖资本开支的 12%,主要靠举债和股权融资,而微软覆盖率达 155%。公司股价较 6 月峰值腰斩,6 月发行的 250 亿美元债券各期限均跌破面值。
Meta 推出多阶段序列模型,将离线用户建模与在线排序解耦,并采用密集 token 化与目标感知注意力,使序列学习具备可预测的 LLM 式扩展定律。该架构已为 Instagram 转化率带来 6% 的累计提升,Facebook 转化率提升 3%、广告点击量提升 3.5%,并成为 Meta 生成式广告推荐模型(GEM)的核心组件。