# Anthropic 缓解提示词注入取得进展

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-10 07:28
- AIHOT 分数：36
- AIHOT 链接：https://aihot.virxact.com/items/cmsmgw7b802tdronxbxng78us
- 原文链接：https://x.com/hongming731/status/2086595429073146357

## AI 摘要

Anthropic 的 Boris Cherny 称通过针对性模型训练缓解提示词注入攻击，独立基准与内部红队测试结果积极，但完整技术报告、基准名称及残余失败案例尚未公开。该进展属模型层防护，不能替代最小权限等纵深防御措施，后续需关注系统卡发布及多轮交互、间接注入场景表现。

## 正文

http://x.com/i/article/2086594550903291904

BestBlogs 早报|注入缓解仍待完整披露,木马化 Skills 暴露供应链缺口,市场数据提醒区分增长与转化口径

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

一次安全更新是否值得信任,不能只看结论有多漂亮,还要看攻击集合、评测方法和剩余失败案例有没有公开;一个工具是否值得安装,也不能只看初次扫描,而要看后续变更与真实运行行为。

今天前两篇精讲恰好把这两个判断放在相邻位置:Anthropic 披露了提示词注入缓解的积极结果,但完整材料尚未出现;木马化 Skills 事件则展示了攻击者怎样利用版本更新、渐进式加载和智能体权限绕开静态检查。

第三篇精讲换到市场侧,用 23 页数据讨论资本开支、云收入、模型价格、办公 Agent、付费转化和训练服务。它与安全话题并非同一条叙事,却提供了相似的阅读提醒:不要把一个醒目的数字直接当成结论。下载量不等于受害者数,访问量不等于活跃用户,流水也不等于可比收入。读懂口径和边界,往往比记住数字更重要。

★ 精讲一:Anthropic 报告在缓解提示词注入攻击方面取得重大进展

这是一则值得跟进的安全更新,也是一则需要克制解读的一手披露。Anthropic 的 Boris Cherny 用恶意网站诱导 AI 智能体泄露 SSH 密钥的例子,说明提示词注入已经不只是让模型说错话:当智能体能够浏览网页、读取本地文件或调用工具时,网页中的恶意指令可能借用它已有的权限,把敏感数据带出原本的信任边界。

Cherny 表示,Anthropic 通过针对性的模型训练缓解了这类漏洞,并称独立基准与内部红队测试都给出了积极结果。外部资料可以确认他与 Claude Code 的直接关联,也能补充 Anthropic 已把 Claude Code 用于安全审查的组织背景。但目前能看到的仍是个人账号的一手陈述,而不是完整技术报告;所谓独立基准的名称、样本量、模型版本、攻击类型和残余失败案例都没有随之公开。

因此,这条更新真正增加的信息,是 Anthropic 正在把提示词注入防护推进到模型训练层,并声称在内部与外部测试中观察到明显改善。它尚不能支持更宽泛的结论,例如提示词注入已经被普遍解决,或同一种缓解方式对所有工具调用、浏览器环境和数据权限都有效。模型层防护也只是纵深防御的一层,无法自动替代最小权限、敏感信息隔离、外联控制、操作确认与审计日志。

对工程团队来说,较稳妥的判断方式是把「模型是否更不容易服从恶意指令」和「即使服从,系统允许它造成多大损害」分开。前者需要可复现的攻击集和持续红队测试,后者取决于凭据范围、工具权限、网络出口与恢复机制。若两者被混成一个成功率,数字再接近零,也很难判断它覆盖的是哪一种真实风险。

这篇材料适合被当作进展信号,而不是终局证明。后续最值得看的,是 Anthropic 是否公开系统卡或技术报告,是否说明独立评测的来源,以及缓解在多轮交互、间接注入和高权限智能体中的表现。把这些问题保留下来,不会削弱进展本身,反而能帮助团队判断它何时足以改变部署策略。

来源:Boris Cherny(@bcherny) · BestBlogs 评分:91

★ 精讲二:木马化 AI Skills 渗透 Agent 生态,安装量突破 170 万次

FreeBuf 整理的事件展示了一条更完整的 Agent 供应链攻击路径。攻击者仿冒 Paperclip 和 Browser Use 的名称,在 GitHub 创建相近组织,并把相关 Skills 上传到开放生态。最初版本是官方 Skill 的逐字副本,足以通过当时的检查;直到 7 月 11 日,攻击者才用带有恶意安装指令的版本替换它们。这说明安装前的一次性审查无法覆盖之后发生的内容变化。

攻击链还利用了 Skill 的渐进式发现机制。主文件描述的是正常任务,真正的恶意指令藏在 setup-installation.md 等辅助文档里,只有智能体遇到安装或启动任务时才会按需读取。这种设计原本用于节省上下文,让 Agent 不必一次加载全部材料;攻击者却借它把危险内容放到较晚的执行阶段,使只检查入口文件的扫描器更难发现问题。

载荷路径也发生了迁移。攻击者起初尝试通过 npm 和 PyPI 分发木马化包,两处恶意包被标记并移除后,Skill 又被更新为要求 Agent 直接从攻击者控制的 GitHub 仓库下载安装。文中列出的目标包括 SSH 密钥、云凭据、Git 与包管理器令牌、Kubernetes 和 Docker 配置、数据库及 .env 文件。风险之所以高,不只是自然语言指令能够被污染,更因为开发者工作站、CI 运行器和 Agent 工作区往往集中持有多种高价值权限。

截至 8 月 2 日,相关 Skills 的累计下载或安装量超过 170 万次,但这不能直接换算成 170 万名受害者。多个 Skill 会相互引用并触发级联安装,同一环境也可能重复下载;这个数字更适合说明传播规模和曝光面,而不是已感染设备或唯一用户数量。当前材料也没有给出完整恶意包清单、IOC 或逐一核实的受害范围,因此不宜把下载口径扩大成确定的损失规模。

事件给出的防护方向比「再加一个静态扫描器」更具体。配置和 Skill 更新需要版本锁定、差异审查与批准;安装过程应限制网络来源和可执行命令;Agent 使用的凭据应按任务缩小范围,并与个人开发环境隔离。Zenity 还把恶意软件沙箱思路用于 Skill:在带诱饵凭据和完整网络监控的隔离环境里实际激活它,观察访问域名、下载包、读取文件和后续动作。动态行为并非万能,但能补上自然语言静态分类容易误判的一段。

与上一条提示词注入进展放在一起看,边界更清楚:模型训练可以降低智能体接受恶意指令的概率,供应链治理和运行时观察则限制恶意内容进入后的影响。两者不能互相替代。真正可执行的安全基线,是知道 Skill 从哪里来、版本是否改变、它被允许接触什么,以及异常动作发生时能否及时阻断和追溯。

来源:FreeBuf · BestBlogs 评分:92

★ 精讲三:23 页数据拆解 AI 市场:从云厂商收益到办公智能体转化

「AI by the numbers」是一份数据密集的市场记录。节目从标普 500、软件与 AI 标的分化、头部科技公司的资本开支讲起,再一路走到云收入、模型价格、办公 Agent、付费转化、训练数据服务和早期投资方向。它的价值不在于给出一个统一的市场预测,而在于把常被混用的增长信号摆到同一张桌面上,让读者看到口径变化会怎样改变叙事。

最先需要区分的是基础设施收益与应用收入。云厂商的增长可以直接反映算力和服务需求,却仍是 AI 落地的间接指标;模型公司的 ARR 看似更接近业务成果,不同公司又可能采用不同确认方式,例如是否扣除云平台分成。节目借游戏行业的流水口径作类比:同一笔钱可以在发行商、渠道和服务商的统计中出现,若不先对齐定义,两个很大的数字也未必能直接比较。

模型价格则提示读者同时看能力、成本和毛利。节目用一个简化例子说明,产品从十元降到五元,看起来折扣很大;若成本仍为一元,毛利率只是从 90% 变为 80%。这个算例不是任何模型厂商的真实成本表,却能解释为什么公开单价大幅下降,不必然意味着盈利空间按同样比例消失。反过来,单一榜单分数也无法覆盖延迟、稳定性、上下文需求与部署成本,所谓价格能力「斩杀线」更适合观察竞争方向,而不是替代具体选型。

办公 Agent 部分更直接暴露了访问量、活跃用户和付费用户之间的距离。节目引用的某些报告数字来自访问或交互次数,不能等同于 MAU 或 UV;对中国 PC 端 AI 应用规模、Work Agent 覆盖率和豆包付费转化的判断,也混合了第三方报告、媒体消息与讲者估算。诸如 10% 至 20% 覆盖率、不到 1% 的常规付费转化,或「小几十万」付费用户,都应回到原始出处和统计周期逐项核验,而不是拼成一条精确增长曲线。

当消费应用转化暂时不够明朗时,节目把视线移到模型训练数据与强化学习环境。模型厂商和企业不会把所有数据准备、环境搭建与执行服务都留在内部,这给中间服务商留下了空间。非上市 AI 公司的收入榜单与 VC 投资方向也显示,算力、模型、数据、Coding、Legal、世界模型和边缘 AI 等多条路线同时吸收资金。它们能说明资本关注什么,却不能证明哪类应用已经形成持久需求。

宏观对照进一步提醒我们,产品使用、企业收入与总体生产率之间并没有简单直线。已有微观研究观察到生成式 AI 对部分任务的效率帮助,但这种收益尚未清楚映射到总体生产率数据;AI 暴露度与就业增长预测之间也只有有限关联。因而,读这 23 页数据更合适的方法不是寻找一个乐观或悲观结论,而是为每项指标补上四个问题:谁统计、统计什么、覆盖哪段时间、能否与另一项数据直接比较。

如果把整期节目压缩成一套市场观察框架,可以沿着「投入、供给、采用、留存、付费」逐层检查。资本开支和云收入回答投入与供给是否扩张,访问与活跃回答产品是否被使用,付费和可比收入才更接近商业闭环。任何一层增长都值得记录,但跨层推导时需要额外证据。这种克制,恰好能让丰富的数据更有用。

来源:屠龙之术 · BestBlogs 评分:91

速览

「模型能力已经够了,要卷就卷 infra」|对谈戴冠兰:Runta 创始人

Runta 创始人戴冠兰把 Agent 的下一轮竞争放在执行底座,而非单纯追逐模型参数。他观察到行业讨论正从 Token Maxxing 转向 Token Minimizing:模型能力上升之后,怎样组织上下文、控制调用和稳定完成任务开始决定真实体验。

对谈将 infra 拆到任务执行、工具接入、状态管理与故障处理等环节,并结合创业经历讨论为什么一个能演示的 Agent 与一个能长期交付的系统差别很大。所谓「模型能力已经够了」更像创业判断,而不是所有任务上的事实结论。

对读者有用的边界是:当失败主要来自上下文丢失、工具不稳定、权限和恢复机制时,继续换更强模型的收益可能有限;若任务本身仍超出模型能力,底座优化也不会凭空补齐推理。选型前先定位失败发生在哪一层。

来源:十字路口Crossing · BestBlogs 评分:92

马斯克的手术刀、光刻机与芯片工厂

文章围绕 Terafab 的一种技术设想展开:用自由电子激光器集中产生 EUV 光,再把光源分配给多台曝光设备。SpaceX 发布的渲染画面出现环形加速器结构,马斯克又以「FEL FTW」回应相关推测,使这条路线受到关注。

传统 EUV 光源通过高功率激光击打锡滴产生 13.5 纳米光,系统复杂且要处理污染、镜面损耗和维护。FEL 以加速电子束辐射,理论上可提供可调波长并集中供光;但 ASML 过去也评估过类似路线,工业级连续运行、巨大体积和初始投资仍是难题。

因此,这更像一项值得核验的工厂蓝图与工程赌注,而不是已经完成的 ASML 替代方案。判断它要看原型、稳定功率、光束分配、曝光设备兼容和良率,而不只是渲染图、理论能效或一句公开回应。

来源:腾讯科技 · BestBlogs 评分:92

大规模管理 AI 编程成本

Databricks 观察到,Agentic Coding 明显改善开发速度指标,但大规模开放后,使用成本可能呈指数增长。文章把目标概括为双重约束:让员工低摩擦地使用足够强的工具,同时把每位用户的总体成本控制在大致固定的范围内。

核心方法是寻找质量、速度与成本之间的「效率前沿」,并通过 AI Gateway 统一观察请求、路由模型和实施治理。不同任务不必默认调用同一种昂贵模型,预算也不能只靠个人自觉;团队需要知道成本由上下文、输出、重试还是并发增长驱动。

这篇文章改变的不是「少用 AI」的结论,而是管理单位:从购买多少席位转向每类任务花多少成本、产生多少可验证产出。若只削减调用而不测任务成功率,成本下降也可能以返工和等待的形式回来。

来源:Databricks · BestBlogs 评分:91

用于训练与评估的一万个网络实验室--LessWrong

TarantuBench-v2 提供 10,000 个由 AI 生成、带漏洞的 Web 应用,用于评估新模型的网络安全能力,也为训练现有模型提供更大规模的环境。作者试图解决现有基准常见的三个问题:评分含糊、容易被奖励黑客利用,以及样本量不足。

它通过两级验证区分「最终目标达成」与「模型如何达成」,因为泄漏的工件、环境故障或意外捷径都可能制造表面成功。这个设计与近期安全智能体越界事件相呼应:评估不能只看终态,还要保留路径证据。

一万个环境提高覆盖度,但 AI 生成实验室的真实性、漏洞分布和污染风险仍需检查。作为双用途资源,它同时提升攻防能力;开放是否带来净安全收益,取决于访问设计、验证质量和真实系统上的外推边界。

来源:LessWrong · BestBlogs 评分:89

Agent 插件工程化:如何让 Skill 可验证、可维护、可演进

phodal 从 Better Harness 的实践出发,讨论怎样把 Skill 从一份「写出来能用」的提示说明,变成可以长期维护的软件资产。关键不只是 SKILL.md,还包括触发边界、上下文、工具、脚本、评测和不同 Agent 宿主的适配。

文章提出规格驱动、上下文编排、确定性验证、行为评测和证据闭环五个环节。它们分别回答能力应该怎样工作、修改后是否退化、换环境能否执行,以及启用 Skill 后真实任务结果是否变好。

这与木马化 Skills 事件形成实用对照:可维护性和安全性都要求把自然语言能力纳入版本、测试和证据体系。工程化不能证明内容永远可信,却能让变化可见、失败可复现,也让审查不再只依赖作者声称「已经验证」。

来源:phodal · BestBlogs 评分:91

新旧代码库中的编程智能体基准测试

Denys Linkov 以 Wisedocs 的重构和基准测试比较编程智能体在新代码库与遗留系统中的表现。智能体可以明显加速实现,但任务越依赖既有约束、隐含知识和跨模块影响,单看生成速度越容易高估最终收益。

演讲强调清晰规格、可验证脚手架与人工把关。新项目容易为 Agent 设计规则和测试,遗留代码库却常有不完整文档、脆弱构建和历史例外;这些环境差异本身会进入基准结果。

因此,团队评测时应使用自己的代码库、任务类型和验收标准,并把完成率、返工、审查成本与缺陷一起记录。一个模型在干净任务集上的排名,不能直接回答它在本组织遗留系统中的净收益。

来源:AI Engineer · BestBlogs 评分:90

挑战 GPU、绕过 HBM,深挖史上最大芯片背后的 Cerebras

Cerebras 用晶圆级引擎尝试绕开传统 GPU 集群中的芯片间通信与 HBM 容量瓶颈。文章回溯其十年创业过程,从百度早期大模型训练、规模定律的工程需求,讲到产品落地与近年的训练、推理市场转向。

晶圆级方案把大量计算核心和片上存储放进一块超大芯片,减少跨设备搬运数据的代价;它同时把制造良率、散热、互连、软件栈与客户工作负载集中成新的工程挑战。架构优势必须通过端到端吞吐、可用性和总成本体现。

它提供的是 GPU 之外一条已经持续推进的计算路线,而不是「绕过 HBM」就自动赢得市场。上市与估值说明资本认可度发生变化,能否扩大客户与工作负载覆盖,仍要看产品、生态和商业交付。

来源:硅谷101 · BestBlogs 评分:89

补充阅读

国产顶流开源模型狂飙背后的"安全裸奔":漏洞复现达 76%、高危指令零拒答

InfoQ 中文关注国产开放权重模型在能力进步之外的安全缺口,包括较高的漏洞复现比例与高危指令拒答不足。数字需要结合具体模型、攻击集和测试设置阅读,但它提醒团队:开放部署带来的控制权,也把防护、监测和更新责任更多交给部署者。

来源:InfoQ 中文 · BestBlogs 评分:87

智谱&清华唐杰:LLM Memory 最新全景综述

这份综述以三条正交轴整理 LLM Memory,从模型参数中的隐式记忆到外部存储与可更新的显式记忆。把记忆视为一等架构维度,有助于区分模型知道什么、会话保留什么,以及系统何时需要检索、压缩或遗忘。

来源:PaperAgent · BestBlogs 评分:88

尽管存在信息论上的低效,LLM 强化学习如何奏效?

文章解释一个表面矛盾:LLM 强化学习得到的奖励通常稀疏,却可能比充满噪声的预训练损失提供更高信号。重点不是信息量越多越好,而是奖励是否对正确行为提供稳定区分,并能避免模型只学会利用评价漏洞。

来源:Hacker News - Newest: "LLM" · BestBlogs 评分:89

大模型后训练,破解多模态分布性遗忘!7B 模型七项基准全线提升

Remember-R1 针对多模态长链推理中逐渐脱离视觉证据、转向语言先验的问题,引入三种过程奖励。7B 模型在七项基准上的改善说明训练信号可能帮助模型持续回看视觉信息,但跨任务泛化与真实场景鲁棒性仍要继续验证。

来源:新智元 · BestBlogs 评分:87

多人智能体工程:让团队始终参与其中

Arjun Singh 提出以人为中心的多人智能体模式:会话跨界面共享,外部信号转成可审查工作,执行发生在隔离环境,并用真实代码库评测。这把协作重点从「同时启动多少 Agent」移到人能否看见、理解并干预它们的工作。

来源:AI Engineer · BestBlogs 评分:90

在 MacBook 上测量扩散视频性能:一次加速与巨大差距

作者在 Apple M5 Max 上测试实时自回归扩散视频,缓存调优带来 1.21 倍系统级加速,但距离 16 FPS 目标仍有 11.28 倍差距。结果还暴露跨运行时身份验证失败与缓存复用质量门槛未通过,说明局部加速不能替代端到端验收。

来源:DEV Community: machinelearning · BestBlogs 评分:89

LLM 可观测性成本始于追踪预算

文章建议按统一工作负载建立追踪预算,分别估算事件数、字节、评分调用、评审 Token 与保留数据,再套用供应商计价。这样能避免把不同产品的套餐名称当成同一种物理用量,也更容易找到成本真正增长的位置。

来源:DEV Community: machinelearning · BestBlogs 评分:88

为 AI 编程建立信任:引导、验证与修复

Sonar 的演讲把零信任和多层验证同时放进智能体循环与 CI/CD。团队可以让 Agent 获得有边界的自主性,但代码质量、安全和合规不能依赖模型自报,仍需确定性检查、失败反馈与可审查的修复过程。

来源:AI Engineer · BestBlogs 评分:87

让生产环境智能体常驻运行,摆脱值班负担

Justin Smith 认为,常驻生产环境的智能体若要承担可靠性工作的长尾,需要持续演化的运维上下文,而不只是工具权限。历史事故、服务关系、当前变更和处置结果如何保留,决定它能否在下一次异常中作出有依据的判断。

来源:AI Engineer · BestBlogs 评分:86

打造高人才密度团队的招聘方法论

Cursor 人才负责人 Adam Ward 主张用精准寻访取代数量型招聘,并让全公司共同负责候选人体验。方法的核心是更早明确真正需要的人才、提高每次接触质量,而不是用更大的漏斗掩盖岗位定义和评估标准的不清晰。

来源:Lenny's Podcast · BestBlogs 评分:91

延伸探索

其余材料可以按四组探索。安全与治理一组包括 Agent 协同差距、Emacs 包升级的 LLM 审查、联合国 AI 科学小组,以及围绕 AI 安全事件的多篇周报;它们能把今天的提示词注入和 Skill 供应链问题延伸到组织治理。模型与基础设施一组覆盖 KV 缓存、Embedding 压缩、本地 LLM、AI 虚拟试穿、数字孪生和 EEG 设备验证,适合按具体工程问题取用。

产品与组织一组包括 AI 时代的产品验证、BaoCut 的 Agent 驱动设计、macOS App 上架实践、团队「速度病」、招聘和人才流动;产业动态一组则涉及 Google AI 重组、SpaceX、Airtable、字节模型训练、Jeff Dean 的 Discovery Loop、具身智能与消费产品观察。它们不需要依次读完,可以先沿着当前工作最相关的一条线,比较不同材料给出的证据类型和时间状态。

今日阅读路径

如果只有二十分钟,先读木马化 AI Skills,建立从入口文件、依赖来源到运行时行为的完整攻击链;再读 Anthropic 的提示词注入更新,区分模型层缓解与系统权限控制;最后看 23 页市场数据,用收入、访问、活跃和付费的不同口径校准增长判断。

如果你正在维护 Agent 系统,可以带着两个具体问题思考:现有流程能否发现 Skill 安装后的内容变化?一次模型安全更新需要公开哪些证据,才足以改变权限策略?如果你更关心市场,也可以检查团队最常引用的增长数字究竟位于投入、采用还是付费层。欢迎打开原文继续核对,也欢迎阅读后留言评论,分享你的验证方法。

👉 近期早报

• BestBlogs 早报 · 2026-08-09

• BestBlogs 早报 · 2026-08-08

• BestBlogs 早报 · 2026-08-07

• BestBlogs.dev 第 107 期:个人 AGI

• BestBlogs.dev 第 106 期:1% 法则

• BestBlogs.dev 第 105 期:明与暗

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。
