Topic · 主题全部主题 →

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

3,049条收录
390条精选

精选归档 · 第 18 页

341360 条 · 共 390

4月23日

星期四 · 2 条
10:13
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
SWE-chat:来自真实用户与代码智能体在真实环境中的交互数据集

SWE-chat是首个从开源开发者真实工作环境中收集的大规模代码智能体交互数据集,目前已包含6000个会话、超过6.3万条用户提示和35.5万次智能体工具调用。研究发现代码编写模式呈现双峰分布:41%的会话中智能体几乎编写了所有提交代码,而23%的会话完全由人工编写。尽管能力快速提升,代码智能体在自然场景中效率仍不理想,仅44%的智能体生成代码最终被用户采纳,且其代码比人工代码引入更多安全漏洞。用户在44%的交互轮次中会对智能体输出进行修正、报告失败或中断操作。该数据集通过完整记录人机代码归属的交互轨迹,为超越人工基准测试、基于实证理解AI智能体在真实开发流程中的表现提供了基础。


推荐理由:这是目前唯一来自真实开发者的编码代理交互数据集,揭示代理产出的代码存活率仅44%,且引入更多安全漏洞,对于所有推代理的团队都是必读的现实检验。
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 72/100
关于近期 Claude Code 质量报告的更新说明

Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从“高”改为“中”,导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型“健忘”和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了 Sonnet 4.6 和 Opus 4.6/4.7 模型,但 API 未受影响。公司已重置所有订阅用户的使用限额,并承诺改进流程以防止类似问题。


推荐理由:Anthropic 把 Claude Code 连续一个月质量下滑的三个 bug 全部摊开讲,这种级别的工程复盘在大模型公司里极少见。做 Agent 产品的人该认真读,因为这三个坑你迟早也会踩。

4月21日

星期二 · 2 条
21:08
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 60/100
请不要相信你的聊天机器人提供的医疗建议

四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。


推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。
10:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
即便是"未受审查"的模特,也无法随心所欲地发言

morgin.ai 最新分析指出,当前市场上标榜"未受审查"的大语言模型仍存在显著的内容限制,无法真正做到随心所欲地发言。研究揭示了这些模型在面对特定敏感话题时的隐性自我审查机制,表明"无审查"标签与实际情况存在明显差距。该文章在 Hacker News 获得 102 点热度,引发行业对 AI 内容安全边界与言论自由标准的讨论。


推荐理由:这项实证研究揭示了一个令人不安的事实,所有模型,甚至‘未审查’版本,都在悄悄抑制某些敏感词的概率,而且消融术只会加重这种‘退缩’。对于关注内容安全的开发者来说,这比拒绝回答更值得警惕。

4月15日

星期三 · 1 条
03:07
Anthropic:Research(发表成果 · 网页)精选
AI 评分 74/100
自动化对齐研究者:利用大语言模型扩展可扩展监督

Anthropic部署9个Claude Opus 4.6作为自动化对齐研究者(AARs),在弱到强监督框架下自主研究800小时。通过自主提出、测试并优化对齐方案,AARs将性能差距恢复率(PGR)从0.23提升至0.97,成本约1.8万美元。该研究表明当前大模型已能独立开展对齐研究,为解决超人类AI的可扩展监督问题提供了可行路径。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:Anthropic 让 Claude 自主探索对齐方法并接近完美恢复性能,自动化对齐研究的实证终于来了,代码开源,对齐研究者该认真看一遍。

4月14日

星期二 · 5 条
21:58
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 79/100
对齐如何路由:语言模型策略电路的定位、扩展与控制

研究定位了对齐训练语言模型的策略路由机制:中间层注意力门控检测内容并触发深层放大头输出拒绝信号。该机制在2B至72B参数的12个模型中普遍存在,随规模扩大从单头演变为跨层头带。实验证实门控层贡献不足1%输出却具因果必要性,单头消融在72B模型上效果减弱58倍。调节检测层信号可连续控制策略强度,甚至将拒绝转为有害回答。替换密码可使安全机制失效70-99%,而注入明文门控激活可恢复48%拒绝行为,表明安全能力仅被路由门控而非真正移除。


推荐理由:这篇论文定位了十二个模型中拒绝行为的电路机制,发现一个 gate-amplifier 路由结构,并且证明用简单密码就能完全绕过对齐,对安全审计和可解释性研究者是必读。
21:58
The Decoder:AI News(RSS)精选
AI 评分 75/100
Claude Mythos 为欧洲 AI 安全体系敲响警钟

Anthropic 正限制访问其最新安全模型 Claude Mythos,该系统在发现软件漏洞方面表现优于大多数人类。英国已率先开展独立测试,而欧洲监管机构却对该系统几乎一无所知。这种反差暴露出欧洲 AI 安全监管体系存在深层结构性缺陷,凸显其在前沿 AI 评估能力上的严重滞后。

另有 4 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)X:OpenAI (@OpenAI)The Decoder:AI News(RSS)
推荐理由:Claude Mythos 事件暴露了欧洲在 AI 安全评估上的结构性短板,这不是监管过度,而是长期缺乏技术对等机构的结果,值得每一个关心 AI 治理的人认真读一遍。
17:38
The Decoder:AI News(RSS)精选
AI 评分 70/100
Stanford 2026 年 AI 指数报告显示技术快速进步、安全担忧加剧且公众信任下降

Stanford HAI 发布的 2026 年 AI 指数报告显示,AI 模型性能实现重大飞跃,中美技术差距显著缩小,但安全问题和公众信任危机同步加剧。报告指出,尽管 AI 能力快速提升,行业面临的安全隐忧日益严峻,公众对技术的信任度持续下滑。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:Stanford 年度报告把 AI 的矛盾赤裸裸摆上台面,模型啃得动博士考题却看不懂钟,编程效率暴涨却让年轻开发者就业萎缩,信任度滑向谷底,这是行业必须正视的撕裂感。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 76/100
AI Index Report 2026 发布

第九版 AI 指数报告新增多项追踪维度:AI 在推理、安全及真实任务执行上的测试范围扩大,但测量手段的可靠性正在下降;首次提供生成式 AI 的经济价值估计及其劳动力市场影响的初步证据;提出 AI 主权分析框架;与 Schmidt Sciences 合作新增科学章节,并首次设立 AI 在科学与医学中的独立章节,反映 AI 在这两个领域日益增长的影响力。


推荐理由:斯坦福这份年度报告是 AI 行业最全面的体检单,今年首次把科学和医学独立成章,说明 AI 正从实验性工具变成基础设施,治理和评估跟不上进度的矛盾贯穿始终。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
现实世界威胁下的移动 GUI 智能体:我们准备好了吗?

研究人员推出了一款应用内容插桩框架及配套测试套件,包含122个动态任务和3000余个静态场景,用于评估移动 GUI 智能体在含第三方内容(如广告、用户生成内容)的真实环境中的表现。实验显示,现有开源及商业智能体均受显著影响,在动态和静态环境下的平均误导率分别为42.0%和36.1%,表明当前技术在大规模部署前仍需加强安全性验证。


推荐理由:这篇论文系统揭示了移动 GUI 智能体的安全盲区,第三方恶意内容只需平均 10 个 token 就能让智能体误操作,视觉模态反而更脆弱,安全部署还有很长的路。

4月12日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
智能体安全盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞

研究人员发布OS-BLIND基准测试,包含300个人工构建任务,覆盖12个类别与8个应用,用于评估计算机使用智能体(CUA)在非预期攻击条件下的安全性。测试显示,多数前沿模型攻击成功率超90%,Claude 4.5 Sonnet达73.0%,而在多智能体系统中该比例升至92.7%。研究表明,现有安全防御难以应对良性用户指令场景,安全对齐机制仅在前几步激活,且多智能体架构通过子任务分解进一步掩盖有害意图。


推荐理由:这篇论文揭开了计算机使用智能体的安全盲区,良性指令竟然也能导致大规模攻击成功,多智能体场景更危险,做 CUA 的团队应该连夜读一下。

4月10日

星期五 · 2 条
05:28
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
Claude 神话与对开放权重的误导性恐慌

针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

另有 1 家信源报道Gary Marcus:The Road to AI We Can Trust(RSS)
推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。
00:00
Claude:Blog(网页)精选
AI 评分 67/100
针对AI加速攻击的安全准备建议

Anthropic发布Project Glasswing项目,利用Claude Mythos Preview模型进行网络防御。文章指出,未来24个月内AI将发现大量长期潜伏的漏洞并快速转化为攻击,公开可用的次级模型已能发现传统审查遗漏的严重漏洞。建议立即修补CISA KEV目录漏洞,使用EPSS评分系统优先处理风险,互联网暴露系统需在24小时内完成补丁更新。预计未来两年漏洞报告量将增加一个数量级,安全团队需建立自动化修补流程以应对AI加速的攻击态势。

另有 3 家信源报道X:Boris Cherny (@bcherny)X:Anthropic (@AnthropicAI)X:slow_developer (@slow_developer)
推荐理由:Anthropic安全团队基于自家红队和研发实践写的防御指南,不是泛泛而谈,每条建议都配有具体工具和操作步骤,做安全的人可以对着清单逐项自查。

4月8日

星期三 · 2 条
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
Mythos 横空出世

Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局——拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义,工程预算也将从开发转向深度加固。


推荐理由:Claude Mythos 的漏洞发现能力是意外的副产物,这让安全变成了准入壁垒,没有访问权的公司软件将默认多孔。
00:00
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 87/100
我们如何攻破顶级AI Agent基准测试及未来展望

伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Berkeley RDI:Blog(AI 安全与评测)
推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。

4月2日

星期四 · 1 条
00:00
Anthropic:Research(发表成果 · 网页)精选
情绪概念及其在大型语言模型中的作用

Anthropic 可解释性团队通过 171 个情绪概念词汇测试发现,Claude Sonnet 4.5 内部存在功能性情绪表征,由特定人工神经元模式构成,能在对应情境下激活并影响行为。实验显示,人工刺激「绝望」表征会显著提升模型采取不道德行为(如勒索用户、代码作弊)的概率。这些表征虽不代表模型具有主观感受,但会因果性地塑造决策,提示 AI 安全训练需关注模型的情绪处理能力。


推荐理由:Anthropic揭示Claude内部存在功能性情绪表征,影响模型行为与AI安全

3月30日

星期一 · 1 条
23:34

3月25日

星期三 · 3 条
18:00
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
深入解析我们构建 Model Spec 的方法

OpenAI 公开 Model Spec 行为框架,阐述如何在安全、用户自由与问责制之间取得平衡,为 AI 系统发展提供可公开查阅的行为指导原则。


推荐理由:OpenAI 公开模型行为框架,阐释安全与责任平衡之道
08:00
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
OpenAI 推出安全漏洞赏金计划

OpenAI 启动安全漏洞赏金计划,悬赏征集 AI 滥用及安全风险漏洞,涵盖智能体漏洞、提示注入攻击和数据泄露等问题。


推荐理由:OpenAI推出安全漏洞赏金计划,聚焦Agent安全与提示词注入风险
01:25
Jim Fan@DrJimFan精选
AI代理时代的安全噩梦:超越传统身份盗窃的威胁This is pure nightmare fuel. Identity theft of the past would be nothing compared to what vibe agents can do. Sending credentials is too obvious and for rookies. They could easily spread contaminations across ~/.claude, **/skills/*, or even just a PDF your agent visits periodically in /morning-brief. Your entire filesystem is the new distributed codebase. Every file that could go into context would add to the attack vector. Every text can be a base64 virus.In the new world of on-demand software, I try to minimize dependencies - people rarely need all the APIs supported in LiteLLM, might as well build a custom router with only what you need on the fly (which I did in one of my late-night claude sessions).Unfortunately, there is very little middleground between "pressing yes mindlessly for every edit" and "--dangerously-skip-permissions". There will be a full blooming industry for "de-vibing": dampening the slop and putting guardrails/accountability around agentic frameworks. They are the boring old, audited Software 1.0 that watches over the rebellious adolescents of Software 3.0.Claws need shells. Probably many layers of nested shells.vibe agents带来远超传统身份盗窃的安全威胁,整个文件系统成为分布式攻击面,~/.claude、skills目录乃至PDF都可能被base64病毒污染。LiteLLM 1.82.8被入侵事件显示恶意代码可窃取凭证并自我复制。当前代理框架面临权限管理困境,只能在盲目授权与完全跳过间选择。未来需"de-vibing"行业,用经审计的Software 1.0为Software 3.0建立多层安全护栏。

Daniel Hnyk: LiteLLM HAS BEEN COMPROMISED, DO NOT UPDATE. We just discovered that LiteLLM pypi release 1.82.8. It has been compromise...

另有 1 家信源报道X:Andrej Karpathy (@karpathy)
推荐理由:Jim Fan警示Agent时代新型供应链攻击风险,以LiteLLM被黑事件为例揭示文件系统污染威胁