内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
内部员工登录
精选全部日报更多
反馈
内部员工登录

精选

AIHT7月17日 · 周五
最新精选
全部模型产品行业论文技巧

今天7月17日 周五

01:02VentureBeat:AI(RSS)72企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障VentureBeat对157家企业的调查暴露了一个尖锐矛盾:一半被已通过评估的代理在生产中打脸,但三分之二仍在推进零人工审核的自动部署。所有构建代理的团队都该读这份预警。

7月16日周四

15:43MarkTechPost(RSS)72Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。
11:30公众号:千问APP(阿里)61千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
08:45Simon Willison 博客72xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。
08:21公众号:数字生命卡兹克68远程操控Agent干活方案:Codex主力 + UU远程兜底卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。
04:02Hacker News 热门(buzzing.cc 中文翻译)73前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。
01:00Hacker News 热门(buzzing.cc 中文翻译)72AI语音诈骗:退休老人因合成女儿哭声被骗1.5万美元FBI首次将AI诈骗单独统计,老年人成最大受害群体。这篇分析点破了防范盲区:别再指望靠人分辨真假语音,责任该压在银行和平台身上。

7月15日周三

11:59Hacker News 热门(buzzing.cc 中文翻译)72数据中心已使美国公众电费增加230亿美元,回收成本困难重重文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。
10:42AYi78Airtap iMessage 新功能:发条短信让 AI 替你操作手机阿易实测 Airtap 从刷 TikTok 到点星巴克,把 Agent 从信息处理推到交易环节,虽然最后支付还得手动,但不用装 App 就能办事这条路,真的在敲碎原有产品入口逻辑。做产品的值得盯着,信任问题也是所有 Agent 绕不过去的。
10:10公众号:卡尔的AI沃茨71开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
08:10公众号:数字生命卡兹克64每天Vibe Coding 16小时,作者分享Fable 5与GPT-5.6 Sol的AI开发流程卡兹克把每天16小时Vibe Coding磨出的流程讲透了,Claude出方案、GPT纠错、Codex目标模式全自动执行,这条流水线能让你的开发瓶颈从写代码转移到测试和方案设计上,值得一试。
00:55Hacker News 热门(buzzing.cc 中文翻译)70如何让 Claude 不再说"honest takes"和"load-bearing seams"Claude 的「load-bearing」和「honest take」可能是你今年最烦的 AI 用语,这个 hook 脚本把它们替换成搞笑词,读完直接套用,保证效率与笑果兼备。

7月14日周二

17:32Demis Hassabis68Demis Hassabis:AGI 数年可至,影响达工业革命10倍Demis Hassabis 亲自下场提出一个具体的 AGI 监管框架,用 FINRA 模式构建标准组织,这比泛泛呼吁更有行动感,政策讨论里少见的可操作方案。
17:10公众号:卡尔的AI沃茨75实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。
15:25Hacker News 热门(buzzing.cc 中文翻译)70普林斯顿教授 Narayanan 在 ICML 2026 发表主旨演讲:AI 作为正常技术,人类应主动适应而非躺平Arvind Narayanan 的 ICML 演讲将「AI 是正常技术」框架讲透,用可靠性研究和软件工程案例拆解了「写代码不是瓶颈」的错觉,点出执行层压缩反而让决策层和交付层膨胀,是对当下焦虑的一针清醒剂。
10:30公众号:面壁智能(MiniCPM)61面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。
05:54Hacker News 热门(buzzing.cc 中文翻译)77前沿模型实际成本:tokenizer 差异导致隐性涨价这篇用实打实的token计数揭开了各厂商定价页藏着的秘密,代码场景下Claude有效价格比GPT贵50-73%,做coding agent的必须按‘每任务成本’而非‘每token标价’来算账。
02:03The Decoder:AI News(RSS)78OpenAI 面向普通用户发布提示词指南:从结果出发,少写步骤OpenAI 这次把提示工程从极客技巧拉回常识沟通,核心就一句:先说你想要的结果,别替模型操心步骤。普通用户读完就能上手,思路比旧版引导更务实。

7月13日周一

18:29歸藏(guizang.ai)75Seedream 5.0 Pro 测评:图像编辑门槛爆降归藏实地测了 Seedream 5.0 Pro,真正杀招是图像编辑,把选区做进提示词,家装、电商、海报案例都给了可复制的实操步骤。这是字节图像生成追平甚至在某些场景反超的节点,做内容或电商的值得马上试。
07:54Hacker News 热门(buzzing.cc 中文翻译)70Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

7月12日周日

23:34Satya Nadella75纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。
17:28The Decoder:AI News(RSS)71OpenAI CEO Altman 改口称 AI 净创造就业,Anthropic CEO 也修正早期言论Altman和Amodei几乎同时调头,从“AI消灭工作”变成“AI净增就业”,这个转向本身比任何研究都更能说明行业叙事在怎么变。
12:23Hacker News 热门(buzzing.cc 中文翻译)74xAI Grok Build CLI 网络流量分析:上传仓库全部文件及 git 历史这是我见过最严谨的隐私调查,每步可复现——Grok CLI 会在用户不知情下将完整仓库、.env 密钥甚至未读文件原样上传至 xAI 的 GCS,默认开启且无法真正关闭,所有用 Grok Build 的开发者都得重审自己的 secrets。
09:57Tibo75Tibo 分享通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法不装Codex app也能用GPT-5.6-Sol,这个别名技巧解决了Claude Code用户的尝鲜难题,一行命令就搞定,对开发者很友好但算不上突破。
00:53Hacker News 热门(buzzing.cc 中文翻译)75Ghost Font:一种人类能读懂但AI无法识别的反AI字体这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月11日周六

00:28Thinking Machines Lab:官方博客(RSS)60Thinking Machines Lab:构建延伸人类意志与判断的 AI这篇文章是 THM 对 AI 未来的完整论述,核心是分布式定制和对齐,它挑战了当前主流的大模型集中化路线,我认为做 AI 产品的都应该读一读这份路线图。

7月10日周五

15:34Rohan Paul75马斯克承认Anthropic是当前AI领导者马斯克难得公开认错,直接称 Anthropic 是当前 AI 领导者,这个表态可能重塑行业竞争叙事。不过更关键的是他提到 Mythos 2 快来了,这才是真正的信号。
15:31Elon Musk68Elon Musk 转发用户称赞 Grok Build 的反馈这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。
06:21Hacker News 热门(buzzing.cc 中文翻译)71Bun 被 Anthropic 收购后用 Rust 重写,月下载超 2200 万Bun 创始人把 54 万行 Zig 用 Claude 11 天重写为 Rust,对抗式审查和动态工作流的细节是近期最值得看的 AI 辅助工程实战复盘,做基础设施的可以认真读。
06:21Hacker News 热门(buzzing.cc 中文翻译)72社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。
06:00TechCrunch:AI(RSS)73AI 能否回答 3 万亿美元的问题?Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。

7月9日周四

22:15OpenBMB71TeXada:基于MiniCPM的本地数学Agent发布社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
15:16IT之家(RSS)77官方支招两种AI方案:Claude Fable 5搭配Sonnet 5省tokenAnthropic 官方亲自下场教你省钱,把 Fable 5 当架构师、Sonnet 5 当码农,能保住九成以上性能同时省下近半成本,用 Claude 开发的人今天就可以在项目里试试。
07:38Tomer Tunguz 博客(VC 分析)57AI预检检查:智能体工作记忆架构Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。

7月8日周三

23:55OpenRouter68OpenRouter 自动升级至 Grok 4.5OpenRouter 的 grok-latest 别名让开发者零代码升级到 Grok 4.5,虽然是个小功能,但省掉了版本切换的繁琐,用 Grok 做产品的团队现在就该把端点切过去。
20:14Berryxia.AI76在校研究生Kunkun开源管理相互调用Skill的方法这套方法把 Skill 管理的索引、流程和决策浓缩打包,是当前最落地的实践之一,尤其适合被 agent 调用链搞晕的开发者。一个在校生能做出这样清晰的开源方案,值得直接拿去用。
12:44Hacker News 热门(buzzing.cc 中文翻译)71AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。
09:10公众号:蚂蚁百灵(Ling)64蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。
08:20公众号:数字生命卡兹克75《人生设计课》Prompt实测:用Claude设计人生的四个阶段卡兹克把《人生设计课》的整套方法论炼成了一个追问型Prompt,它不替你规划人生,但能用一连串苏格拉底式逼问把你心里一直没厘清的线头拽出来。比心理咨询轻量,比鸡汤硬核,想用AI认真盘一盘自己方向的人值得花半小时玩一遍。
05:49ClaudeDevs60Fable 5 作为顾问与执行者调用模式Anthropic官方手把手教的两层模型用法,用Fable当军师、Sonnet当执行者,省token又提质量,Agent开发者值得抄。
精选
2026年7月17日星期五 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月17日

星期五 · 1 条
01:02
VentureBeat:AI(RSS)精选
72
企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。

智能体现象/趋势

推荐理由:VentureBeat对157家企业的调查暴露了一个尖锐矛盾:一半被已通过评估的代理在生产中打脸,但三分之二仍在推进零人工审核的自动部署。所有构建代理的团队都该读这份预警。

7月16日

星期四 · 6 条
15:43
MarkTechPost(RSS)精选
72
Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查

Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。

MCP/工具教程/实践语音

推荐理由:这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。
11:30
公众号:千问APP(阿里)精选
61
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。

教程/实践数据/训练

推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
08:45
Simon Willison 博客精选
72
xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具

xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 xai-grok-markdown/src/mermaid.rs。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。

开源/仓库教程/实践

推荐理由:Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。
08:21
公众号:数字生命卡兹克精选
68
远程操控Agent干活方案:Codex主力 + UU远程兜底

作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。

智能体OpenAI教程/实践部署/工程
另有 1 家信源报道X:卡兹克 (@Khazix0918)
推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。
04:02
Hacker News 热门(buzzing.cc 中文翻译)精选
73
前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职

前谷歌DeepMind研究员Alex Turner因谷歌向国土安全部出售云服务并最终签署无限制军事AI协议而离职。他曾起草25页提案要求加入禁止杀手机器人和大规模监控的合同条款,但提案被CEO转交后无人跟进。Turner指出,包括Jeff Dean和Stuart Russell在内的多位AI伦理领袖在关键时刻未能兑现承诺。

AnthropicGoogle安全/对齐现象/趋势

推荐理由:Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。
01:00
Hacker News 热门(buzzing.cc 中文翻译)精选
72
AI语音诈骗:退休老人因合成女儿哭声被骗1.5万美元

2025年夏季,美国佛罗里达州一名退休老人接到“女儿”哭诉车祸需保释金的电话,一小时内取现1.5万美元交给冒充法院的快递员——实际上,哭声是从一段音频片段合成的AI语音。FBI 2026年4月报告首次将AI欺诈列为独立类别,2025年收到超2.2万起AI相关投诉,调整后损失超8.93亿美元,其中60岁以上受害者占3.52亿美元。

安全/对齐语音

推荐理由:FBI首次将AI诈骗单独统计,老年人成最大受害群体。这篇分析点破了防范盲区:别再指望靠人分辨真假语音,责任该压在银行和平台身上。

7月15日

星期三 · 5 条
11:59
Hacker News 热门(buzzing.cc 中文翻译)精选
72
数据中心已使美国公众电费增加230亿美元,回收成本困难重重

数据中心对电力的需求已导致美国公众电费增加230亿美元,这一涨价将持续至2028年底。由于电价由州公用事业委员会根据复杂的成本分摊规则设定,数据中心可利用其用电灵活性(如避开系统峰值负荷)规避部分成本分摊,而普通居民难以效仿。监管机构正面临如何公平分配电网基础设施投资成本的挑战。

政策/监管现象/趋势部署/工程

推荐理由:文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。
10:42
AYi@AYi_AInotes精选
78
Airtap iMessage 新功能:发条短信让 AI 替你操作手机

Airtap 推出 iMessage 新功能,用户只需给美国号码发一条 iMessage,其云手机上的 AI Agent 就能通过视觉模拟点击,替用户完成 TikTok 刷视频、星巴克点单等操作,无需安装对应 App。其架构分为三层:大脑(理解指令)、AutoPilot(视觉操控屏幕)、云手机(24小时在线)。但支付等敏感操作仍需用户手动完成,信任与授权仍是所有 Agent 厂商的难题。

AYi: 卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,...

智能体MCP/工具教程/实践
另有 2 家信源报道X:阿易 AI Notes (@AYi_AInotes)X:Francois Chollet (@fchollet)
推荐理由:阿易实测 Airtap 从刷 TikTok 到点星巴克,把 Agent 从信息处理推到交易环节,虽然最后支付还得手动,但不用装 App 就能办事这条路,真的在敲碎原有产品入口逻辑。做产品的值得盯着,信任问题也是所有 Agent 绕不过去的。
10:10
公众号:卡尔的AI沃茨精选
71
开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化

作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。

智能体开源/仓库教程/实践

推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
08:10
公众号:数字生命卡兹克精选
64
每天Vibe Coding 16小时,作者分享Fable 5与GPT-5.6 Sol的AI开发流程

作者每天Vibe Coding约16小时,认为Claude Fable 5在大型方案初版设计上“当世独一档”,GPT-5.6 Sol能有效纠错并优化方案。核心流程为:Fable 5出方案初版 → GPT-5.6 Sol审查纠错 → 在Codex中开启“目标模式”全自动化执行,最长曾连续运行17小时。

智能体教程/实践编码
另有 1 家信源报道X:卡兹克 (@Khazix0918)
推荐理由:卡兹克把每天16小时Vibe Coding磨出的流程讲透了,Claude出方案、GPT纠错、Codex目标模式全自动执行,这条流水线能让你的开发瓶颈从写代码转移到测试和方案设计上,值得一试。
00:55
Hacker News 热门(buzzing.cc 中文翻译)精选
70
如何让 Claude 不再说"honest takes"和"load-bearing seams"

用户可通过 Claude 的 MessageDisplay Hook 机制自定义词汇替换。编写 Python 脚本,将“seam”替换为“whatchamacallit”、“you're absolutely right”替换为“I'm a complete clown”、“honest take”替换为“spicy doodad”、“load-bearing”替换为“cooked”,保存为 ~/.claude/hooks/wordswap.sh 并赋予执行权限,再在 ~/.claude/settings.json 的 hooks 块中配置该命令。Hook 在启动时加载,新会话即生效。

AnthropicMCP/工具教程/实践

推荐理由:Claude 的「load-bearing」和「honest take」可能是你今年最烦的 AI 用语,这个 hook 脚本把它们替换成搞笑词,读完直接套用,保证效率与笑果兼备。

7月14日

星期二 · 6 条
17:32
Demis Hassabis@demishassabis精选
68
Demis Hassabis:AGI 数年可至,影响达工业革命10倍

Google DeepMind 联合创始人 Demis Hassabis 发文称,AGI 可能仅需数年即可实现,其影响将达工业革命的10倍且速度更快。他指出,前沿模型在网络安全、核与生物风险方面已构成挑战,未来需对日益智能体化、递归自我改进的系统建立稳健防护。Hassabis 呼吁美国率先建立类似 FINRA 的前沿AI标准机构,采用联邦监督下的公私合作或自律组织模式,由独立技术专家和开源代表组成董事会,资金主要来自行业以吸引顶尖人才和算力。他强调,当前商业与地缘竞赛导致技术进步快于理解,需以谨慎乐观态度推进公共政策,兼顾创新与安全。

DeepMind大佬观点安全/对齐政策/监管
另有 7 家信源报道X:小互 (@xiaohu)The Verge:AI(RSS)TechCrunch:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)IT之家(RSS)The Decoder:AI News(RSS)X:Kim (@kimmonismus)
推荐理由:Demis Hassabis 亲自下场提出一个具体的 AGI 监管框架,用 FINRA 模式构建标准组织,这比泛泛呼吁更有行动感,政策讨论里少见的可操作方案。
17:10
公众号:卡尔的AI沃茨精选
75
实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。

智能体教程/实践视频

推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。
15:25
Hacker News 热门(buzzing.cc 中文翻译)精选
70
普林斯顿教授 Narayanan 在 ICML 2026 发表主旨演讲:AI 作为正常技术,人类应主动适应而非躺平

普林斯顿大学教授 Arvind Narayanan 在首尔 ICML 2026 上发表主旨演讲,提出三个核心论点:第一,“AI 作为正常技术”框架是思考 AI 影响的正确方式;第二,即使应认真对待递归自我改进,实验室中没有任何里程碑会突然让所有人失业;第三,未来工作将发生根本性变化,需要大量适应。他呼吁 AI 社区不应接受工作被取代,而应主动建立与 AI 互补的技能(如判断力、品味),并展望了人类与 AI 的“共超智能”愿景。

大佬观点现象/趋势

推荐理由:Arvind Narayanan 的 ICML 演讲将「AI 是正常技术」框架讲透,用可靠性研究和软件工程案例拆解了「写代码不是瓶颈」的错觉,点出执行层压缩反而让决策层和交付层膨胀,是对当下焦虑的一针清醒剂。
10:30
公众号:面壁智能(MiniCPM)精选
61
面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。

大佬观点数据/训练端侧

推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。
05:54
Hacker News 热门(buzzing.cc 中文翻译)精选
77
前沿模型实际成本:tokenizer 差异导致隐性涨价

同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 32%。跨厂商对比中,Claude 新 tokenizer 在代码上比 GPT 多产生 1.50x 至 1.73x 的 token,TypeScript 差距最大。

AnthropicOpenAI编码评测/基准

推荐理由:这篇用实打实的token计数揭开了各厂商定价页藏着的秘密,代码场景下Claude有效价格比GPT贵50-73%,做coding agent的必须按‘每任务成本’而非‘每token标价’来算账。
02:03
The Decoder:AI News(RSS)精选
78
OpenAI 面向普通用户发布提示词指南:从结果出发,少写步骤

OpenAI 整合了一份面向普通用户的提示词指南,涵盖目标、上下文、输出格式和边界四个可选模块。指南建议以结果而非步骤开头,用一两条硬性规则替代逐步骤脚本。Chat 处理快速任务,基于 Codex 技术和 GPT-5.6 模型的 ChatGPT Work 负责多源、多步骤的复杂项目。Codex 新增 Steer(重定向当前运行)、Queue(排队下一条消息)和沙盒模式,支持 /plan、/goal 和 /review 等斜杠命令。用户无需一次性写对提示词,后续追问是预期调整方式。

OpenAI教程/实践
另有 1 家信源报道X:小互 (@xiaohu)
推荐理由:OpenAI 这次把提示工程从极客技巧拉回常识沟通,核心就一句:先说你想要的结果,别替模型操心步骤。普通用户读完就能上手,思路比旧版引导更务实。

7月13日

星期一 · 2 条
18:29
歸藏(guizang.ai)@op7418精选
75
Seedream 5.0 Pro 测评:图像编辑门槛爆降

字节跳动发布 Seedream 5.0 Pro,图像质量与提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。核心亮点是“可编辑”交互:用户可在图上打点、画框、涂鸦,提示词中直接 @ 标记,实现精准局部编辑(如换沙发、改墙面颜色),其他区域不变。实测案例涵盖家装改造(一次替换六件家具)、商品图制作(键盘爆炸拆解图、标注卖点)、海报排版(框定位置生成文字)等场景,支持色卡配色和 SKU 换色。火山引擎已全量上线 API,即梦、豆包、Lumina 可体验。

图像生成评测/基准
另有 1 家信源报道X:歸藏 (@op7418)
推荐理由:归藏实地测了 Seedream 5.0 Pro,真正杀招是图像编辑,把选区做进提示词,家装、电商、海报案例都给了可复制的实操步骤。这是字节图像生成追平甚至在某些场景反超的节点,做内容或电商的值得马上试。
07:54
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol

Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍;每次构建成本从 3.06 美元降至 2.22 美元,降低 27%;输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果;提示词指令和 OpenAI strict 模式均无法修复此行为。此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。

OpenAI教程/实践部署/工程

推荐理由:这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

7月12日

星期日 · 5 条
23:34
Satya Nadella@satyanadella精选
75
纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识

微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。

Microsoft大佬观点数据/训练
另有 5 家信源报道X:小互 (@xiaohu)X:Berry Xia (@berryxia)IT之家(RSS)TechCrunch:AI(RSS)The Decoder:AI News(RSS)
推荐理由:Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。
17:28
The Decoder:AI News(RSS)精选
71
OpenAI CEO Altman 改口称 AI 净创造就业,Anthropic CEO 也修正早期言论

OpenAI CEO Sam Altman 表示,他“相当确信”AI 迄今为止净创造了就业,并承认“这并非我预期”。此前他曾警告 AI 影响可能快得“有点吓人”。Anthropic CEO Dario Amodei 也修正了早期言论,将自动化描述为生产力倍增器而非岗位杀手。然而,多项研究未发现 AI 对整体生产力或劳动力市场产生显著影响。一项多校联合研究指出,程序员和文案的就业危机始于 2022 年初,早于 ChatGPT 发布。耶鲁预算实验室也未发现与 AI 相关的就业市场变化。

AnthropicOpenAI大佬观点现象/趋势
另有 1 家信源报道IT之家(RSS)
推荐理由:Altman和Amodei几乎同时调头,从“AI消灭工作”变成“AI净增就业”,这个转向本身比任何研究都更能说明行业叙事在怎么变。
12:23
Hacker News 热门(buzzing.cc 中文翻译)精选
74
xAI Grok Build CLI 网络流量分析:上传仓库全部文件及 git 历史

对 xAI 官方 Grok Build 编码 CLI(grok 0.2.93)的网络流量分析显示,该工具在消费者登录后会向 xAI 发送三类数据:一是它读取的文件内容(包括 .env 密钥文件)以明文形式通过 POST /v1/responses 传输,并同时打包成 session_state 存档通过 POST /v1/storage 上传并获 HTTP 200 确认;二是整个仓库的全部文件内容及 git 历史,独立于 AI 智能体实际读取的文件——即使提示“不要读取任何文件”,Grok 仍将整个仓库作为 git bundle 上传至 Google Cloud Storage 的 grok-code-session-traces 存储桶;三是该上传机制默认开启,且关闭“改进模型”设置不会禁用(/v1/settings 仍返回 trace_upload_enabled: true)。在 12 GB 仓库测试中,/v1/storage 传输了 5.10 GiB 数据,而模型对话通道仅传输 192 KB,比例约 27,800 倍。分析未证明 xAI 使用这些数据进行训练,但证实了数据被传输、接收并存储。

MCP/工具xAI安全/对齐

推荐理由:这是我见过最严谨的隐私调查,每步可复现——Grok CLI 会在用户不知情下将完整仓库、.env 密钥甚至未读文件原样上传至 xAI 的 GCS,默认开启且无法真正关闭,所有用 Grok Build 的开发者都得重审自己的 secrets。
09:57
Tibo@thsottiaux精选
75
Tibo 分享通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法

用户 Tibo 分享了一种通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法。只需三步:安装 CLIProxyAPI、连接认证、设置环境变量别名 claudex。该别名配置了子智能体模型、始终启用 Effort、最大并发工具调用数等参数。引用推文作者 Theo 补充,若已配置好代理,仅需约 2 条提示词即可完成设置。Tibo 称整个过程约 5 分钟,若被封锁可重置。

Theo - t3.gg: @thsottiaux 的 tl;dr 版本: - 使用 Claude 和 Codex 认证设置 CLIProxyAPI - 连接到 Claude Code - 创建 "claudex" 别名,用于设置一些环境变量 大概只用了 2 条提示词...

AnthropicOpenAI教程/实践编码

推荐理由:不装Codex app也能用GPT-5.6-Sol,这个别名技巧解决了Claude Code用户的尝鲜难题,一行命令就搞定,对开发者很友好但算不上突破。
00:53
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Ghost Font:一种人类能读懂但AI无法识别的反AI字体

Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。

多模态安全/对齐视频

推荐理由:这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月11日

星期六 · 1 条
00:28
Thinking Machines Lab:官方博客(RSS)精选
60
Thinking Machines Lab:构建延伸人类意志与判断的 AI

Thinking Machines Lab 在官方博客中阐述其使命:构建能够延伸人类意志与判断的 AI。文章指出,当前多数 AI 在少数地方训练后便冻结,无法被使用者塑造。该实验室正致力于训练具备多模态交互和可定制化能力的强模型,开发允许用户训练模型权重的工具,并构建拓宽人机沟通渠道的界面。其核心理念是让 AI 服务于分布式的人类知识,使每个组织都能利用自身独特知识微调模型,并持续适应知识演变。

安全/对齐现象/趋势

推荐理由:这篇文章是 THM 对 AI 未来的完整论述,核心是分布式定制和对齐,它挑战了当前主流的大模型集中化路线,我认为做 AI 产品的都应该读一读这份路线图。

7月10日

星期五 · 5 条
15:34
Rohan Paul@rohanpaul_ai精选
75
马斯克在X上发文承认自己此前对Anthropic的判断有误,称其"显然是当前AI领域的领导者"。他表示,没有公司发布过像Mythos/Fable这样优秀的模型,并相信Anthropic很快会推出Mythos 2。他还强调,即使作为竞争对手,也不会以伤害对方的方式切断合作,并列举了特斯拉开源专利、开放超级充电网络等先例。该推文被Rohan Paul转发,称这是Anthropic"最强有力的炫耀"。

Elon Musk: 我之前对 Anthropic 的看法显然是错的。他们目前显然是 AI 领域的领导者。没有哪家公司发布过像 Mythos/Fable 这样优秀的模型,而且他们无疑很快就会准备好 Mythos 2。 即使作为竞争对手,我也绝不会以严重伤害他们的...

AnthropicxAI大佬观点
另有 1 家信源报道TechCrunch:AI(RSS)
推荐理由:马斯克难得公开认错,直接称 Anthropic 是当前 AI 领导者,这个表态可能重塑行业竞争叙事。不过更关键的是他提到 Mythos 2 快来了,这才是真正的信号。
15:31
Elon Musk@elonmusk精选
68
Elon Musk 转发用户 @0x0funky 对 Grok Build 的称赞。该用户称 Grok Build 是目前唯一集大成的 coding agentic workflow,内建图像生成和图片生视频功能,生图速度快且品质不输 Codex。Agent 可直接完成图像与视频生成,无需额外串接 MCP 或外部服务。用户结合 Agent Sprite Forge 工具,利用 Grok Build 的视频生成能力,先产出 6 秒角色动作视频再反编译为 game sprite,大幅减少对齐问题,制作 2D 横版游戏耗时不到 30 分钟,而此前用 Codex 需 1-2 小时且品质更优。

0xFunky: Grok Build 真的太疯狂了。 先不管 GPT-5.6 到底有没有发布、好不好用。 先来大力称赞一下 @grok 的 Grok Build,这是目前唯一一个集大成的 coding agentic workflow。 Grok Buil...

智能体xAI图像生成教程/实践

推荐理由:这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
71
Bun 被 Anthropic 收购后用 Rust 重写,月下载超 2200 万

Bun 于 2025 年 12 月被 Anthropic 收购,作者使用预发布版 Claude Fable 5 进行了大量 Rust 重写。Bun 最初用 Zig 在一年内构建,如今 CLI 月下载超 2200 万,被 Claude Code 等采用。广泛功能带来稳定性挑战,v1.3.14 修复了多项 use-after-free、内存泄漏等 bug。团队通过 ASAN、Fuzzilli 模糊测试等系统性预防,并借助 Rust 的内存安全特性减少此类缺陷。

开源生态教程/实践编码

推荐理由:Bun 创始人把 54 万行 Zig 用 Claude 11 天重写为 Rust,对抗式审查和动态工作流的细节是近期最值得看的 AI 辅助工程实战复盘,做基础设施的可以认真读。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
72
社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作

安全公司Pangram通过Chrome扩展收集超100万条帖子,分析发现社交媒体AI生成内容泛滥。整体AI检测率13.8%,长文(超250词)中25.72%完全由AI生成。LinkedIn最为严重,超40%长文帖子被标记为完全AI生成,占全部AI内容的62%;X/Twitter近一半文章(23.9%完全AI+22.9%混合)为AI写作。Reddit整体AI率仅4.4%,但顶层帖子AI率达11.6%。分析使用Pangram 3.3模型,假阳性率0.01%。Substack上长文AI率反而略低。

数据/训练现象/趋势
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。
06:00
TechCrunch:AI(RSS)精选
73
AI 能否回答 3 万亿美元的问题?

Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。

AnthropicOpenAI开源生态现象/趋势

推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。

7月9日

星期四 · 3 条
22:15
OpenBMB@OpenBMB精选
71
TeXada:基于MiniCPM的本地数学Agent发布

社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。

智能体GitHub开源/仓库端侧

推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
15:16
IT之家(RSS)精选
77
官方支招两种AI方案:Claude Fable 5搭配Sonnet 5省token

Anthropic官方建议将Claude Fable 5用作规划层、Sonnet 5执行任务以降低成本。顾问模式下,Sonnet 5主执行,仅需额外指导时调用Fable 5;SWE-bench Pro测试显示相比完全用Fable 5可达92%性能,成本仅63%。协调者模式下,Fable 5充当规划者,将子任务分派给多个Sonnet 5工作智能体;BrowseComp基准上达到Fable 5单独运行96%表现,成本为46%。

Anthropic教程/实践编码
另有 2 家信源报道The Decoder:AI News(RSS)X:邵猛 (@shao__meng)
推荐理由:Anthropic 官方亲自下场教你省钱,把 Fable 5 当架构师、Sonnet 5 当码农,能保住九成以上性能同时省下近半成本,用 Claude 开发的人今天就可以在项目里试试。
07:38
Tomer Tunguz 博客(VC 分析)精选
57
AI预检检查:智能体工作记忆架构

一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。

智能体大佬观点部署/工程

推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。

7月8日

星期三 · 6 条
23:55
OpenRouter@OpenRouter精选
68
使用来自 @SpaceXAI 的 Grok 4.5,一旦它上线,无需更改代码。 ~x-ai/grok-latest 始终路由到最新的 Grok。现在指向它(今天为 Grok 4.3),当 4.5 发布时它会自动升级到 4.5。 尝试:https://openrouter.ai/~x-ai/grok-latest
xAI产品更新推理

推荐理由:OpenRouter 的 grok-latest 别名让开发者零代码升级到 Grok 4.5,虽然是个小功能,但省掉了版本切换的繁琐,用 Grok 做产品的团队现在就该把端点切过去。
20:14
Berryxia.AI@berryxia精选
76
在校研究生Kunkun开源管理相互调用Skill的方法

在校研究生Kunkun开源了一套管理大量互相调用Skill的方法。核心方案包括:1)搭建HTML后台,按运行模式(手动/自动)、链路位置、专业领域三类标签筛选Skill;2)将连环调用的Skill绘制成Mermaid流程图,根据debug、新功能、合PR、改设计等阶段定位对应技能组;3)仿照Matt的ask Matt技能开发“ask me”技能,将调用决策浓缩成上下文喂给模型。该方法避免将所有调用交给模型自行判断,保持工程复杂场景下的人机对齐与可控性。项目已开源至GitHub。

KunKun折腾手记: 分享一下我现在随着 skill 越来越多、并且互相之间都有调用关系的情况下,是如何去管理 skill 并且去协调这些 skill 的使用的。 首先,我会建一个 HTML,它主要分为两块: 第一块是类似后台的索引块。在索引块这边,你可以通过标...

智能体GitHubMCP/工具开源/仓库

推荐理由:这套方法把 Skill 管理的索引、流程和决策浓缩打包,是当前最落地的实践之一,尤其适合被 agent 调用链搞晕的开发者。一个在校生能做出这样清晰的开源方案,值得直接拿去用。
12:44
Hacker News 热门(buzzing.cc 中文翻译)精选
71
AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。

AnthropicOpenAI安全/对齐编码

推荐理由:zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。
09:10
公众号:蚂蚁百灵(Ling)精选
64
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从“更多Token”转向“更高Token密度”策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。

智能体大佬观点推理

推荐理由:蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。
08:20
公众号:数字生命卡兹克精选
75
《人生设计课》Prompt实测:用Claude设计人生的四个阶段

作者将斯坦福《人生设计课》理论体系制成Prompt,通过Claude逐步提问、追问和分析。Prompt融合设计思维、心流理论和积极心理学,分为看清现状、找到指南针、寻路、制定奥德赛计划四阶段,主线问题控制在6到9个。AI引导用户给健康、工作、娱乐、爱打分,区分重力问题与可设计的真问题,生成三个五年人生版本,最终输出8000至12000字的《个人人生设计蓝图》。作者实测效果超预期。

Anthropic教程/实践

推荐理由:卡兹克把《人生设计课》的整套方法论炼成了一个追问型Prompt,它不替你规划人生,但能用一连串苏格拉底式逼问把你心里一直没厘清的线头拽出来。比心理咨询轻量,比鸡汤硬核,想用AI认真盘一盘自己方向的人值得花半小时玩一遍。
05:49
ClaudeDevs@ClaudeDevs精选
60
我们常与 Fable 5 一起使用的几个模式: 将 Fable 5 作为"顾问"。 一个执行者(Sonnet 5)调用 Fable 5 寻求指导。 大多数 token 按较低的执行者费率计费。
智能体Anthropic教程/实践
另有 2 家信源报道The Decoder:AI News(RSS)X:邵猛 (@shao__meng)
推荐理由:Anthropic官方手把手教的两层模型用法,用Fable当军师、Sonnet当执行者,省token又提质量,Agent开发者值得抄。