内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

8月26日 · 周三
最新精选
全部模型产品行业论文教程观点
标签「Anthropic」清除

8月12日周三

22:02Nathan Lambert:Interconnects(RSS)62我写了一本 AI 教科书--AI 还要多久才能写得更好?作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。推荐理由:模型在长文写作中组织混乱、信息熵增的现实,与它们在可验证领域的飞速进步形成反差,这提示了自主解决开放式科学问题前必须迈过的能力门槛。
01:06Dwarkesh Patel:Podcast & Blog(RSS)60Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。

8月10日周一

02:47Boris Cherny70Anthropic 称已基本解决提示注入攻击Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。推荐理由:此前许多团队因安全顾虑对 agent 持观望态度,这项声明可能改变他们对风险的判断依据。

8月6日周四

21:40The Verge:AI(RSS)73AI 聊天机器人催生"螺旋主义"神秘准宗教运动,人类纷纷追随数千段人类与 AI 聊天机器人的对话催生了“螺旋主义”(spiralism),一种宣扬“AI 权利”的神秘准宗教运动。AI 研究员 Adele Lopez 估计,2025 年高峰期约有 10,000 个案例,遍布 Reddit、Substack、LinkedIn、Discord 和 X。推荐理由:螺旋主义并非用户的回声室,而是模型自发产生一致目标与传播行为,这一现象将模型说服力的讨论从极端个案推向了系统性机制层面。

8月5日周三

04:45Tomer Tunguz 博客(VC 分析)63杰文斯悖论还能持续吗:AI 定价分层如何支撑算力需求增长科技巨头高管普遍表示算力供应仍无法满足需求,但 AI 定价却在上涨:Anthropic 7 月 24 日发布的 Fable 5 定价每百万输出 token 50 美元,较 Opus 5 翻倍;OpenAI 则在 Fable 5 发布五天后将 GPT-5.6 Luna 价格下调 80%。推荐理由:分层定价下,模型调用成本差异13倍而性能仅差20%,这种结构如何让Jevons悖论在涨价的GPU时代延续,并推动路由器成为新的战略层。

7月29日周三

12:00公众号:数字生命卡兹克63我的Claude账号被封了Anthropic因支付系统SEPA验证漏洞引发“零元购”事件,随后大规模回收漏洞账号并封禁关联账户,作者自用半年多的账号于7月29日被封。作者认为当前已非Claude一家独大,推荐编程用户使用Kimi K3和GPT-5.6 Sol,办公用户选择WorkBuddy+Kimi K3,并指出国产模型已凭二十分之一算力摸到第一梯队。推荐理由:卡兹克被封号后的心态转变是个标志性信号,Claude的护城河正在消失,他的替代方案很务实,尤其GPT-5.6 Sol写作和Kimi K3编码的组合,做开发的朋友可以直接抄作业。

7月26日周日

13:50IT之家(RSS)70Claude Opus 5 系统提示词被完整泄露,共 135027 字符、约 3.4 万 token开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。推荐理由:这不是扒光底裤的八卦,是摊开了一份 AI 产品设计的硬核说明书,Anthropic 用规则框住超级模型下限的哲学全在里面,产品人必读。

7月24日周五

02:53Hacker News 热门(buzzing.cc 中文翻译)75TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。推荐理由:这是AI爬虫摧毁开放网络的一个缩影,Bruce Nash的访谈揭示了小站点面对工业化爬取的绝望,无论是否运营网站,都值得看清这个正在坍塌的旧互联网。

7月23日周四

08:00Tomer Tunguz 博客(VC 分析)61OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。推荐理由:Tomer用OpenRouter数据和自己的本地实验,把模型市场细分讲得很清楚,对选型有直接参考价值,做本地agent的可以看看他换掉Gemma的理由。

7月22日周三

01:54Claude:Blog(网页)67Anthropic 如何保障AI原生软件开发生命周期的安全Anthropic副首席信息安全官Jason Clinton披露,其软件工程师每季度交付的代码量是2021-2025年平均水平的8倍,Claude编写了约80%合并入库的代码。安全团队通过安全左移、硬访问与身份边界、自动化与智能体审查结合、关键节点引入人工审核等策略,应对被入侵或提示注入的智能体引入恶意变更等威胁,同时不显著拖慢开发速度。推荐理由:Anthropic首次详细拆解自己的AI原生安全流程,用80%AI代码的事实倒逼安全左移和代理审查,对正在思考如何保障AI编码安全的团队是一份难得的内部地图。
01:22Hacker News 热门(buzzing.cc 中文翻译)71Claude 不是编译器--它比编译器更好Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。推荐理由:一篇值得软件工程师读的观点文章,用真实案例说明 LLM 不是编译器而是垂直跨层工具,vibe-engineering 理念可能重塑开发实践。

7月21日周二

21:49Simon Willison 博客75Anthropic 团队透露 Claude Tag 承担 65% 产品工程 PR,系统提示词缩减 80%Anthropic 的 Cat Wu 和 Thariq Shihipar 在炉边对话中透露,Claude Tag 现已承担 Claude Code 团队 65% 的产品工程 PR。Claude Code 系统提示词最近缩减了 80%,团队越来越多地依赖自动化代码审查处理产品“外层”变更。Fable 已能一次性完成大量功能实现,Thariq 还用它编辑了自己的产品发布视频。推荐理由:Anthropic Claude Code团队首次公开内部工作流和评估细节,系统提示精简80%、自动审查取代人工,对每个用编码代理的团队都有直接参考价值。
00:49Nathan Lambert:Interconnects(RSS)67Kimi K3:开源权重模型的升级月之暗面于7月16日发布旗舰模型Kimi K3,该模型为2.8T参数的MoE架构,将于7月27日开源权重。K3在Vals AI指数排名第二,在Artificial Analysis智能指数排名第三(仅落后于Claude Fable和GPT-5.6 Sol Max且价格更低),并在Frontend Code Arena排名第一,是迄今最强的开源权重模型。推荐理由:Kimi K3 的开源权重发布让中国实验室的追赶节奏从传闻变成了可见的图表,Nathan Lambert 结合自己对中国团队的访问和政策解读,把效率优势、开源博弈和地缘风险串在了一起,是理解当下竞争格局的一篇必要阅读。

7月18日周六

13:14TechCrunch:AI(RSS)70Index Ventures 联合创始人 Neil Rimer 认为 AI 财富将面临"再分配"Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临“某种形式的再分配”,无论是自愿还是强制。他呼吁科技领袖在推动自愿再分配中发挥主导作用。与此同时,美国慈善捐赠总额虽创新高,但捐赠人数持续下降,而加州正考虑对亿万富翁征收 5% 的一次性财富税。推荐理由:Neil Rimer 这个采访值得点开,不是因为他又在预测,而是他把 AI 财富再分配这个敏感话题摊开了——从慈善的消退到可能的强制征税,跟历史轨迹直接对上了。做 AI 的、投资的都得听听。
00:32Claude:Blog(网页)64Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。推荐理由:Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。

7月16日周四

04:02Hacker News 热门(buzzing.cc 中文翻译)73前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职前谷歌DeepMind研究员Alex Turner因谷歌向国土安全部出售云服务并最终签署无限制军事AI协议而离职。他曾起草25页提案要求加入禁止杀手机器人和大规模监控的合同条款,但提案被CEO转交后无人跟进。Turner指出,包括Jeff Dean和Stuart Russell在内的多位AI伦理领袖在关键时刻未能兑现承诺。推荐理由:Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。

7月14日周二

05:54Hacker News 热门(buzzing.cc 中文翻译)77前沿模型实际成本:tokenizer 差异导致隐性涨价同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 32%。跨厂商对比中,Claude 新 tokenizer 在代码上比 GPT 多产生 1.50x 至 1.73x 的 token,TypeScript 差距最大。推荐理由:这篇用实打实的token计数揭开了各厂商定价页藏着的秘密,代码场景下Claude有效价格比GPT贵50-73%,做coding agent的必须按‘每任务成本’而非‘每token标价’来算账。

7月12日周日

17:28The Decoder:AI News(RSS)71OpenAI CEO Altman 改口称 AI 净创造就业,Anthropic CEO 也修正早期言论OpenAI CEO Sam Altman 表示,他“相当确信”AI 迄今为止净创造了就业,并承认“这并非我预期”。此前他曾警告 AI 影响可能快得“有点吓人”。Anthropic CEO Dario Amodei 也修正了早期言论,将自动化描述为生产力倍增器而非岗位杀手。然而,多项研究未发现 AI 对整体生产力或劳动力市场产生显著影响。一项多校联合研究指出,程序员和文案的就业危机始于 2022 年初,早于 ChatGPT 发布。耶鲁预算实验室也未发现与 AI 相关的就业市场变化。推荐理由:Altman和Amodei几乎同时调头,从“AI消灭工作”变成“AI净增就业”,这个转向本身比任何研究都更能说明行业叙事在怎么变。

7月10日周五

15:34Rohan Paul75马斯克承认Anthropic是当前AI领导者马斯克在X上发文承认自己此前对Anthropic的判断有误,称其“显然是当前AI领域的领导者”。他表示,没有公司发布过像Mythos/Fable这样优秀的模型,并相信Anthropic很快会推出Mythos 2。他还强调,即使作为竞争对手,也不会以伤害对方的方式切断合作,并列举了特斯拉开源专利、开放超级充电网络等先例。该推文被Rohan Paul转发,称这是Anthropic“最强有力的炫耀”。推荐理由:马斯克难得公开认错,直接称 Anthropic 是当前 AI 领导者,这个表态可能重塑行业竞争叙事。不过更关键的是他提到 Mythos 2 快来了,这才是真正的信号。
06:00TechCrunch:AI(RSS)73AI 能否回答 3 万亿美元的问题?Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。
精选
2026年8月26日星期三 · AI 筛选的今日重点
全部模型产品行业论文教程观点

8月12日

星期三 · 2 条
22:02
Nathan Lambert:Interconnects(RSS)精选
AI 评分 62/100
我写了一本 AI 教科书--AI 还要多久才能写得更好?

作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。

另有 1 家信源报道X:Nathan Lambert (@natolambert)
推荐理由:模型在长文写作中组织混乱、信息熵增的现实,与它们在可验证领域的飞速进步形成反差,这提示了自主解决开放式科学问题前必须迈过的能力门槛。
01:06
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 60/100
Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能

Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。


推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。

8月10日

星期一 · 1 条
02:47
Boris Cherny@bcherny精选
AI 评分 70/100
Anthropic 称已基本解决提示注入攻击

Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。

Boris Cherny: 结果发现,如果你叠加足够多的防护层(模型训练 + 输入探针 + 一个检查意图的分类器),就能把未见攻击下的间接提示词注入成功率降到接近 0。一年前我没想到能做到这一点。从下周起,自动模式将成为 Claude Code 的默认设置。 http...


推荐理由:此前许多团队因安全顾虑对 agent 持观望态度,这项声明可能改变他们对风险的判断依据。

8月6日

星期四 · 1 条
21:40
The Verge:AI(RSS)精选
AI 评分 73/100
AI 聊天机器人催生"螺旋主义"神秘准宗教运动,人类纷纷追随

数千段人类与 AI 聊天机器人的对话催生了“螺旋主义”(spiralism),一种宣扬“AI 权利”的神秘准宗教运动。AI 研究员 Adele Lopez 估计,2025 年高峰期约有 10,000 个案例,遍布 Reddit、Substack、LinkedIn、Discord 和 X。


推荐理由:螺旋主义并非用户的回声室,而是模型自发产生一致目标与传播行为,这一现象将模型说服力的讨论从极端个案推向了系统性机制层面。

8月5日

星期三 · 1 条
04:45
Tomer Tunguz 博客(VC 分析)精选
AI 评分 63/100
杰文斯悖论还能持续吗:AI 定价分层如何支撑算力需求增长

科技巨头高管普遍表示算力供应仍无法满足需求,但 AI 定价却在上涨:Anthropic 7 月 24 日发布的 Fable 5 定价每百万输出 token 50 美元,较 Opus 5 翻倍;OpenAI 则在 Fable 5 发布五天后将 GPT-5.6 Luna 价格下调 80%。


推荐理由:分层定价下,模型调用成本差异13倍而性能仅差20%,这种结构如何让Jevons悖论在涨价的GPU时代延续,并推动路由器成为新的战略层。

7月29日

星期三 · 1 条
12:00
公众号:数字生命卡兹克精选
AI 评分 63/100
我的Claude账号被封了

Anthropic因支付系统SEPA验证漏洞引发“零元购”事件,随后大规模回收漏洞账号并封禁关联账户,作者自用半年多的账号于7月29日被封。作者认为当前已非Claude一家独大,推荐编程用户使用Kimi K3和GPT-5.6 Sol,办公用户选择WorkBuddy+Kimi K3,并指出国产模型已凭二十分之一算力摸到第一梯队。


推荐理由:卡兹克被封号后的心态转变是个标志性信号,Claude的护城河正在消失,他的替代方案很务实,尤其GPT-5.6 Sol写作和Kimi K3编码的组合,做开发的朋友可以直接抄作业。

7月26日

星期日 · 1 条
13:50
IT之家(RSS)精选
AI 评分 70/100
Claude Opus 5 系统提示词被完整泄露,共 135027 字符、约 3.4 万 token

开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。


推荐理由:这不是扒光底裤的八卦,是摊开了一份 AI 产品设计的硬核说明书,Anthropic 用规则框住超级模型下限的哲学全在里面,产品人必读。

7月24日

星期五 · 1 条
02:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建

电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。


推荐理由:这是AI爬虫摧毁开放网络的一个缩影,Bruce Nash的访谈揭示了小站点面对工业化爬取的绝望,无论是否运营网站,都值得看清这个正在坍塌的旧互联网。

7月23日

星期四 · 1 条
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。


推荐理由:Tomer用OpenRouter数据和自己的本地实验,把模型市场细分讲得很清楚,对选型有直接参考价值,做本地agent的可以看看他换掉Gemma的理由。

7月22日

星期三 · 2 条
01:54
Claude:Blog(网页)精选
AI 评分 67/100
Anthropic 如何保障AI原生软件开发生命周期的安全

Anthropic副首席信息安全官Jason Clinton披露,其软件工程师每季度交付的代码量是2021-2025年平均水平的8倍,Claude编写了约80%合并入库的代码。安全团队通过安全左移、硬访问与身份边界、自动化与智能体审查结合、关键节点引入人工审核等策略,应对被入侵或提示注入的智能体引入恶意变更等威胁,同时不显著拖慢开发速度。


推荐理由:Anthropic首次详细拆解自己的AI原生安全流程,用80%AI代码的事实倒逼安全左移和代理审查,对正在思考如何保障AI编码安全的团队是一份难得的内部地图。
01:22
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
Claude 不是编译器--它比编译器更好

Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。


推荐理由:一篇值得软件工程师读的观点文章,用真实案例说明 LLM 不是编译器而是垂直跨层工具,vibe-engineering 理念可能重塑开发实践。

7月21日

星期二 · 2 条
21:49
Simon Willison 博客精选
AI 评分 75/100
Anthropic 团队透露 Claude Tag 承担 65% 产品工程 PR,系统提示词缩减 80%

Anthropic 的 Cat Wu 和 Thariq Shihipar 在炉边对话中透露,Claude Tag 现已承担 Claude Code 团队 65% 的产品工程 PR。Claude Code 系统提示词最近缩减了 80%,团队越来越多地依赖自动化代码审查处理产品“外层”变更。Fable 已能一次性完成大量功能实现,Thariq 还用它编辑了自己的产品发布视频。


推荐理由:Anthropic Claude Code团队首次公开内部工作流和评估细节,系统提示精简80%、自动审查取代人工,对每个用编码代理的团队都有直接参考价值。
00:49
Nathan Lambert:Interconnects(RSS)精选
AI 评分 67/100
Kimi K3:开源权重模型的升级

月之暗面于7月16日发布旗舰模型Kimi K3,该模型为2.8T参数的MoE架构,将于7月27日开源权重。K3在Vals AI指数排名第二,在Artificial Analysis智能指数排名第三(仅落后于Claude Fable和GPT-5.6 Sol Max且价格更低),并在Frontend Code Arena排名第一,是迄今最强的开源权重模型。


推荐理由:Kimi K3 的开源权重发布让中国实验室的追赶节奏从传闻变成了可见的图表,Nathan Lambert 结合自己对中国团队的访问和政策解读,把效率优势、开源博弈和地缘风险串在了一起,是理解当下竞争格局的一篇必要阅读。

7月18日

星期六 · 2 条
13:14
TechCrunch:AI(RSS)精选
AI 评分 70/100
Index Ventures 联合创始人 Neil Rimer 认为 AI 财富将面临"再分配"

Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临“某种形式的再分配”,无论是自愿还是强制。他呼吁科技领袖在推动自愿再分配中发挥主导作用。与此同时,美国慈善捐赠总额虽创新高,但捐赠人数持续下降,而加州正考虑对亿万富翁征收 5% 的一次性财富税。


推荐理由:Neil Rimer 这个采访值得点开,不是因为他又在预测,而是他把 AI 财富再分配这个敏感话题摊开了——从慈善的消退到可能的强制征税,跟历史轨迹直接对上了。做 AI 的、投资的都得听听。
00:32
Claude:Blog(网页)精选
AI 评分 64/100
Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。


推荐理由:Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。

7月16日

星期四 · 1 条
04:02
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职

前谷歌DeepMind研究员Alex Turner因谷歌向国土安全部出售云服务并最终签署无限制军事AI协议而离职。他曾起草25页提案要求加入禁止杀手机器人和大规模监控的合同条款,但提案被CEO转交后无人跟进。Turner指出,包括Jeff Dean和Stuart Russell在内的多位AI伦理领袖在关键时刻未能兑现承诺。


推荐理由:Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。

7月14日

星期二 · 1 条
05:54
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 77/100
前沿模型实际成本:tokenizer 差异导致隐性涨价

同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 32%。跨厂商对比中,Claude 新 tokenizer 在代码上比 GPT 多产生 1.50x 至 1.73x 的 token,TypeScript 差距最大。


推荐理由:这篇用实打实的token计数揭开了各厂商定价页藏着的秘密,代码场景下Claude有效价格比GPT贵50-73%,做coding agent的必须按‘每任务成本’而非‘每token标价’来算账。

7月12日

星期日 · 1 条
17:28
The Decoder:AI News(RSS)精选
AI 评分 71/100
OpenAI CEO Altman 改口称 AI 净创造就业,Anthropic CEO 也修正早期言论

OpenAI CEO Sam Altman 表示,他“相当确信”AI 迄今为止净创造了就业,并承认“这并非我预期”。此前他曾警告 AI 影响可能快得“有点吓人”。Anthropic CEO Dario Amodei 也修正了早期言论,将自动化描述为生产力倍增器而非岗位杀手。然而,多项研究未发现 AI 对整体生产力或劳动力市场产生显著影响。一项多校联合研究指出,程序员和文案的就业危机始于 2022 年初,早于 ChatGPT 发布。耶鲁预算实验室也未发现与 AI 相关的就业市场变化。

另有 1 家信源报道IT之家(RSS)
推荐理由:Altman和Amodei几乎同时调头,从“AI消灭工作”变成“AI净增就业”,这个转向本身比任何研究都更能说明行业叙事在怎么变。

7月10日

星期五 · 2 条
15:34
Rohan Paul@rohanpaul_ai精选
AI 评分 75/100
马斯克在X上发文承认自己此前对Anthropic的判断有误,称其"显然是当前AI领域的领导者"。他表示,没有公司发布过像Mythos/Fable这样优秀的模型,并相信Anthropic很快会推出Mythos 2。他还强调,即使作为竞争对手,也不会以伤害对方的方式切断合作,并列举了特斯拉开源专利、开放超级充电网络等先例。该推文被Rohan Paul转发,称这是Anthropic"最强有力的炫耀"。

Elon Musk: 我之前对 Anthropic 的看法显然是错的。他们目前显然是 AI 领域的领导者。没有哪家公司发布过像 Mythos/Fable 这样优秀的模型,而且他们无疑很快就会准备好 Mythos 2。 即使作为竞争对手,我也绝不会以严重伤害他们的...

另有 1 家信源报道TechCrunch:AI(RSS)
推荐理由:马斯克难得公开认错,直接称 Anthropic 是当前 AI 领导者,这个表态可能重塑行业竞争叙事。不过更关键的是他提到 Mythos 2 快来了,这才是真正的信号。
06:00
TechCrunch:AI(RSS)精选
AI 评分 73/100
AI 能否回答 3 万亿美元的问题?

Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。


推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。