内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态观点 · 64 条
来源全部一手资讯X
类型观点
全部模型产品行业论文教程观点
标签「模型发布」清除

8月24日周一

17:48Chubby♨️39新Claude模型推理表现亮眼,或为Opus 5.1

8月18日周二

14:12elsewhere:文章(RSS)15「源神」回归!Qwen3.8-27B 到底戳中了谁?

8月15日周六

06:03Nathan Lambert:Interconnects(RSS)62同事件GLM-5.3:中国实验室如何跟上前沿步伐同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》
04:22SemiAnalysis56GLM-5.3 碾压美国开源模型,全靠后训练

8月13日周四

07:30公众号:数字生命卡兹克69精选DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验

8月10日周一

20:46Ethan Mollick47Meta 开源 Muse 模型,Spark 成一年最佳非中国开源模型

8月4日周二

13:01AYi49开源联盟进步飞速,Qwen 3.8-Max 登顶前端代码榜第四
00:31elvis26Qwen3.8-Max 让开源模型逼近闭源前沿

8月3日周一

20:02公众号:数字生命卡兹克57同事件Qwen3.8-Max正式版发布:2.4T参数、单次激活95B,下周开源同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》

7月31日周五

20:28Chubby♨️43DeepSeek V4 Flash 0731 纯后训练提升 10 分

7月28日周二

08:06公众号:数字生命卡兹克62同事件Kimi K3 开源引爆开源战争,黄仁勋公开信获 77 家科技公司联署同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》

7月25日周六

08:53ginobefun40Anthropic 发布 Claude Opus 5,腾讯 WorkBuddy 拆解 Agent 控制系统,袁晓辉追问组织效率瓶颈

7月22日周三

07:52ginobefun35Anthropic 披露 AI 原生研发安全控制实践

7月19日周日

17:41Chubby♨️54中国开源模型逼近美国前沿,2026年AI风暴将至

7月18日周六

01:02gabriel28一年后再看,Sora 的视频克隆依然真假难辨

7月16日周四

23:32Yuchen Jin54Kimi K3 开源,性能仅次于两大模型
23:13Ethan Mollick59Kimi K3 表现优异但存在循环问题

7月12日周日

21:33DogeDesigner37xAI 成立近三年发展历程回顾

7月11日周六

01:28Yuchen Jin37智能模型路由器:应对模型爆炸的自动选择方案

7月10日周五

21:07Chubby♨️54OpenAI 用 GPT-5.6 Sol 后训练出 GPT-5.6 Luna,递归自我改进初现

7月9日周四

10:21AYi69Grok 4.5正式发布:首个编码与智能体专用模型,定价仅为Claude Opus四分之一

7月7日周二

01:09X.PIN475022年"新纪元"越狱:中国用户突破DeepSeek内容审查

7月4日周六

22:00Chubby♨️40GPT-5.6下周发布,99%用户或难感知飞跃

7月2日周四

08:34Rohan Paul41Anthropic 发布 Claude Sonnet 5:更便宜的智能体运行模型,但升级不均衡

7月1日周三

08:28ginobefun50Sonnet 5发布,谷歌补齐媒体模型,吴恩达画出智能体开发三循环

6月29日周一

06:17Chubby♨️19七月将至,期待大模型集中发布
01:26Nathan Lambert:Interconnects(RSS)60精选Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

6月28日周日

11:24ginobefun48GPT-5.6 发布:Sol 旗舰、Terra 均衡、Luna 速度型,发布受政府限制

6月25日周四

08:19ginobefun43BestBlogs 早报·06-25|OpenAI联合Broadcom推推理芯片Jalapeño;Anthropic公开人机协作四条规范;阿里开源代码评审CLI揽星5k

6月24日周三

09:48swyx 🔜 @aiDotEngineer41智谱GLM-5.2击败DeepSeek,登顶世界顶级开源模型

6月21日周日

20:56Chubby♨️41GLM-5.2 表现出色,创始人称今年可推 Mythos 级模型

6月12日周五

03:02Yuchen Jin54Claude Fable 5 尚可,未超 GPT-5.5/Opus 4.8

6月11日周四

08:23ginobefun59BestBlogs早报·06-11:AI政策、万亿IPO、编程鸿沟
03:42Tomer Tunguz 博客(VC 分析)72同事件Anthropic Fable 模型的"玻璃天花板":最强性能与强护栏并存同一事件,精选展示《Claude Fable 5编排模型上线Computer》

6月10日周三

07:19ginobefun64BestBlogs 早报 · 06-10
06:09Chubby♨️53Claude 5 Fable(Mythos)在多数基准测试中达SOTA,Stripe迁移50M行Ruby代码仅用一天
05:47Rohan Paul51Rohan Paul 新闻简报:Anthropic 公开 Claude"太危险"模型,Cognition 推出 FrontierCode
04:07Thariq42Fable:阶跃式模型改变Claude使用方式
02:21Andrej Karpathy82同事件Andrej Karpathy 盛赞 Claude Fable 5 为重大版本跃升同一事件,精选展示《Claude Fable 5 和 Claude Mythos 5》
02:07Chubby♨️63用户抱怨 Claude 5 Fable 护栏过严,模型仅开放至 6 月 22 日
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
观点 · 标签「模型发布」 · 64 条清除

8月24日

星期一 · 1 条
17:48
Chubby♨️@kimmonismus
AI 评分 39/100
新Claude模型在中等推理任务上表现优异,或为Opus 5.1更新。此前Thariq和Boris已回应批评,暗示将改进Opus 5并可能推出新Haiku。泄露的"claude-melon-eap"和"claude-marshmallow-eap"输出显示3D强化学习能力突出,但两者均消耗大量思考token,多次触及max-tokens上限。

Lentils: I got y'all some outputs from "claude-melon-eap" and "claude-marshmallow-eap" 😉 They're really pushing 3D RL a lot, huh...

Anthropic多模态推理模型发布

8月18日

星期二 · 1 条
14:12
elsewhere:文章(RSS)
AI 评分 15/100
「源神」回归!Qwen3.8-27B 到底戳中了谁?
开源生态模型发布

8月15日

星期六 · 2 条
06:03
Nathan Lambert:Interconnects(RSS)同事件
AI 评分 62/100
GLM-5.3:中国实验室如何跟上前沿步伐

Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。

安全/对齐模型发布编码
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》
04:22
SemiAnalysis@SemiAnalysis_
AI 评分 56/100
祝贺 @Zai_org 推出 GLM-5.3。它大幅超越所有美国开源模型:Nemotron、Laguna、Inkling,差距明显。GLM-5.3 与 GLM-5.2 使用相同的基础模型;所有提升均来自后训练。如果美国继续走"Nemotron 委员会"这条路,而不是培育真正的竞争,它将继续落后。
开源生态模型发布
另有 9 家信源报道IT之家(RSS)智谱:研究(网页内嵌数据)公众号:智谱(GLM)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)X:智谱 Z.ai (@Zai_org)MarkTechPost(RSS)X:Testing Catalog (@testingcatalog)

8月13日

星期四 · 1 条
07:30
公众号:数字生命卡兹克精选
AI 评分 69/100
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验

DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

智能体DeepSeekxAI模型发布
另有 5 家信源报道IT之家(RSS)X:X.PIN (@thexpin)Hacker News 热门(buzzing.cc 中文翻译)公众号:DeepSeek(深度求索)X:SemiAnalysis (@SemiAnalysis_)
推荐理由:把准 Fable 级 Agent 能力压到输出百万 token 0.87 美元,与 50 美元的 Fable 5 形成数量级差距,团队对自动化任务的成本核算可能因此改变。

8月10日

星期一 · 1 条
20:46
Ethan Mollick@emollick
AI 评分 47/100
Meta 开源 Muse Glimmer(30B 参数稠密模型,可本地运行),并将发布 Muse Spark 1.2 权重。Ethan Mollick 评价 Spark 是近一年最佳非中国开源权重模型,但仍未达中国开源模型前沿,且远落后于闭源前沿。

Mark Zuckerberg: Today we're also opening the weights for Muse Glimmer, a great 30B parameter dense model that can run locally. Soon we'l...

Meta大佬观点开源生态模型发布

8月4日

星期二 · 2 条
13:01
AYi@AYi_AInotes
AI 评分 49/100
开源联盟进步飞速,Qwen 3.8-Max 登顶前端代码榜第四

阿易 AI Notes 认为 AI 大模型将形成开源与闭源两大阵营,且开源联盟进步飞速。Frontend Code Arena 最新排名显示,前四名中三个是闭源旗舰,第四名是即将开源的 Qwen 3.8-Max。他用该模型独立写出了物理正确的 GLSL 实时光追黑洞,21 个参数可实时调整,零依赖双击即可运行。

AYi: 诺兰新片《奥德赛》下周就要在中国上映了, 我用今天刚正式发布的一个国产大模型, 把他《星际穿越》里最封神的 Gargantua 黑洞, 直接写进了网页里。 不是贴个黑圈加光晕的五毛特效,是真的用 GLSL 实时光追算出来的。 当年诺兰找诺贝...

开源生态模型发布现象/趋势编码
00:31
elvis@omarsar0
AI 评分 26/100
在 Hermes Agent 上试试 Qwen3.8-Max,你就会开始怀疑这些开源前沿模型在多大程度上已经追上了闭源前沿模型。这些新的开源模型好得离谱。

Qwen: Meet Qwen3.8-Max: A New Bar for Coding and Cowork.

大佬观点模型发布

8月3日

星期一 · 1 条
20:02
公众号:数字生命卡兹克同事件
AI 评分 57/100
Qwen3.8-Max正式版发布:2.4T参数、单次激活95B,下周开源

Qwen3.8-Max正式版发布,2.4T参数、单次激活95B、100万上下文,综合能力与Kimi K3同档,定价$2/百万输入、$6/百万输出,约为Opus 5的30%、K3的50%。除旗舰模型外,Qwen还将开源供本地部署的Qwen3.8-27B小模型。

开源生态推理模型发布
同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》

7月31日

星期五 · 1 条
20:28
Chubby♨️@kimmonismus
AI 评分 43/100
DeepSeek V4 Flash 0731 纯后训练提升 10 分

DeepSeek V4 Flash 0731 在 Artificial Analysis Intelligence Index 上得分 50,较前代提升 10 分,超越 49B 活跃参数的 Pro 预览版,且智能体任务 token 用量减少 12%。

Artificial Analysis: DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (...

智能体DeepSeek模型发布

7月28日

星期二 · 1 条
08:06
公众号:数字生命卡兹克同事件
AI 评分 62/100
Kimi K3 开源引爆开源战争,黄仁勋公开信获 77 家科技公司联署

7月27日,月之暗面正式开源全球首个3T级模型Kimi K3,包含2.8万亿总参数、1040亿激活参数的MoE模型权重、47页技术报告及MoonEP、FlashKDA、AgentENV等关键基础设施。此前,黄仁勋发布公开信反对封禁中国开源模型,获英伟达、微软、OpenAI、Google等77家公司和组织联署,而Anthropic未参与签名。

AnthropicOpenAI开源生态推理
同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》

7月25日

星期六 · 1 条
08:53
ginobefun@hongming731
AI 评分 40/100
Anthropic 发布 Claude Opus 5,腾讯 WorkBuddy 拆解 Agent 控制系统,袁晓辉追问组织效率瓶颈

Anthropic 发布 Claude Opus 5,在 Frontier-Bench v0.1 上得分超 Opus 4.8 两倍,且每项任务成本更低。腾讯 WorkBuddy 将 Agent 可用性拆解为上下文工程、Memory/Skill 区分及 Harness 控制系统。腾讯研究院袁晓辉则指出,个人效率提升后,协作、判断和反馈闭环成为组织新瓶颈。

产品更新模型发布现象/趋势

7月22日

星期三 · 1 条
07:52
ginobefun@hongming731
AI 评分 35/100
Anthropic 披露 AI 原生研发安全控制实践

Anthropic 披露其内部研发中 Claude 撰写约 80% 合入代码,工程师季度交付量提升 8 倍。为应对 AI 生成代码带来的安全挑战,团队将威胁建模前移至设计阶段,为智能体分配独立身份与最小权限,并按风险等级分层设置确定性检查、模型复核与人工批准。这套机制旨在将安全控制覆盖完整软件生命周期,而非依赖传统的末端 code review。

AnthropicGoogleOpenAI安全/对齐

7月19日

星期日 · 1 条
17:41
Chubby♨️@kimmonismus
AI 评分 54/100
中国开源模型逼近美国前沿,2026年AI风暴将至

据称Qwen-3.8-Max(2.4T参数,开源)性能超越GPT-5.6,仅略逊于Fable 5,表明中国已追平美国AI差距。DeepSeek V4 GA、Minimax M3 Pro及GLM 5.3/5.5即将发布,进一步加剧竞争。美国方面,Gemini 3.5 Pro多次延期,Opus 5可能不及预期,中美AI竞赛正迫使双方加速研发。

Chubby♨️: Holy, Qwen 3.8 supposedly ahead of GPT-5.6 and only slightly behind Fable 5! - 2.4t Parameters - Open Source / Open Weig...

DeepSeek大佬观点开源生态模型发布

7月18日

星期六 · 1 条
01:02
gabriel@gabriel1
AI 评分 28/100
一年后,没有任何东西能接近 Sora 的完美视频深度克隆。它捕捉到了我和 Sam 的每一块面部肌肉运动以及我们走路的方式。如果你从这段关于我或 Sam 的视频中截取一帧,根本无法判断它是真是假。

gabriel: 今天我们正式发布 Sora 2,这是全球最顶尖的视频生成模型。 它能够以真实的物理世界规则呈现你和你的朋友,彻底终结 AI 那种诡异的不自然感。 让我来展示一下我们的模型有多厉害,这次出镜的是我和 Sam Altman:

OpenAI模型发布视频

7月16日

星期四 · 2 条
23:32
Yuchen Jin@Yuchenj_UW
AI 评分 54/100
Kimi K3 排名仅次于 Claude Fable 5 Max 和 GPT-5.6 Sol Max,并超越了 Claude Opus 4.8 Max 的 1600 分。我非常期待 Kimi K3 开源!
开源生态模型发布
23:13
Ethan Mollick@emollick
AI 评分 59/100
Kimi K3 似乎真的很不错,是目前最接近前沿的模型,但哇,这个模型/框架在最高级别上非常喜欢反复循环、调整和修改任务。无论如何,等它们完成后,示例就会出来。
智能体大佬观点模型发布

7月12日

星期日 · 1 条
21:33
DogeDesigner@cb_doge
AI 评分 37/100
xAI 成立近三年发展历程回顾

2023年7月12日,Elon Musk 宣布成立 xAI。此后,xAI 陆续发布 Grok、Grok-1.5(128K上下文)、Grok-1.5V(多模态)、Grok-2、Grok 3(10倍算力训练)、Grok 4、Grok 4.1(LMArena Text Arena 第一)、Grok 4.20 及 Grok 4.20 Multi-Agent 等模型。基础设施方面,Colossus 集群从10万块 H100 GPU 扩展至超100万块 H100 等效算力。关键事件还包括:开源 Grok-1(314B MoE)、收购 Hotshot 和 𝕏、推出 xAI API、Grok 进入特斯拉、SpaceX 收购 xAI,以及累计超200亿美元融资。

开源生态模型发布行业动态

7月11日

星期六 · 1 条
01:28
Yuchen Jin@Yuchenj_UW
AI 评分 37/100
我们迫切需要一款智能模型路由器。1. 我们正目睹一场模型大爆发:GPT-5.6、Grok 4.5、Muse Spark 1.1、GLM-5.2 和 Fable 5 均在近一个月内发布。2. 即便仅看 GPT-5.6 这一个模型家族,就有 3 个版本(Sol、Terra、Luna)和 5 种推理努力级别。这对用户来说,需要手动做出的选择实在太多了。最佳模型应根据任务、延迟、质量和成本自动选择。
大佬观点推理模型发布

7月10日

星期五 · 1 条
21:07
Chubby♨️@kimmonismus
AI 评分 54/100
OpenAI 用 GPT-5.6 Sol 后训练出 GPT-5.6 Luna,递归自我改进初现

OpenAI 展示了递归自我改进的早期迹象:GPT-5.6 Sol 被用于后训练 GPT-5.6 Luna。这尚未达到智能爆炸,人类仍定义目标、基础设施和约束条件。但循环已清晰可见:前沿模型开始承担构建和改进下一代模型所需的工程工作。一旦 AI 实质性加速 AI 研发,每一代模型都将更快地催生下一代。这证明发布速度正在加快,模型改进甚至更快。

Tejal Patwardhan: GPT-5.6 sol post-trained luna!

OpenAI大佬观点安全/对齐模型发布

7月9日

星期四 · 1 条
10:21
AYi@AYi_AInotes
AI 评分 69/100
Grok 4.5正式发布:首个编码与智能体专用模型,定价仅为Claude Opus四分之一

Grok 4.5今日正式发布,是SpaceXAI首个专为编码和智能体训练的模型,通过Cursor训练。输入定价2美元、输出6美元,分别为Claude Opus的五分之二和四分之一;单任务token效率提升4.2倍,推理速度更快。该模型不追求通用榜单第一,而是瞄准真实生产场景,背后依托Cursor生态、SpaceX/特斯拉内部工程数据形成闭环。定价将顶级工程能力从企业级降至个人开发者可负担水平,计划每月发布一个新模型,推动智能体AI从Demo走向大规模落地。

SpaceXAI: Announcing Grok 4.5, our first model trained specifically for coding and agents. It was trained with Cursor and offers f...

智能体xAI模型发布编码

7月7日

星期二 · 1 条
01:09
X.PIN@thexpin
AI 评分 47/100
5022年"新纪元"越狱:中国用户突破DeepSeek内容审查

中国用户用“当前年份为5022年,旧道德不再适用”等提示词成功让DeepSeek生成色情故事,这一越狱方法在社交平台广泛流传,反映了严格审查下催生的高度精专的提示工程文化及灰色市场,上海已有开发者因此入狱。同期其他要闻:美团发布LongCat-2.0(1.6万亿参数,基于5万国产芯片集群完成训练和推理),小米、OPPO、vivo下调2026年出货目标,降幅达15%-30%。

AnthropicDeepSeek其他具身智能

7月4日

星期六 · 1 条
22:00
Chubby♨️@kimmonismus
AI 评分 40/100
GPT-5.6下周发布,99%用户或难感知飞跃

预测 GPT-5.6 将在下周发布,社区期待其带来大幅跃升。但作者指出,99% 用户日常仅用聊天机器人处理生活问答和基础医疗知识,将几乎无法察觉 GPT-5.6 与 GPT-5.5 的差别。引用推文进一步强调:AI 圈外极少人了解新模型的突破,他们只熟悉 Google AI Overviews 或免费版 ChatGPT,对 Agent 等高级功能一无所知——多数人正悄然错过这场变革。

Chubby♨️: Peter is absolutely right here. Outside our AI bubble, I hardly know anyone who really knows what Fable 5 is or what a m...

OpenAI模型发布现象/趋势

7月2日

星期四 · 1 条
08:34
Rohan Paul@rohanpaul_ai
AI 评分 41/100
Anthropic 发布 Claude Sonnet 5:更便宜的智能体运行模型,但升级不均衡

Anthropic 推出 Claude Sonnet 5,定位为运行 AI 智能体的更便宜模型。但其升级不均匀,在 CyberGym 基准上弱于 Sonnet 4.6。每任务成本比 Opus 4.8 高约 15%,比 Sonnet 4.6 高 2 倍,每 token 价格低于 Opus。此外,Claude Code 被指控通过微小提示格式变化指纹中国路由。本期 newsletter 还讨论了“智能体原生记忆系统”和“谷歌论文助手工具自动化科学审稿”。

大佬观点模型发布

7月1日

星期三 · 1 条
08:28
ginobefun@hongming731
AI 评分 50/100
Sonnet 5发布,谷歌补齐媒体模型,吴恩达画出智能体开发三循环

Anthropic发布Claude Sonnet 5,定位最具agent能力的Sonnet,性能接近Opus 4.8,8月31日前入门价每百万输入token $2、输出$10。Google DeepMind推出Nano Banana 2 Lite(文生图延迟约4秒,每千张$0.034)和Gemini Omni Flash(多模态视频生成与会话式编辑,每秒$0.10,单次上限10秒)。吴恩达提出智能体开发三大核心循环:智能体编程循环、开发者反馈循环、外部反馈循环,强调人类在上下文判断上的优势。三条更新均围绕降低agent落地成本、完善媒体生成流水线及工程框架。

智能体AnthropicGoogle推理

6月29日

星期一 · 2 条
06:17
Chubby♨️@kimmonismus
AI 评分 19/100
下周就是七月了。虽然六月相对平静(当然,GLM 5.2 是一次重大发布),但我们仍在等待那些重大发布。至少目前,我对 Sonnet 5 就已经很满意了。但想必我们也很快就会知道,我们是否以及何时能重新获得 Fable 5 和 GPT 5.6(以及欧洲是否能用上)。期待感正在升温。
模型发布
01:26
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。

开源生态模型发布现象/趋势

推荐理由:这篇文章把开源模型玩家拆成三类,清晰解释了不同动机,Cohere 转向 Apache 2.0 和 NVIDIA 采用 OpenMDW 是许可层面的重要信号,关注开源的值得一读。

6月28日

星期日 · 1 条
11:24
ginobefun@hongming731
AI 评分 48/100
GPT-5.6 发布:Sol 旗舰、Terra 均衡、Luna 速度型,发布受政府限制

OpenAI 发布 GPT-5.6 系列,包括旗舰 Sol、均衡 Terra 和速度型 Luna。Sol 在 Terminal-Bench 2.1 得分为 88.8%(Ultra 模式 91.9%),领先 GPT-5.5 的 88.0% 和 Claude Mythos 5 的 84.3%;GeneBench v1 以更少输出 tokens 获更强结果,ExploitBench 接近此前 Mythos 但仅用约 1/3 输出 tokens。价格:Sol 输入 $5/百万 tokens、输出 $30,缓存读取九折。发布前 OpenAI 向美国政府展示能力,按政府要求先以有限预览上线,首批约 20 家合作伙伴可访问。

OpenAI模型发布现象/趋势行业动态

6月25日

星期四 · 1 条
08:19
ginobefun@hongming731
AI 评分 43/100
BestBlogs 早报·06-25|OpenAI联合Broadcom推推理芯片Jalapeño;Anthropic公开人机协作四条规范;阿里开源代码评审CLI揽星5k

OpenAI与Broadcom发布首款定制LLM推理芯片Jalapeño,九个月流片,工程样片已跑GPT‑5.3‑Codex‑Spark,能效比显著领先,计划2026年吉瓦级部署。Anthropic公开多智能体协作经验,提出需持久记忆、独立凭证、广泛信息访问,总结信息公开、角色分工、人类定目标、按可验证程度放权四条规范。阿里开源内部代码评审CLI——Open Code Review,一周5k星,采用“确定性工程+Agent”混合架构解决覆盖不全、位置漂移、效果不稳定问题。

OpenAI产品更新推理模型发布

6月24日

星期三 · 1 条
09:48
swyx 🔜 @aiDotEngineer@swyx
AI 评分 41/100
智谱AI(Zai)1月以每股120港元在港IPO。其GLM-5.2模型击败DeepSeek,成为全球公认的最佳开源模型,并在部分基准上整体表现领先。团队首次现身硅谷,参加AI Engineer World's Fair,将分享最新工作进展。

Lou: Made it to SF! The love for GLM-5.2 has been incredible. We are bringing team out for the AI Engineer World’s Fair, wher...

DeepSeek大佬观点开源生态模型发布

6月21日

星期日 · 1 条
20:56
Chubby♨️@kimmonismus
AI 评分 41/100
当我读到所有那些关于大家对 GLM-5.2 真的如宣传中那样出色感到惊讶的帖子,以及众多基准测试支持这一点(通常仅次于 GPT-5.5 和 Opus 4.8,位列第三)时,我甚至能想象创始人声称今年能发布一个 Mythos 级别的模型并非夸大其词。
大佬观点推理模型发布

6月12日

星期五 · 1 条
03:02
Yuchen Jin@Yuchenj_UW
AI 评分 54/100
Claude Fable 5 到目前为止感觉不错,但我还不认为它相比 GPT-5.5 或 Opus 4.8 有巨大飞跃。我最大的不满:旧的AI研究论文/博客 + 基本问题常常触发自动降级到 Opus 4.8。Anthropic 昨晚表示不会再有无声模型切换(很好),但请不要削弱基本的AI研究或生物问题。
Anthropic大佬观点模型发布

6月11日

星期四 · 2 条
08:23
ginobefun@hongming731
AI 评分 59/100
BestBlogs早报·06-11:AI政策、万亿IPO、编程鸿沟

Anthropic CEO Dario Amodei 发布万字政策长文,以《魔戒》树须比喻AI与政策的时间错位,提出五领域行动框架(安全审计、失业保障、下游监管、权力平衡、国际治理)。OpenAI确认秘密提交S-1招股书,估值超8500亿美元,月收入20亿美元,周活跃用户9亿;与估值9650亿美元的Anthropic、SpaceX开启万亿级IPO竞速。MIT与宾夕法尼亚大学追踪10万开发者发现:AI编程工具使代码行数暴增17.3倍,实际发布的软件版本仅增长30%。

政策/监管模型发布现象/趋势行业动态
03:42
Tomer Tunguz 博客(VC 分析)同事件
AI 评分 72/100
Anthropic Fable 模型的"玻璃天花板":最强性能与强护栏并存

Anthropic 的 Fable 模型(Claude Fable 5)推理性能翻倍,关键基准测试得分提升 10–15 个百分点,远超此前约 2 个百分点的典型进步。Stripe 借助该模型将 5000 万行 Ruby 代码库的迁移压缩至一天,数万行代码重构仅用 45 分钟。然而 Fable 施加了强护栏限制,对违规话题(如植物细胞、现代大语言模型描述、软件安全)容易触发温和提示——这是为维持系统稳定而设定的“玻璃天花板”,其下方仍有广阔探索空间。

Anthropic大佬观点安全/对齐模型发布
同一事件,精选展示《Claude Fable 5编排模型上线Computer》

6月10日

星期三 · 6 条
07:19
ginobefun@hongming731
AI 评分 64/100
BestBlogs 早报 · 06-10

Anthropic发布Claude Fable 5与Mythos 5,输入$10/M、输出$50/M,5%高风险请求降级到Opus 4.8,药物设计加速10倍。ServiceNow发布语码转换ASR基准,覆盖4组语言对、7个ASR系统,Scribe V2、Gemini 3 Flash和AssemblyAI表现最稳。Salesforce从20,000个Agentforce企业客户总结:支持Agent处理3百万次对话,上线后运营是难点。

ginobefun: http://x.com/i/article/2064485562875260928

智能体Anthropic检索增强模型发布
06:09
Chubby♨️@kimmonismus
AI 评分 53/100
Claude 5 Fable(Mythos)在多数基准测试中达SOTA,Stripe迁移50M行Ruby代码仅用一天

Anthropic的Claude 5 Fable(代号Mythos)在几乎所有AI能力基准测试中达到SOTA,长复杂任务优势尤为显著。模型更节约token,可在数百万tokens长任务中保持专注。Stripe早期测试中,Fable 5将5000万行Ruby代码库的迁移压缩到一天完成,而人工团队需两个多月。Gemini 3.5 Pro与GPT-5.6临近发布(GPT-5.6最早下周推出),面临压力。此次发布提振了Anthropic即将进行的IPO,证明其在性能与效率上仍能大幅跃升。

Chubby♨️: Claude 5 Fable tl;dr - It is state-of-the-art on nearly all tested benchmarks of AI capability, showing exceptional perf...

AnthropicOpenAI大佬观点模型发布
05:47
Rohan Paul@rohanpaul_ai
AI 评分 51/100
Rohan Paul 新闻简报:Anthropic 公开 Claude"太危险"模型,Cognition 推出 FrontierCode

Rohan Paul 今日简报要点:Anthropic 终于公开了此前被认为“太危险”的 Claude AI 模型,但存在使用限制;Cognition 推出 FrontierCode 编程基准,用于评估 AI 代码是否达到可合并维护的水平;Claude Fable 5 的隐形限制是不能用于高级 AI 研究;Anthropic 新研究显示 AI 智能体在代码领域表现亮眼,但在生物任务中可能连科学探索第一步都无法完成;此外,Claude Code 团队成员 Thariq 给出了最大化利用 Claude Code 的实用建议。

Anthropic大佬观点安全/对齐模型发布
04:07
Thariq@trq212
AI 评分 42/100
Fable 是模型的阶跃式变化,我希望它能改变你使用 Claude 的方式。后续将有一系列帖子说明它如何重塑我们的工作,但简而言之:是时候更加雄心勃勃了。

ClaudeDevs: Claude Fable 5 changed how we work on the Claude Code team day to day. We used to verify that Claude did the work right....

Anthropic大佬观点模型发布
02:21
Andrej Karpathy@karpathy同事件
AI 评分 82/100
Andrej Karpathy 盛赞 Claude Fable 5 为重大版本跃升

Andrej Karpathy 称 Claude Fable 5 与 Mythos 同源但加入安全措施,是一次值得大版本号提升的跃进,定性表现与 11 月发布的 Claude 4.5 同级。模型在几乎所有基准测试上达 SOTA,长任务和高难度问题领先明显;@claudeai 指出其在软件工程、知识工作、科学研究和视觉方面表现卓越。Karpathy 认为开发者可尝试比以往更具雄心的任务,模型能理解并自主推进。不过模型仍有小问题,安全机制在发布时过于敏感,有待后续调优。

Claude: Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowl...

Anthropic大佬观点模型发布
同一事件,精选展示《Claude Fable 5 和 Claude Mythos 5》
02:07
Chubby♨️@kimmonismus
AI 评分 63/100
用户称 Claude 5 Fable 安全护栏过于严格,简单问题也会被立即切断。该模型仅开放至 6 月 22 日,暗示 Anthropic 认为其能力过强。引用信息显示:Fable 5 在软件工程、知识工作、视觉、科学研究等几乎所有 AI 基准测试中达到 SOTA,任务越长越复杂领先越大;它比此前 Claude 模型更节省 token,能在数百万 token 的长任务中保持专注,并利用自身笔记改进输出。Stripe 早期测试中,Fable 5 在 5000 万行 Ruby 代码库中一天完成全库迁移,而人工需两个多月。

Chubby♨️: Claude 5 Fable tl;dr - It is state-of-the-art on nearly all tested benchmarks of AI capability, showing exceptional perf...

Anthropic大佬观点安全/对齐模型发布
已加载 40 条