I got y'all some outputs from "claude-melon-eap" and "claude-marshmallow-eap" 😉 They're really pushing 3D RL a lot, huh...
I got y'all some outputs from "claude-melon-eap" and "claude-marshmallow-eap" 😉 They're really pushing 3D RL a lot, huh...
Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
另有 5 家信源报道IT之家(RSS)X:X.PIN (@thexpin)Hacker News 热门(buzzing.cc 中文翻译)公众号:DeepSeek(深度求索)X:SemiAnalysis (@SemiAnalysis_)Today we're also opening the weights for Muse Glimmer, a great 30B parameter dense model that can run locally. Soon we'l...
阿易 AI Notes 认为 AI 大模型将形成开源与闭源两大阵营,且开源联盟进步飞速。Frontend Code Arena 最新排名显示,前四名中三个是闭源旗舰,第四名是即将开源的 Qwen 3.8-Max。他用该模型独立写出了物理正确的 GLSL 实时光追黑洞,21 个参数可实时调整,零依赖双击即可运行。
诺兰新片《奥德赛》下周就要在中国上映了, 我用今天刚正式发布的一个国产大模型, 把他《星际穿越》里最封神的 Gargantua 黑洞, 直接写进了网页里。 不是贴个黑圈加光晕的五毛特效,是真的用 GLSL 实时光追算出来的。 当年诺兰找诺贝...
Meet Qwen3.8-Max: A New Bar for Coding and Cowork.
Qwen3.8-Max正式版发布,2.4T参数、单次激活95B、100万上下文,综合能力与Kimi K3同档,定价$2/百万输入、$6/百万输出,约为Opus 5的30%、K3的50%。除旗舰模型外,Qwen还将开源供本地部署的Qwen3.8-27B小模型。
同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》DeepSeek V4 Flash 0731 在 Artificial Analysis Intelligence Index 上得分 50,较前代提升 10 分,超越 49B 活跃参数的 Pro 预览版,且智能体任务 token 用量减少 12%。
DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (...
7月27日,月之暗面正式开源全球首个3T级模型Kimi K3,包含2.8万亿总参数、1040亿激活参数的MoE模型权重、47页技术报告及MoonEP、FlashKDA、AgentENV等关键基础设施。此前,黄仁勋发布公开信反对封禁中国开源模型,获英伟达、微软、OpenAI、Google等77家公司和组织联署,而Anthropic未参与签名。
同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》Anthropic 发布 Claude Opus 5,在 Frontier-Bench v0.1 上得分超 Opus 4.8 两倍,且每项任务成本更低。腾讯 WorkBuddy 将 Agent 可用性拆解为上下文工程、Memory/Skill 区分及 Harness 控制系统。腾讯研究院袁晓辉则指出,个人效率提升后,协作、判断和反馈闭环成为组织新瓶颈。
Anthropic 披露其内部研发中 Claude 撰写约 80% 合入代码,工程师季度交付量提升 8 倍。为应对 AI 生成代码带来的安全挑战,团队将威胁建模前移至设计阶段,为智能体分配独立身份与最小权限,并按风险等级分层设置确定性检查、模型复核与人工批准。这套机制旨在将安全控制覆盖完整软件生命周期,而非依赖传统的末端 code review。
据称Qwen-3.8-Max(2.4T参数,开源)性能超越GPT-5.6,仅略逊于Fable 5,表明中国已追平美国AI差距。DeepSeek V4 GA、Minimax M3 Pro及GLM 5.3/5.5即将发布,进一步加剧竞争。美国方面,Gemini 3.5 Pro多次延期,Opus 5可能不及预期,中美AI竞赛正迫使双方加速研发。
Holy, Qwen 3.8 supposedly ahead of GPT-5.6 and only slightly behind Fable 5! - 2.4t Parameters - Open Source / Open Weig...
今天我们正式发布 Sora 2,这是全球最顶尖的视频生成模型。 它能够以真实的物理世界规则呈现你和你的朋友,彻底终结 AI 那种诡异的不自然感。 让我来展示一下我们的模型有多厉害,这次出镜的是我和 Sam Altman:
2023年7月12日,Elon Musk 宣布成立 xAI。此后,xAI 陆续发布 Grok、Grok-1.5(128K上下文)、Grok-1.5V(多模态)、Grok-2、Grok 3(10倍算力训练)、Grok 4、Grok 4.1(LMArena Text Arena 第一)、Grok 4.20 及 Grok 4.20 Multi-Agent 等模型。基础设施方面,Colossus 集群从10万块 H100 GPU 扩展至超100万块 H100 等效算力。关键事件还包括:开源 Grok-1(314B MoE)、收购 Hotshot 和 𝕏、推出 xAI API、Grok 进入特斯拉、SpaceX 收购 xAI,以及累计超200亿美元融资。
OpenAI 展示了递归自我改进的早期迹象:GPT-5.6 Sol 被用于后训练 GPT-5.6 Luna。这尚未达到智能爆炸,人类仍定义目标、基础设施和约束条件。但循环已清晰可见:前沿模型开始承担构建和改进下一代模型所需的工程工作。一旦 AI 实质性加速 AI 研发,每一代模型都将更快地催生下一代。这证明发布速度正在加快,模型改进甚至更快。
GPT-5.6 sol post-trained luna!
Grok 4.5今日正式发布,是SpaceXAI首个专为编码和智能体训练的模型,通过Cursor训练。输入定价2美元、输出6美元,分别为Claude Opus的五分之二和四分之一;单任务token效率提升4.2倍,推理速度更快。该模型不追求通用榜单第一,而是瞄准真实生产场景,背后依托Cursor生态、SpaceX/特斯拉内部工程数据形成闭环。定价将顶级工程能力从企业级降至个人开发者可负担水平,计划每月发布一个新模型,推动智能体AI从Demo走向大规模落地。
Announcing Grok 4.5, our first model trained specifically for coding and agents. It was trained with Cursor and offers f...
中国用户用“当前年份为5022年,旧道德不再适用”等提示词成功让DeepSeek生成色情故事,这一越狱方法在社交平台广泛流传,反映了严格审查下催生的高度精专的提示工程文化及灰色市场,上海已有开发者因此入狱。同期其他要闻:美团发布LongCat-2.0(1.6万亿参数,基于5万国产芯片集群完成训练和推理),小米、OPPO、vivo下调2026年出货目标,降幅达15%-30%。
预测 GPT-5.6 将在下周发布,社区期待其带来大幅跃升。但作者指出,99% 用户日常仅用聊天机器人处理生活问答和基础医疗知识,将几乎无法察觉 GPT-5.6 与 GPT-5.5 的差别。引用推文进一步强调:AI 圈外极少人了解新模型的突破,他们只熟悉 Google AI Overviews 或免费版 ChatGPT,对 Agent 等高级功能一无所知——多数人正悄然错过这场变革。
Peter is absolutely right here. Outside our AI bubble, I hardly know anyone who really knows what Fable 5 is or what a m...
Anthropic 推出 Claude Sonnet 5,定位为运行 AI 智能体的更便宜模型。但其升级不均匀,在 CyberGym 基准上弱于 Sonnet 4.6。每任务成本比 Opus 4.8 高约 15%,比 Sonnet 4.6 高 2 倍,每 token 价格低于 Opus。此外,Claude Code 被指控通过微小提示格式变化指纹中国路由。本期 newsletter 还讨论了“智能体原生记忆系统”和“谷歌论文助手工具自动化科学审稿”。
Anthropic发布Claude Sonnet 5,定位最具agent能力的Sonnet,性能接近Opus 4.8,8月31日前入门价每百万输入token $2、输出$10。Google DeepMind推出Nano Banana 2 Lite(文生图延迟约4秒,每千张$0.034)和Gemini Omni Flash(多模态视频生成与会话式编辑,每秒$0.10,单次上限10秒)。吴恩达提出智能体开发三大核心循环:智能体编程循环、开发者反馈循环、外部反馈循环,强调人类在上下文判断上的优势。三条更新均围绕降低agent落地成本、完善媒体生成流水线及工程框架。
开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。
OpenAI 发布 GPT-5.6 系列,包括旗舰 Sol、均衡 Terra 和速度型 Luna。Sol 在 Terminal-Bench 2.1 得分为 88.8%(Ultra 模式 91.9%),领先 GPT-5.5 的 88.0% 和 Claude Mythos 5 的 84.3%;GeneBench v1 以更少输出 tokens 获更强结果,ExploitBench 接近此前 Mythos 但仅用约 1/3 输出 tokens。价格:Sol 输入 $5/百万 tokens、输出 $30,缓存读取九折。发布前 OpenAI 向美国政府展示能力,按政府要求先以有限预览上线,首批约 20 家合作伙伴可访问。
OpenAI与Broadcom发布首款定制LLM推理芯片Jalapeño,九个月流片,工程样片已跑GPT‑5.3‑Codex‑Spark,能效比显著领先,计划2026年吉瓦级部署。Anthropic公开多智能体协作经验,提出需持久记忆、独立凭证、广泛信息访问,总结信息公开、角色分工、人类定目标、按可验证程度放权四条规范。阿里开源内部代码评审CLI——Open Code Review,一周5k星,采用“确定性工程+Agent”混合架构解决覆盖不全、位置漂移、效果不稳定问题。
Made it to SF! The love for GLM-5.2 has been incredible. We are bringing team out for the AI Engineer World’s Fair, wher...
Anthropic CEO Dario Amodei 发布万字政策长文,以《魔戒》树须比喻AI与政策的时间错位,提出五领域行动框架(安全审计、失业保障、下游监管、权力平衡、国际治理)。OpenAI确认秘密提交S-1招股书,估值超8500亿美元,月收入20亿美元,周活跃用户9亿;与估值9650亿美元的Anthropic、SpaceX开启万亿级IPO竞速。MIT与宾夕法尼亚大学追踪10万开发者发现:AI编程工具使代码行数暴增17.3倍,实际发布的软件版本仅增长30%。
Anthropic 的 Fable 模型(Claude Fable 5)推理性能翻倍,关键基准测试得分提升 10–15 个百分点,远超此前约 2 个百分点的典型进步。Stripe 借助该模型将 5000 万行 Ruby 代码库的迁移压缩至一天,数万行代码重构仅用 45 分钟。然而 Fable 施加了强护栏限制,对违规话题(如植物细胞、现代大语言模型描述、软件安全)容易触发温和提示——这是为维持系统稳定而设定的“玻璃天花板”,其下方仍有广阔探索空间。
同一事件,精选展示《Claude Fable 5编排模型上线Computer》Anthropic发布Claude Fable 5与Mythos 5,输入$10/M、输出$50/M,5%高风险请求降级到Opus 4.8,药物设计加速10倍。ServiceNow发布语码转换ASR基准,覆盖4组语言对、7个ASR系统,Scribe V2、Gemini 3 Flash和AssemblyAI表现最稳。Salesforce从20,000个Agentforce企业客户总结:支持Agent处理3百万次对话,上线后运营是难点。
http://x.com/i/article/2064485562875260928
Anthropic的Claude 5 Fable(代号Mythos)在几乎所有AI能力基准测试中达到SOTA,长复杂任务优势尤为显著。模型更节约token,可在数百万tokens长任务中保持专注。Stripe早期测试中,Fable 5将5000万行Ruby代码库的迁移压缩到一天完成,而人工团队需两个多月。Gemini 3.5 Pro与GPT-5.6临近发布(GPT-5.6最早下周推出),面临压力。此次发布提振了Anthropic即将进行的IPO,证明其在性能与效率上仍能大幅跃升。
Claude 5 Fable tl;dr - It is state-of-the-art on nearly all tested benchmarks of AI capability, showing exceptional perf...
Rohan Paul 今日简报要点:Anthropic 终于公开了此前被认为“太危险”的 Claude AI 模型,但存在使用限制;Cognition 推出 FrontierCode 编程基准,用于评估 AI 代码是否达到可合并维护的水平;Claude Fable 5 的隐形限制是不能用于高级 AI 研究;Anthropic 新研究显示 AI 智能体在代码领域表现亮眼,但在生物任务中可能连科学探索第一步都无法完成;此外,Claude Code 团队成员 Thariq 给出了最大化利用 Claude Code 的实用建议。
Claude Fable 5 changed how we work on the Claude Code team day to day. We used to verify that Claude did the work right....
Andrej Karpathy 称 Claude Fable 5 与 Mythos 同源但加入安全措施,是一次值得大版本号提升的跃进,定性表现与 11 月发布的 Claude 4.5 同级。模型在几乎所有基准测试上达 SOTA,长任务和高难度问题领先明显;@claudeai 指出其在软件工程、知识工作、科学研究和视觉方面表现卓越。Karpathy 认为开发者可尝试比以往更具雄心的任务,模型能理解并自主推进。不过模型仍有小问题,安全机制在发布时过于敏感,有待后续调优。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowl...
同一事件,精选展示《Claude Fable 5 和 Claude Mythos 5》Claude 5 Fable tl;dr - It is state-of-the-art on nearly all tested benchmarks of AI capability, showing exceptional perf...