BestBlogs 早报 · 07-28
Claude Code 消融 / Kimi K3 推理栈 / AI 网关 / ReplaySSM / Agent 验证
【1】 ★ 精讲|Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流 【视频】 Boris Cherny 把 Claude Code 的构建方法归结为持续消融与实测:每次模型升级先删提示和工具约束,只在重复失败时加回。他用可验证的长任务、动态工作流与例行维护说明,真正稳定的不是旧脚手架,而是任务边界、验收方式和迭代能力;也提醒系统工程与像素级 UI 仍未解决。 来源:Y Combinator https://www.bestblogs.dev/video/227347908
【2】 ★ 精讲|管理 AI 变化速度的进化架构模式 这篇架构文章把 AI 集成的高频变化集中到独立网关:模型路由、Agent 身份、动作策略、内容防护与审计可单独演进,后端业务系统保持稳定。它同时列出真实代价:延迟、集中化、运维负担和供应商新能力滞后;单团队、单模型场景未必值得引入这一层。 来源:InfoQ https://www.bestblogs.dev/article/f849ce23af
【3】 ★ 精讲|Kimi K3 上线即获 SGLang 推理与 Miles 训练支持 Kimi K3 的混合 KDA/MLA 架构迫使推理栈重做状态缓存、推测解码和并行策略。SGLang 与 Miles 给出的价值不只是首日兼容:ReplaySSM 用重放输入替代逐步状态快照,并把推理、预填充与 LoRA 强化学习串成可验证链路。性能数字均来自团队指定硬件和负载,不能直接外推。 来源:LMSYS Blog https://www.bestblogs.dev/article/732e62aab6
【4】 AI 如何正在扩展人们的工作内容 OpenAI 的研究揭示了 AI 正在实现「任务交叉(task crossover)」,即员工越来越多地执行其传统职业边界之外的专业任务。 来源:OpenAI News https://www.bestblogs.dev/article/d568cbc6cd
【5】 DeepSWE:抗污染的代码智能体评测基准 【视频】 DataCurve 介绍了 DeepSWE 如何用原创、经行为验证的长周期任务,降低代码智能体评测中的数据污染与奖励黑客风险。 来源:AI Engineer https://www.bestblogs.dev/video/4a6cf8002
【6】 Agent 开始「自我进化」:会出题、会反思,还会自己长出新技能 本文深度解析了自进化 Agent 的技术演进路径,将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线,并详细拆解了各路线下的前沿研究工作。 来源:腾讯技术工程 https://www.bestblogs.dev/article/5d978f2ae1
【7】 NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式模拟 NVIDIA 推出了 Cosmos-H-Dreams,这是一款用于手术机器人的实时生成式模拟器,它将世界基础模型蒸馏为高速交互环境,用于策略训练与评估。 来源:Hugging Face - Blog https://www.bestblogs.dev/article/ea561a40ef
【8】 百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践 本文分享了天猫百亿补贴项目通过 SDD(规格驱动开发)与自进化记忆机制,在复杂服务端场景下实现 0 手写代码高质量交付的实战经验。 来源:大淘宝技术 https://www.bestblogs.dev/article/46e8fa9511