# BestBlogs 早报：Claude Code 消融与 Kimi K3 推理栈

- 来源：ginobefun (@hongming731)
- 发布时间：2026-07-28 07:30
- AIHOT 分数：35
- AIHOT 链接：https://aihot.virxact.com/items/cms3vv4ex02tero82hyd5xz7u
- 原文链接：https://x.com/hongming731/status/2081884971699171574

## AI 摘要

Boris Cherny 分享 Claude Code 构建方法：每次模型升级先删提示和工具约束，只在重复失败时加回，强调任务边界与验收方式。Kimi K3 上线即获 SGLang 推理与 Miles 训练支持，其混合 KDA/MLA 架构迫使推理栈重做状态缓存与推测解码。

## 正文

BestBlogs 早报 · 07-28

# Claude Code 消融 / Kimi K3 推理栈 / AI 网关 / ReplaySSM / Agent 验证

【1】 ★ 精讲|Boris Cherny 谈如何打造 Claude Code：提示词消融、验证闭环与智能体工作流 【视频】
Boris Cherny 把 Claude Code 的构建方法归结为持续消融与实测：每次模型升级先删提示和工具约束，只在重复失败时加回。他用可验证的长任务、动态工作流与例行维护说明，真正稳定的不是旧脚手架，而是任务边界、验收方式和迭代能力；也提醒系统工程与像素级 UI 仍未解决。
来源：Y Combinator
https://www.bestblogs.dev/video/227347908

【2】 ★ 精讲|管理 AI 变化速度的进化架构模式
这篇架构文章把 AI 集成的高频变化集中到独立网关：模型路由、Agent 身份、动作策略、内容防护与审计可单独演进，后端业务系统保持稳定。它同时列出真实代价：延迟、集中化、运维负担和供应商新能力滞后；单团队、单模型场景未必值得引入这一层。
来源：InfoQ
https://www.bestblogs.dev/article/f849ce23af

【3】 ★ 精讲|Kimi K3 上线即获 SGLang 推理与 Miles 训练支持
Kimi K3 的混合 KDA/MLA 架构迫使推理栈重做状态缓存、推测解码和并行策略。SGLang 与 Miles 给出的价值不只是首日兼容：ReplaySSM 用重放输入替代逐步状态快照，并把推理、预填充与 LoRA 强化学习串成可验证链路。性能数字均来自团队指定硬件和负载，不能直接外推。
来源：LMSYS Blog
https://www.bestblogs.dev/article/732e62aab6

【4】 AI 如何正在扩展人们的工作内容
OpenAI 的研究揭示了 AI 正在实现「任务交叉（task crossover）」，即员工越来越多地执行其传统职业边界之外的专业任务。
来源：OpenAI News
https://www.bestblogs.dev/article/d568cbc6cd

【5】 DeepSWE：抗污染的代码智能体评测基准 【视频】
DataCurve 介绍了 DeepSWE 如何用原创、经行为验证的长周期任务，降低代码智能体评测中的数据污染与奖励黑客风险。
来源：AI Engineer
https://www.bestblogs.dev/video/4a6cf8002

【6】 Agent 开始「自我进化」：会出题、会反思，还会自己长出新技能
本文深度解析了自进化 Agent 的技术演进路径，将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线，并详细拆解了各路线下的前沿研究工作。
来源：腾讯技术工程
https://www.bestblogs.dev/article/5d978f2ae1

【7】 NVIDIA Cosmos-H-Dreams：为手术机器人带来实时生成式模拟
NVIDIA 推出了 Cosmos-H-Dreams，这是一款用于手术机器人的实时生成式模拟器，它将世界基础模型蒸馏为高速交互环境，用于策略训练与评估。
来源：Hugging Face - Blog
https://www.bestblogs.dev/article/ea561a40ef

【8】 百亿补贴 C 端 AI Coding 实战：基于 SDD 的服务端 AI Coding 实践
本文分享了天猫百亿补贴项目通过 SDD（规格驱动开发）与自进化记忆机制，在复杂服务端场景下实现 0 手写代码高质量交付的实战经验。
来源：大淘宝技术
https://www.bestblogs.dev/article/46e8fa9511

【9】 蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash
蚂蚁百灵发布原生混合推理模型 Ling-3.0-Flash，通过 KDA 注意力架构与多智能体协同实现小参数高智效比，重点优化 Agent 场景的长程规划与纠错能力。
来源：量子位
https://www.bestblogs.dev/article/8245193e10

【10】 阿里最新发布，千问 AI 平台 Token Plan 实测来了！
阿里千问 AI 平台发布统一 API 调用百余模型并开源两个 Skill，实现 Agent 自主调度模型，实测完成 15 秒短片制作。
来源：Datawhale
https://www.bestblogs.dev/article/5d9d71bc12

---
http://BestBlogs.dev · 发现真正适合你的高质量内容
BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
在线阅读：https://www.bestblogs.dev/explore/brief/2026-07-28

### 引用推文

> ginobefun：http://x.com/i/article/2081884381086699520
