真是一篇AI推理优化的技术好文, 感觉我们不用再对着 KernelBench 跑分自嗨了,这篇文章把 AI 推理优化的真相捅破了!
大家都在吹 Agent 会写 Triton,但现实很骨感:微基准跑第一的单算子,一进 CUDA Graph 收益直接被吞,换个真实 batch 就变慢,根本合不进复杂的 Serving 引擎。
Baseten 这套框架直接在 SGLang + B300 真实生产栈上,把 Qwen-Image 端到端延迟砍了 42.3%,FLUX.2 砍了 15.2%,而且优化全是由系统自主发现、提出并合进生产的。
能拿到 42% 这种逆天收益,是因为它根本没在 Attention 里死抠 5% 的边角料,而是直接重构了整个计算图:
1️⃣ 消灭算子暗税:权重 Scale 改在加载时预打包一次,直接砍掉反复格式转换。 2️⃣ 干掉重复计算:发现 CFG 在无 prompt 分支上纯属白算,直接在 DiT 入口加缓存。 3️⃣ 大算子端到端吞并:Norm 吐出的 BF16 刚落盘又被量化读回,直接跟 QKV 投影和 Epilogue 融成一趟搞定。
以前做优化是人抱着分析工具找漏勺,现在是 Agent 对着真实流量 trace 自动长出特供 Kernel。
Kernel 工程的胜负手,已经从人会不会写代码,彻底变成了系统有没有生产闭环与自进化知识库。
6 条硬核系统军规与完整优化拆解放一楼了 👇