Baseten 用 SGLang+B300 将 Qwen-Image 延迟砍 42.3%

AYi · @AYi_AInotes · X·2026-08-31 01:22·5小时前
AI 导读

Baseten 在 SGLang + B300 真实生产栈上,将 Qwen-Image 端到端延迟降低 42.3%,FLUX.2 降低 15.2%,且优化由系统自主发现并合入生产。

AYi@AYi_AInotes
53AI 编辑部评分,满分 100

Baseten 用 SGLang+B300 将 Qwen-Image 延迟砍 42.3%

2026-08-31 01:22· 5小时前
AI 导读

Baseten 在 SGLang + B300 真实生产栈上,将 Qwen-Image 端到端延迟降低 42.3%,FLUX.2 降低 15.2%,且优化由系统自主发现并合入生产。

真是一篇AI推理优化的技术好文, 感觉我们不用再对着 KernelBench 跑分自嗨了,这篇文章把 AI 推理优化的真相捅破了!

大家都在吹 Agent 会写 Triton,但现实很骨感:微基准跑第一的单算子,一进 CUDA Graph 收益直接被吞,换个真实 batch 就变慢,根本合不进复杂的 Serving 引擎。

Baseten 这套框架直接在 SGLang + B300 真实生产栈上,把 Qwen-Image 端到端延迟砍了 42.3%,FLUX.2 砍了 15.2%,而且优化全是由系统自主发现、提出并合进生产的。

能拿到 42% 这种逆天收益,是因为它根本没在 Attention 里死抠 5% 的边角料,而是直接重构了整个计算图:

1️⃣ 消灭算子暗税:权重 Scale 改在加载时预打包一次,直接砍掉反复格式转换。
2️⃣ 干掉重复计算:发现 CFG 在无 prompt 分支上纯属白算,直接在 DiT 入口加缓存。
3️⃣ 大算子端到端吞并:Norm 吐出的 BF16 刚落盘又被量化读回,直接跟 QKV 投影和 Epilogue 融成一趟搞定。

以前做优化是人抱着分析工具找漏勺,现在是 Agent 对着真实流量 trace 自动长出特供 Kernel。

Kernel 工程的胜负手,已经从人会不会写代码,彻底变成了系统有没有生产闭环与自进化知识库。

6 条硬核系统军规与完整优化拆解放一楼了 👇

Brian Lihttps://x.com/i/article/2093459826085117953