# Baseten 用 SGLang+B300 将 Qwen-Image 延迟砍 42.3%

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-31 01:22
- AIHOT 分数：53
- AIHOT 链接：https://aihot.virxact.com/items/cmtg3n07l01lbroj7hvcd4vsm
- 原文链接：https://x.com/AYi_AInotes/status/2094113597240623151

## AI 摘要

Baseten 在 SGLang + B300 真实生产栈上，将 Qwen-Image 端到端延迟降低 42.3%，FLUX.2 降低 15.2%，且优化由系统自主发现并合入生产。

## 正文

真是一篇AI推理优化的技术好文，
感觉我们不用再对着 KernelBench 跑分自嗨了，这篇文章把 AI 推理优化的真相捅破了！

大家都在吹 Agent 会写 Triton，但现实很骨感：微基准跑第一的单算子，一进 CUDA Graph 收益直接被吞，换个真实 batch 就变慢，根本合不进复杂的 Serving 引擎。

Baseten 这套框架直接在 SGLang + B300 真实生产栈上，把 Qwen-Image 端到端延迟砍了 42.3%，FLUX.2 砍了 15.2%，而且优化全是由系统自主发现、提出并合进生产的。

能拿到 42% 这种逆天收益，是因为它根本没在 Attention 里死抠 5% 的边角料，而是直接重构了整个计算图：

1️⃣ 消灭算子暗税：权重 Scale 改在加载时预打包一次，直接砍掉反复格式转换。 2️⃣ 干掉重复计算：发现 CFG 在无 prompt 分支上纯属白算，直接在 DiT 入口加缓存。 3️⃣ 大算子端到端吞并：Norm 吐出的 BF16 刚落盘又被量化读回，直接跟 QKV 投影和 Epilogue 融成一趟搞定。

以前做优化是人抱着分析工具找漏勺，现在是 Agent 对着真实流量 trace 自动长出特供 Kernel。

Kernel 工程的胜负手，已经从人会不会写代码，彻底变成了系统有没有生产闭环与自进化知识库。

6 条硬核系统军规与完整优化拆解放一楼了 👇

### 引用推文

> Brian Li：https://x.com/i/article/2093459826085117953
