RadixArk 与 Google Cloud 达成合作,将 SGLang 引入 TPU,为开发者提供在自选硬件上运行工作负载的极致灵活性。
SGLang 是一个开源推理框架,专为生产环境下的高吞吐量和低延迟而构建。该项目在 GitHub 上拥有超过 30,000 颗星和 1,700 多名贡献者,在全球数十万块 GPU 上运行,每天在生产环境中生成数万亿个模型 token。RadixArk 是 SGLang 项目的维护方。
目前,开发者可以通过 SGL-JAX 在最新几代 TPU 上运行 SGLang,支持的主流大语言模型和多模态模型系列包括 Gemma、Qwen、DeepSeek、GLM、Mimo、Kimi、Ling、MiniMax 和 Grok,以及用于视频和图像生成的扩散模型(包括 Wan 和 Flux)。今年晚些时候,RadixArk 将推出 SGL-torchtpu 作为另一个 PyTorch 原生 TPU 后端,具备即时执行、PyTorch 生态系统兼容性以及 MPMD 支持。它将让行业内的任何 AI 研究人员或工程师都能使用标准 PyTorch 工具,在 Google 的 TPU 上以高性能、可扩展性和最先进的功能运行 SGLang 大语言模型。这些功能包括在多主机 TPU 上运行全尺寸的领先开源模型,质量与已发布的基线持平,此外还支持并行化(数据、张量、专家、上下文和流水线)、Radix Cache、HiCache、量化以及推测解码——这些均由 RadixArk、Google 和 SGLang 社区基于 TPU Pallas 内核构建。
展望未来,SGLang 将确保新的开源模型在 GPU 上运行的同一天即可在 TPU 上运行,并且这种“Day 0”支持将扩展到每一代新的 TPU。
这些特性使 TPU 成为一条即插即用、高性价比的前沿推理路径。团队可以使用与 GPU 上相同的 SGLang API 和功能,同时根据工作负载需求和性价比自由选择硬件。
“RadixArk 的使命是让前沿 AI 基础设施对每一位构建者开放且触手可及。SGLang 正是这一使命的体现,我们很高兴能与 Google Cloud 合作,将其性能和灵活性带到 TPU 生态系统中,”RadixArk 首席执行官 Ying Sheng 表示。
“要真正加速前沿人工智能创新,开发者必须能够自由选择和使用性能更优、可靠性更高、可扩展性更强且成本更低的人工智能训练与服务平台,”谷歌核心机器学习/人工智能工程副总裁 Bill Jia 表示。“我们与 RadixArk 的合作是实现可编程异构这一愿景的关键一步,即让软件成为开放的桥梁,而非锁定机制。通过将 SGLang 的高吞吐量推理服务框架引入谷歌 TPU,我们实际上消除了开发者的‘迁移成本’,使他们能够使用完全相同的 SGLang 推理 API,在自行选择的硬件(例如 GPU、TPU)和人工智能框架(例如 PyTorch、JAX)上无缝运行生产工作负载。”
SGL-JAX 由 RadixArk 与 SGLang 社区共同打造,现已于 github.com/sgl-project/sglang-jax 上线。
SGL 家族始终欢迎新的贡献者,共同构建一个开放、高性能的推理服务引擎!