Qwen · @Alibaba_Qwen · X·2026-08-26 21:17·30分钟前
AI 导读

通义千问 Qwen3.8-Flash-Next 获 vLLM 首发(day-0)支持,已在 NVIDIA 和 AMD GPU 上验证。该超稀疏多模态 MoE 模型拥有 125B 总参数、6B 激活参数、262K 原生上下文(经 YaRN 可扩展至 1M),并附带可卸载的 51B N-gram 表。模型现可通过 vllm/vllm-openai:qwen38-flash-next 镜像运行。

Qwen@Alibaba_Qwen
52AI 编辑部评分,满分 100
2026-08-26 21:17· 30分钟前
AI 导读

通义千问 Qwen3.8-Flash-Next 获 vLLM 首发(day-0)支持,已在 NVIDIA 和 AMD GPU 上验证。该超稀疏多模态 MoE 模型拥有 125B 总参数、6B 激活参数、262K 原生上下文(经 YaRN 可扩展至 1M),并附带可卸载的 51B N-gram 表。模型现可通过 vllm/vllm-openai:qwen38-flash-next 镜像运行。

Amazing! 🥳 Thanks @vllm_project for getting Qwen3.8-Flash-Next running on NVIDIA and AMD from day 0.

vLLMQwen3.8-Flash-Next from @Alibaba_Qwen has day-0 support in vLLM, verified on NVIDIA and AMD GPUs. 🎉 Ultra-sparse multimodal MoE: 125B params, 6B active, 262K n...