通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览

Qwen · @Alibaba_Qwen · X·2026-08-26 20:34·16分钟前
AI 导读

通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。该模型总参数量 125B,每 token 仅激活 6B,原生上下文 262K,可扩展至 1M;训练成本仅为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。

Qwen@Alibaba_Qwen
精选
81AI 编辑部评分,满分 100

通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览

2026-08-26 20:34· 16分钟前
AI 导读

通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。该模型总参数量 125B,每 token 仅激活 6B,原生上下文 262K,可扩展至 1M;训练成本仅为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。

推荐理由

将训练成本降至Qwen3.7-Plus的九分之一且性能反超,让高并发长上下文应用的成本约束明显放宽。

正文 · AI 翻译

⚡️认识一下 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,现已开放权重!

生产版本的 Qwen3.8-Flash 即将通过 QwenCloud API 提供,价格仅为每 100 万输入 token 0.16 美元,每 100 万输出 token 0.47 美元。

125B 参数 + 51B N-gram 嵌入,每个 token 仅激活 6B 参数。性价比无与伦比。

新特性:🥳 - 下一代架构:GDN + QSA 混合注意力、门控残差、N-gram 嵌入和 Muon 优化器,作为 Qwen4 所用架构的前身。 - 训练和推理成本大幅降低:训练成本仅为 Qwen3.7-Plus 的 1/9,同时在各方面表现均优于后者,在编程和办公任务上尤其突出。 - 性能强劲:在 DeepSWE 1.1 上得分 58.7,在 SWE-bench Pro 上得分 62.5,在 CoWorkBench 上得分 73.9,在 AndroidWorld 上得分 84.5,在 MathVision(带 CI)上得分 95.7。 - 原生 262K 上下文,可通过 YaRN 扩展至 1M。

我们还发布了 Qwen3.8-Flash-Next 的权重,让社区提前一睹我们为 Qwen4 探索的新架构。🚀

我们迫不及待想看看你用 Qwen3.8-Flash 构建出什么!👀👇 - 博客:https://qwen.ai/blog?id=qwen3.8-flash-next - 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf - Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next - ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next