# 阿里通义 Qwen3.8-Flash 发布开源：125B 参数 MoE 模型，训练成本仅为前代 1/9

- 来源：IT之家（RSS）
- 发布时间：2026-08-26 20:39
- AIHOT 分数：75
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.virxact.com/items/cmta4mcv101z1roj2nc8w30ak
- 原文链接：https://www.ithome.com/0/994/735.htm

## AI 摘要

阿里通义千问团队发布 Qwen3.8-Flash，这是一款 125B 参数的多模态 MoE 模型，每 token 激活 6B 参数，原生支持 262,144 tokens 上下文，并可通过 YaRN 扩展至 1M tokens。

## 正文

IT之家 8 月 26 日消息，阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重，Next 新架构将是全新一代 Qwen4 系列模型的雏形。

这是一个多模态 MoE 模型，主模型参数量为 125B，额外配备 51B 的 N-gram Embedding，每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文，并可通过 YaRN 扩展至 1M tokens。

据介绍，Qwen3.8-Flash 围绕四个方向进行了系统升级：

在 Attention 方面，采用 GDN（Gated DeltaNet）+ QSA（Qwen Sparse Attention）混合架构。GDN 负责高效压缩历史信息，QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文，显著降低长序列 Attention 开销。面对 1M token 的超长上下文，QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。

在 Residual 方面，引入 Gated Residual（GR）机制，将残差流扩展为 4 条并行分支，通过动态 Gate 控制信息读写。残差状态支持 FP8 存储，大幅降低访存开销。

在 Embedding 方面，引入 51B 参数的 N-gram Embedding，利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory，通过异步 Prefetch 与模型计算重叠，不长期占用 GPU 显存。

在 Optimization 方面，采用 Muon Optimizer，并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。

性能与成本

相比 Qwen3.7-Plus，Qwen3.8-Flash 的训练成本仅约为前者的九分之一，但在编码和办公任务上具备更强能力。

在 6B 激活参数下，Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果，包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。

模型表现

纯文本：

多模态：

模型结构：

Base 模型表现：

可用性与定价

IT之家从官方获悉，Qwen3.8-Flash 即将上线千问 AI 平台，对外提供 API 服务，定价为每百万 Tokens 输入 1 元、输出 3 元。

模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源，同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。

技术报告：https://github.com/ QwenLM / Qwen3.8-Flash-Next / blob / main / tech_report.pdf

技术博客：https://qwen.ai/ blog?id=qwen3.8-flash-next

Hugging Face：https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&amp;amp;amp;file=Qwen3.8-Flash-Next

ModelScope：https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&amp;amp;amp;file=Qwen3.8-Flash-Next
