Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

Qwen:Blog Retrieval(API)·2026-08-26 20:30·18分钟前·QwenTeam
AI 导读

通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

Qwen:Blog Retrieval(API)
精选
83AI 编辑部评分,满分 100

Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

2026-08-26 20:30· 18分钟前· QwenTeam
AI 导读

通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

推荐理由

这次提前开放 Qwen4 架构权重,关键在于 QSA 稀疏注意力与 N-gram 查表参数同时降低长上下文成本、扩大容量,为评估下一代模型提供早期样本。

正文 · AI 翻译

本次发布中,我们开放了 Qwen3.8-Flash-Next 的权重,这是一个多模态 MoE 模型,同时也是 Qwen4 所采用架构的早期预览。它所扮演的角色与 Qwen3-Next 之于 Qwen3.5 相同:当时引入的混合 Gated DeltaNet + Gated Attention 设计,此后已被广泛应用于 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 系列。我们再次提前发布架构变更,以便社区在完整的 Qwen4 模型家族基于此构建之前,能够先行审视这些改动。

Qwen3.8-Flash-Next 从四个方面系统性地升级了模型——注意力、残差、嵌入和优化——在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性:

注意力:采用 GDN + QSA 混合架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA)使用压缩的轻量级索引器,在微块粒度上选择重要上下文,大幅降低长序列上的注意力计算成本。

残差:Gated Residual(GR)将残差流拓宽为 4 个分支,并通过动态门控控制读写,强化跨层信息流动和训练稳定性。

嵌入:N-gram Embedding 利用局部上下文进行查表,以极少的额外计算扩展模型容量;嵌入表可卸载至主机内存,并通过异步预取与模型计算重叠执行。

优化:采用 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的分工、融合参数的分割进行了精细化调整,并为新架构重新拟合了缩放定律。

Qwen3.8-Flash-Next 拥有 125B 参数的主模型,另配有 51B 的 N-gram 嵌入,每个 token 激活 6B 参数。与 Qwen3.7-Plus 相比,Qwen3.8-Flash-Next 大幅降低了训练和推理成本——训练量仅约为其 1/9,同时在编程和办公任务上展现出更优的能力。

它原生支持 262,144 个 token 的上下文,并可通过 YaRN 扩展至 1,000,000 个 token。关于 Qwen3.8-Flash-Next 的架构、训练方法和实验分析的更多技术细节,请参阅我们 GitHub 仓库中的技术报告。

Qwen3.8-Flash-Next 的权重现已在 Hugging Face 和 ModelScope 上提供。生产版本默认支持 1M 上下文,并内置官方工具,以 Qwen3.8-Flash 的名称在 QwenCloud 上提供服务,定价为每百万输入 token 0.16 美元,每百万输出 token 0.47 美元(API 即将推出)。

语言#

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731Claude-Opus-4.6 (Max)

参数量

125B27B397B284B--

激活参数量

6B27B17B13B--

N-gram 嵌入参数量

51B--------

编码

智能体编码

DeepSWE 1.1

58.742.216.554.4--

智能体编码

SWE-bench Pro

62.561.755.856.053.4

多语言软件工程

SWE-bench Multilingual

81.073.875.8--77.5

仓库级代码生成

NL2Repo-Bench

48.142.341.154.247.6

智能体

长周期办公任务

CoWorkBench

73.970.765.145.168.2

专业工作任务

JobBench

55.733.427.641.336.6

前沿智能体任务

Agents' Last Exam

Pass@1

得分

Pass@1

得分

Pass@1

得分

Pass@1

得分

真实世界工具使用

Toolathlon Verified (Pass@1)

73.567.150.670.3--

通用

指令遵循

IFBench

81.379.579.179.262.5

科学推理

GPQA Diamond

91.789.290.390.891.3

多学科推理

HLE

35.930.834.733.840.0

竞赛级编码

LiveCodeBench v6

91.990.389.690.688.8

  1. DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 测试框架进行评估,temp=1.0,top_p=0.95,256K 上下文窗口。我们报告两个测试框架中的最高得分;值得注意的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
  2. SWE-bench Pro:除 Claude-Opus-4.6 (Max) 报告其官方发布得分外,所有模型均使用 Claude Code 测试框架进行评估,temp=1.0,top_p=0.95,256K 上下文窗口。有问题的任务已修正,所有基线模型均在改进后的基准上重新评估。
  3. SWE-bench Multilingual:使用 mini-SWE-agent 测试框架进行评估,temp=1.0,top_p=0.95,256K 上下文窗口。
  4. NL2Repo-Bench:使用 Claude Code 测试框架进行评估。为防止奖励作弊,我们禁用了试图访问特定仓库的 Bash 命令,例如 pip download、pip install 和 git clone。
  5. CoWorkBench:一个内部协同工作基准,用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长期办公与生产力智能体任务。
  6. HLE:由 GPT-4o 进行评判。
  7. 每行最佳结果以粗体显示。
  8. 空单元格(--):分数尚未公布或暂不适用。

视觉语言#

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude-Opus-4.6 (Max)

智能体多模态智能

多模态工具调用

ClawEval-MM

Pass@3

平均分

Pass@3

平均分

Pass@3

平均分

Pass@3

平均分

应用复刻

RecreationBench

49.947.130.2--

移动端使用

AndroidWorld

84.581.981.062.0

电脑端使用

OSWorld 2.0

可视化网页开发

Vision2Web

64.062.942.1--

通用多模态智能

具身智能

ERQA

72.365.569.840.8

长视频理解

LVBench

76.672.476.263.0

真实世界感知

RealWorldQA

88.585.986.973.9

视觉数学问题求解

MathVision

无CI

有CI

无CI

有CI

无CI

有CI

无CI

科学图表分析

CharXiv (RQ)

无CI

有CI

无CI

有CI

无CI

有CI

无CI

  1. ClawEval-MM:分数以“pass@3 / 平均分”形式报告。Pass@3 衡量在三次尝试中至少一次通过的百分比,平均分是三次尝试的平均得分。
  2. RecreationBench:一个内部长期应用复刻基准,用于评估跨五个平台(桌面端——Ubuntu、macOS、Windows,移动端——Android,以及网页端)的混合智能体能力。
  3. OSWorld 2.0:分数以“二元 / 部分”形式报告。二元分数是获得完整任务奖励的任务百分比,部分分数则汇总所有任务中获得的部分奖励。
  4. Vision2Web:分数以前端、网页和网站类别的平均值报告,使用 Claude Code 测试框架,并由 gpt-5.4-2026-03-05 进行评判。
  5. MathVision、CharXiv(RQ):分数以“无置信区间 / 有置信区间”两种形式报告。MathVision 中少量错误的地面真值标注经人工核验后已修正。我们模型的分数使用固定提示词评估,例如“请逐步推理,并将最终答案放入 \boxed{} 中。”对于其他模型,我们报告在带与不带 \boxed{} 格式的两次运行中取得的较高分数。
  6. 每行最佳结果以粗体显示。
  7. 空单元格(--)表示分数尚未公布或暂不适用。

模型架构#

注意力机制:GDN + QSA,实现高效内存与精准检索#

传统全注意力机制可直接访问所有历史 token,但随着上下文不断变长,计算成本和 KV Cache 内存访问成本都会大幅增加。

沿袭 Qwen3.5 引入的架构设计,Qwen3.8-Flash-Next 采用 GDN [1] + 注意力混合架构:每四层中有三层使用 Gated DeltaNet(GDN)将历史信息持续压缩为固定大小的状态,其余一层使用全局注意力对完整上下文进行精准信息检索。

在全局注意力方面,我们进一步引入了 Qwen 稀疏注意力(QSA)。稀疏注意力通过仅关注重要上下文来降低长序列计算量。然而,DSA [2] 等现有方法仍依赖 token 级索引器来识别重要位置;随着上下文增长,索引器本身也会成为不可忽视的计算来源。

QSA 进一步压缩了这一过程:轻量级索引器先将序列聚合为微块,在块级别评估上下文重要性,再选择最相关的区域进行注意力计算。这不仅降低了注意力本身的计算成本,也减少了识别重要上下文所需的索引开销。与跨层共享索引的方法 [3] 相比,QSA 在每一层内独立进行序列压缩,降低了对跨层注意力相似度的依赖,因此特别适合 GDN 与注意力层交错排列的混合架构。

简而言之:GDN 擅长高效“记忆”,而 QSA 擅长精准“检索”。

在 1M token 规模下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别可实现最高 7.6 倍和 4.9 倍的加速。在模拟高缓存复用在线服务场景(90% Prefix Cache 命中率)的实验设置中,Qwen3.8-Flash-Next 在 1M token 上下文长度下,其 Prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。

门控残差:为信息流动提供更多路径#

在传统 Transformer 架构中,所有层都持续从同一个残差流(Residual Stream)中读取和写入信息。随着网络不断加深,早期特征会反复与后期信息混合,导致重要信号更易被逐渐稀释。

门控残差(GR)可视为两种思想的结合:它借鉴 Hyper-Connection [4] 将残差流扩展为多个分支,同时将 GatedNorm [5] 的逐元素动态门控机制引入残差读取过程。原本单一的残差流被扩展为四个并行分支,使模型能够根据当前内容动态决定从每个分支读取多少信息、以及向每个分支写回多少信息。

这可以理解为将单一信息通道扩展为多条并行通路:部分分支负责局部信息流动,而另一些分支则将早期信息直接保留至网络深层。实证分析还发现,其中一个分支会自然涌现为一条长程通路,将第一个 Attention 层与大部分中间层及后续层连接起来。

GR 还进一步简化了 Hyper-Connection。一旦读取和写入操作具备足够的表达能力,额外的分支混合便不再带来显著收益,可以直接移除,从而降低内存访问开销和训练不稳定性来源。Gate 机制还能有效抑制激活值离群点,提升训练稳定性。此外,Residual State 支持 FP8 存储,进一步减少了内存访问开销。

N-gram 嵌入:以低成本扩展模型容量#

受 Gemma 3n 中的逐层嵌入(Per-Layer Embedding)以及 DeepSeek Engram [6] 等工作的启发,我们进一步引入了 N-gram 嵌入(N-gram Embedding),以在 Transformer 主干参数之外扩展模型容量。

标准嵌入层仅基于单个 token 进行查找。而 N-gram 嵌入则利用当前 token 与其前若干个 token 构成的局部上下文进行查找,为常见短语和局部模式提供额外的表示。

其关键优势在于,它可以在几乎不增加每个 token 额外计算量的情况下,引入大量新增参数。

Qwen3.8-Flash-Next 额外引入了 51B 的 N-gram 嵌入参数。由于查找位置可以预先确定,这些参数可以存储在主机内存中,并在模型计算的同时进行异步预取,而不会永久占用 GPU 内存。

最终模型仅在网络起始位置附近使用单一的 N-gram 嵌入层,以相对较低的额外成本,有效增加了一个大规模的“局部模式记忆”。

优化:架构与优化的协同设计#

Qwen3.8-Flash-Next 使用 Muon 优化器 [7] 进行训练,并围绕将 Muon 应用于大规模模型训练的三个关键方面进行了进一步改进:正交化精度、Muon 与 AdamW 之间的参数分配,以及融合参数矩阵的拆分。

对于真正充当二维线性映射的参数,例如 Attention、GDN 和 MoE 专家中的主要权重,我们使用 Muon。嵌入层、MoE 路由器以及 GR 中的低秩参数则继续使用 AdamW。对于在实现中融合的 QKV、SwiGLU 和 GDN 投影,我们首先根据它们所代表的独立线性变换进行拆分,然后分别进行正交化。

针对新的架构和优化器,我们重新拟合了缩放定律(Scaling Law)。结果表明,该模型可以稳定地使用更大的学习率和批大小,进一步提升了收敛效率和大规模并行训练吞吐量。

我们还发现,大规模模型训练中的常见做法——Batch Size Warmup(批大小预热)已不再必要:从小 Batch 逐步增大到目标 Batch 并不会改善最终结果,反而需要多消耗 18.8% 的优化器步数。因此,在最终的训练方案中,我们直接以目标 Batch Size 开始训练。

其他架构优化#

其余组件沿用了 Qwen3-Next 中确立、并在 Qwen3.5–Qwen3.8 系列中持续打磨的设计。

超稀疏 MoE:通过全局负载均衡 [8],在保持激活专家数量不变的同时增加专家总参数量,可以稳定降低训练损失。因此,Qwen3.8-Flash-Next 采用大型专家池,每个 token 仅路由少量专家,并搭配一个共享专家。

多 token 预测:MTP 模块采用多步训练,保持训练与推理的一致性,从而提升真实场景中投机解码的接受率,同时增强主干模型的性能。其全注意力层也替换为 QSA。

训练稳定性:保留了零中心 RMSNorm(对归一化权重施加权重衰减)、注意力输出门控机制 [9] 以及归一化的 MoE 路由器初始化。这些设计使小规模消融实验更可靠,并有助于大规模训练平稳进行。

基座模型性能#

我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 和 Qwen3.7-Plus 的基座模型进行了对比。

Qwen3.8-Flash-Next-BaseQwen3.8-27B-BaseQwen3.7-Plus-Base

参数量

125B27B397B

激活参数量

6B27B17B

N-gram 嵌入参数量

51B----

通用任务

MMLU

90.3687.5190.43

MMLU-Redux

90.6887.2691.47

MMLU-Pro

73.2368.6070.90

SuperGPQA

51.3644.8648.42

BBH

90.8789.5689.41

数学与 STEM 任务

GPQA

51.4245.0151.52

GSM8K

93.2993.1892.95

MATH

72.7860.5474.38

编程任务

EvalPlus

78.7676.0578.06

MultiPL-E

79.0974.5081.68

SWEBench-Pretrain

50.9941.6649.24

多语言任务

MGSM

89.3386.3785.42

MMMLU

84.8679.7484.53

INCLUDE

78.4074.3778.90

  1. 每行最佳结果以粗体显示。
  2. 空单元格(--):表示分数尚未公布或不适用。

在激活参数为 6B 的情况下,Qwen3.8-Flash-Next-Base 在 14 项基准测试中的 8 项上取得了最佳成绩,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 和 MMMLU,并且在 MMLU、MMLU-Redux、GPQA、MATH 和 MultiPL-E 上保持与 Qwen3.7-Plus-Base 接近的水平。51B 的 N-gram 嵌入参数通过确定性寻址方式处理,不占用每个 token 的矩阵乘法预算。

使用 Qwen3.8-Flash-Next 进行开发#

Qwen3.8-Flash-Next 作为开放权重模型在 HuggingFace 和 ModelScope 上提供,并在 QwenCloud 上提供官方托管 API。该模型旨在平衡能力、延迟和成本,非常适合高吞吐量应用、工具驱动的工作流程以及编程与协作助手。下面,您可以了解如何调用 QwenCloud API,并将 Qwen3.8-Flash-Next 集成到智能体系统和编程助手中。

即将推出。该 API 尚未上线——将在本文发布后不久启用。本节中的示例届时即可使用。

Qwen3.8-Flash-Next 可通过 API 使用:

QwenCloud#

在 QwenCloud 上,该模型以名称 qwen3.8-flash 提供服务。QwenCloud 支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口。

""" 环境变量: DASHSCOPE_API_KEY:您的 API 密钥,来自 https://home.qwencloud.com/ DASHSCOPE_BASE_URL:(可选)兼容模式 API 的基础 URL。

  • 北京:https://dashscope.aliyuncs.com/compatible-mode/v1
  • 新加坡:https://dashscope-intl.aliyuncs.com/compatible-mode/v1
  • 美国(弗吉尼亚州):https://dashscope-us.aliyuncs.com/compatible-mode/v1 """ from openai import OpenAI import os api_key = os.environ.get("DASHSCOPE_API_KEY") if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" ) client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", ), ) messages = [{"role": "user", "content": "编写一个 Python 函数来合并两个已排序的链表。"}] completion = client.chat.completions.create( model="qwen3.8-flash", messages=messages, extra_body={ "enable_thinking": True,

"preserve_thinking": True,

}, reasoning_effort="xhigh", # 支持的级别为 xhigh、medium 和 low stream=True, ) reasoning_content = "" answer_content = "" is_answering = False print("\n" + "=" * 20 + "推理过程" + "=" * 20 + "\n") for chunk in completion: if not chunk.choices: print("\n用量:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" * 20 + "回答" + "=" * 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content

智能体框架与编程助手#

Qwen3.8-Flash-Next 与主流智能体框架和编程助手无缝集成:

QwenWork(即将推出)#

QwenWork 是阿里巴巴旗舰级 AI 生产力平台,旨在帮助个人和企业自动化日常任务并提升运营效率。

我们很高兴地宣布,QwenWork 已集成 Qwen3.8-Flash-Next,为其新推出的“标准”模式提供支持,充分利用该模型的尖端能力,提供流畅且高性价比的体验,为职场 AI 智能体树立新标准。

更多详情请参阅官方文档!

Claude Code#

Qwen API 支持 Anthropic API 协议,可直接与 Claude Code 配合使用:

npm install -g @anthropic-ai/claude-code export ANTHROPIC_MODEL="qwen3.8-flash" export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash" export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic export ANTHROPIC_AUTH_TOKEN= claude

Codex#

Qwen API 支持 OpenAI Responses 协议,因此可以与 Codex 配合使用:

在 ~/.codex/model-catalog.local.json 中

{ "models": [ { "slug": "qwen3.8-flash", "display_name": "qwen3.8-flash", "description": "QwenCloud: Qwen3.8-Flash", "default_reasoning_level": "xhigh", "supported_reasoning_levels": [ { "effort": "low", "description": "快速响应,推理较轻" }, { "effort": "medium", "description": "针对复杂问题提供更深入的推理" }, { "effort": "xhigh", "description": "针对复杂问题提供超高深度推理" } ], "context_window": 1000000, "effective_context_window_percent": 95, "supports_parallel_tool_calls": true, "supports_image_detail_original": true, "input_modalities": ["text", "image"], "shell_type": "default", "visibility": "list", "supported_in_api": true, "priority": 1, "base_instructions": "", "support_verbosity": false, "supports_reasoning_summaries": false, "experimental_supported_tools": [], "truncation_policy": { "mode": "bytes", "limit": 10000 } } ] }

在 ~/.codex/config.toml 中

model_catalog_json = "~/.codex/model-catalog.local.json" model_provider = "QwenCloud" model = "qwen3.8-flash" [model_providers.QwenCloud] name = "QwenCloud" base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1" env_key = "OPENAI_API_KEY" wire_api = "responses"

npm install -g @openai/codex export OPENAI_API_KEY= codex

Qoder CLI#

Qoder 与 Qwen 协同进化,专为智能体编程而生:

curl -fsSL https://qoder.com/install | bash qoder

Qwen Code#

Qwen Code 针对 Qwen 系列进行了深度优化:

npm install -g @qwen-code/qwen-code@latest qwen

OpenClaw#

通过 QwenCloud 连接 OpenClaw:

curl -fsSL https://openclaw.ai/install.sh | bash export DASHSCOPE_API_KEY= openclaw dashboard

配置 ~/.openclaw/openclaw.json:

{ "models": { "mode": "merge", "providers": { "qwencloud": { "baseUrl": "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", "apiKey": "DASHSCOPE_API_KEY", "api": "openai-completions", "models": [ { "id": "qwen3.8-flash", "name": "qwen3.8-flash", "reasoning": true, "input": ["text", "image"], "contextWindow": 1000000, "maxTokens": 65536 } ] } } }, "agents": { "defaults": { "model": { "primary": "qwencloud/qwen3.8-flash" } } } }

Qwen3.8-Flash-Next 在 Qwen3-Next 引入的混合架构基础上,沿四个方向进行了扩展:注意力机制、残差连接、嵌入向量和优化。QSA 将序列压缩到每一层内的微块中,在长上下文场景下同时降低了注意力计算成本和索引成本,同时保持了精确的检索能力。Gated Residual 将残差流拓宽为多个并行分支,并通过逐元素、依赖数据的门控机制控制读写操作,以可忽略不计的算术开销改善了跨层信息流动和训练稳定性;残差状态还可以额外以 FP8 格式保存,进一步减少内存流量。N-gram 嵌入通过确定性寻址的查找内存扩展容量,这种内存可以以可忽略不计的每 token 计算开销进行扩展,并可卸载到主机内存。在优化方面,Muon 被用作主要优化器,其中正交化精度、参数分配和融合矩阵切分是关键实现选择,同时针对新架构重新拟合了缩放定律。

我们提前发布这些权重,以便社区能够独立评估该架构,正如我们对 Qwen3-Next 所做的那样,我们将继续对其进行优化,朝着 Qwen4 的方向推进。

@techreport{qwen2026design, title = {On the Design of {Qwen3.8-Next} Architecture: Evaluation, Efficiency, and Training Stability}, author = {{Qwen Team}}, institution = {Alibaba Group}, month = {August}, year = {2026} } @misc{qwen3.8flashnext, title = {{Qwen3.8-Flash-Next}: A New Architecture, Towards Ultimate Cost-Efficiency}, author = {{Qwen Team}}, month = {August}, year = {2026}, url = {https://qwen.ai/blog?id=qwen3.8-flash-next} }

参考文献#

[1] Gated Delta Networks: Improving Mamba2 with Delta Rule

[2] DeepSeek-V3.2:推动开放大语言模型前沿发展

[3] IndexCache:通过跨层索引复用加速稀疏注意力

[4] 超连接(Hyper-Connections)

[5] 注意力与残差汇(Residual Sinks)的统一视角:异常值驱动的重缩放对 Transformer 训练至关重要

[6] 通过可扩展查找实现条件记忆:大语言模型稀疏性的新维度

[7] Muon:面向神经网络隐藏层的优化器

[8] 细节中的魔鬼:论训练专业化混合专家模型时负载均衡损失的实现

来源:Qwen:Blog Retrieval(API)· qwen.ai