Hacker News 热门(buzzing.cc 中文翻译)
精选
75AI 编辑部评分,满分 100

Qwen 3.6 27B 是本地开发的理想选择

2026-06-30 02:03· 45天前· stared
AI 导读

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。

推荐理由

一篇详实的 Qwen 3.6 27B 实战评测,从创意写作到代码生成都测了,还给出了 llama.cpp 部署命令和性能数据,想本地跑模型的开发者可以直接抄作业。

正文 · AI 翻译

过去我对本地模型一直感到失望。但当我试用了 Qwen3.6 后,我深感震撼。对我来说,这是第一个真正意义上具备通用智能的本地模型。

它有两个版本:一个是混合专家模型 Qwen3.6 35B A3B,另一个是密集模型 Qwen3.6 27B——速度较慢,但能力更强。我推荐后者!

让我分享一下我的使用感受,并告诉你如何也能运行它。

Thermal camera image

它真的很烫。当我的膝盖开始发烫时,我拿起一个手机外接热成像相机拍了张照片。

Qwen3.6 在 Hacker News 上获得了大量报道,这实至名归。关于 Qwen3.6 27B,最常见的评价是它“以小博大”——详见 Will it Mythos?。我认为这种评价当之无愧。它会让你的电脑发热,但绝对值得!

初步测试

Simon Willison 使用“一只骑自行车的鹈鹕”作为烟雾测试(参见 Qwen3.6 35B A3B 和 Qwen3.6 27B 的测试)。我通常采用受限写作测试。

Chat about quantum mechanics with Qwen3.6

一年前,这类任务还是最前沿的技术,需要独一无二且极其昂贵的 GPT-4.5,例如 vibe 翻译 Quantum Flytrap 这个案例。

我还让它写了一首关于 Zouk 舞蹈和量子物理的八行诗,详见记录。它的思考过程很有道理,无论是在量子术语的斟酌还是押韵方面。

接着,我让它在 OpenCode 中使用 pnpm 创建一个六边形扫雷游戏。它成功了:

一次提示就成功了,生成了一个完整的 Node 包。混合专家模型 Qwen3.6 35B A3B 速度更快……但忽略了我创建包的要求,而是做成了一个单独的 index.html 文件。

实际工作

当然,关于量子力学的创意写作,或者又一个扫雷游戏的克隆,很少是日常工作。但 Qwen3.6 27B 在处理常规任务时也相当不错。

Maciej Cielecki's candle-shop prompt running in OpenCode

由我的朋友 Maciej Cielecki 在华沙 AI Tinkerers 活动上提供的提示词。

它运行了几分钟,创建了以下内容:

A landing page by Qwen3.6 27B

由 Qwen3.6 27B 生成的着陆页——查看在线页面。

按照当前前沿模型的标准来看,这并不出彩。但这已经是一项实用的工作了。它运行成功、响应式布局、默认样式也很美观——全部来自一个简短的提示词。

使用 llama.cpp 本地运行 Qwen3.6

运行本地模型从未如此简单。只需几行 CLI 命令即可开始。

我推荐 llama.cpp —— 一个直接、开源的工具,可以在各种设备上运行模型。你不需要 Ollama,而且坦白说——基于道德考量,我建议不要使用它。

首先,我们去 Hugging Face 获取合适的量化版本,即缩小尺寸的模型——流行的版本来自 unsloth 或 bartowski 等。默认模型通常采用 BF16 精度。常见的 8 位量化可以节省一半空间,且几乎不损失质量。进一步降低量化后,模型会更小(也可能更快),但会牺牲质量,请参见 27B 模型的对比以及 35B A3B 模型的另一份对比。

我们下载 unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0,这是一个支持多 token 预测(MTP)的 8 位量化模型。

llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
    --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080

它的作用是:

  • -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 从 Hugging Face 获取模型,后续运行时会复用该缓存
  • -m ~/models/Qwen3.6-27B-Q8_0.gguf 如果你已有该文件,则使用此路径
  • draft-mtp 我们使用一个快速模型来预测后续 token,从而加速推理
  • -ngl 999 将所有层加载到 GPU
  • -fa 开启 flash attention
  • -c 65536 将上下文大小设置为 64k tokens(这个值我们可以调整,因为 Qwen3.6 27B 的原生上下文是 256k)
  • --port 8080 最好固定端口,因为其他配置也会用到它

如果你打开 http://127.0.0.1:8080,就可以直接与它对话。

完全相同的服务器也可以用于 vibe coding。智能体的选择取决于个人目标和主观偏好——全能型选 OpenCode,极简型选 Pi,自我改进型选 Hermes。

对于 OpenCode,只需在 ~/.config/opencode/opencode.jsonc 中添加以下内容:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "llama": {
      "name": "llama.cpp (local)",
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
        "apiKey": "local"
      },
      "models": {
        "qwen3.6-27b": { "name": "Qwen3.6-27B Q8 +MTP" }
      }
    }
  },
  "model": "llama/qwen3.6-27b"
}

如果你只想聊天并且是终端的重度用户,可以用 llama-cli 代替 llama-server:

llama-cli -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
    -ngl 999 -fa on -c 65536

性能测试

它够快吗?

我在我的 MacBook M5 Max 128 GB 上运行了一些测试(源代码在 GitHub 上),分别测试了开启和关闭多 token 预测的情况,并与 35B A3B 模型以及量化版的 DeepSeek V4 Flash 版本 DwarfStar4 进行了对比。

tokens / 秒

内存

Qwen3.6-35B-A3B

· 8 位

MLX

85 tok/s

85

37 GB 内存

37 GB

llama.cpp

93 tok/s

93

44 GB 内存

44 GB

llama.cpp + MTP

105 tok/s

105

45 GB 内存

45 GB

Qwen3.6-27B

· 8 位

MLX

17 tok/s

17

28 GB 内存

28 GB

llama.cpp

18 tok/s

18

41 GB 内存

41 GB

llama.cpp + MTP

32 tok/s

32

42 GB 内存

42 GB

DeepSeek-V4-Flash

· Q2–Q4

llama.cpp

33 tok/s

33

103 GB 内存

103 GB

每秒 30 个 token 并不差,完全在主流前沿模型 API 的典型范围内。虽然 mlx-lm 专门针对 Apple Silicon 设备优化,且 AI 智能体强烈推荐它,但实际测试中 llama.cpp 速度更快。它使用了 95% 的 GPU,说明能高效利用可用资源。

MacBook M5 Max 性能强劲(至少对于笔记本电脑而言),但在其他设备上也能表现不错。如你所见,Qwen3.6 的两个变体都能在 48 GB 的 Apple Silicon 共享内存中运行。4-bit 量化版本不到 18 GB,可以在 32 GB 设备上运行。在消费级 NVIDIA RTX 显卡上,需要激进量化,但推理速度甚至更快。

我今天在 5090 上以 Q6_K 量化和 Q4_0 KV 缓存设置跑了一下,在 123k 上下文下稳定达到 50 tok/s,通过 LM Studio 占用约 28/32 GB 显存。——gfosco 在 Hacker News 上的评论

虽然 35B A3B 速度快 3 倍,但我更喜欢 27B。我宁愿生成少三分之二的代码,但质量更高。

它们与之前最先进的模型相比如何?

人工检查固然好,但基准测试有助于建立直观感受。以下是 Artificial Analysis 的评分,与前沿模型对比:

Gemma 4 31B

29

≈ 2024 年底

o1 / Claude 3.5 Sonnet

Qwen3.6-35B-A3B

32

≈ 2025 年初

o3 / Claude 4 Sonnet

Qwen3.6-27B

37

≈ 2025 年中

GPT-5 / Claude Sonnet 4.5

DeepSeek-V4-Flash

40

≈ 2025 年底

GPT-5.2 / Claude Opus 4.5

这些笔记中还有更多基准测试,但整体趋势类似。这里加入了 Gemma 4 31B,因为很多人将其作为本地编码的默认模型。但无论是基准测试还是网络上的普遍看法,都明显更倾向于 Qwen3.6 27B。

这里有一个注意事项——Qwen3.6 的 8-bit 量化可能对结果影响不大,但 DwarfStar4 对 DeepSeek V4 Flash 使用了更激进的量化(2-4 bit)。这肯定不如完整模型。我个人印象是,在这些量化级别下,Qwen3.6 27B 与 DwarfStar4 表现相当(甚至可能略好)。不过,如果对于更长上下文项目 DS4 更有优势,我也不会感到意外。

下一步是什么

我认为我们正在进入一个迷人的时代,运行自己的模型变得切实可行。

这一趋势将因专有前沿模型的现状而进一步加速。Claude Fable 5 已被下架。其他前沿模型目前以巨额补贴的方式运行,用户每月支付 100 美元,就能获得价值数千美元的模型 token。让我们趁此折扣还在,好好利用吧!

本地运行的模型可以根据我们的需求进行微调,并且不会被下架。企业可以将其用于专有和敏感数据。我们个人也可以将其用于离线项目,或者在我们不愿与美国或中国分享内心最深处的秘密或医疗数据时使用。

随着前沿级开源权重模型 GLM 5.2 的发布,一个新时代已经到来。虽然 Qwen3.6 是垫脚石,但即使是前沿级的 GLM 5.2 也可以在本地运行。它无法在你的 MacBook 或单张 RTX 5090 上运行,但即便如此,用公司的预算还是可以负担的。

此外,我坚信我们将拥有比当前最先进模型更智能的模型,同时还能在本地设备(甚至可能是智能手机)上运行。当前的模型将原始智能和事实知识混合在相同的权重中。未来的模型很可能会将两者分离,将大量知识卸载到工具调用中。

在 Hacker News、LinkedIn 或 X 上参与讨论。

敬请关注未来的文章和发布。

或者

Compare harnesses, not models: Blitzy vs. GPT-5.4 on SWE-Bench Pro

来源:Hacker News 热门(buzzing.cc 中文翻译) · quesma.com

Qwen 3.6 27B 是本地开发的理想选择

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-30 02:03·45天前·stared
AI 导读

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。

正文 · AI 翻译

过去我对本地模型一直感到失望。但当我试用了 Qwen3.6 后,我深感震撼。对我来说,这是第一个真正意义上具备通用智能的本地模型。

它有两个版本:一个是混合专家模型 Qwen3.6 35B A3B,另一个是密集模型 Qwen3.6 27B——速度较慢,但能力更强。我推荐后者!

让我分享一下我的使用感受,并告诉你如何也能运行它。

Thermal camera image

它真的很烫。当我的膝盖开始发烫时,我拿起一个手机外接热成像相机拍了张照片。

Qwen3.6 在 Hacker News 上获得了大量报道,这实至名归。关于 Qwen3.6 27B,最常见的评价是它“以小博大”——详见 Will it Mythos?。我认为这种评价当之无愧。它会让你的电脑发热,但绝对值得!

初步测试

Simon Willison 使用“一只骑自行车的鹈鹕”作为烟雾测试(参见 Qwen3.6 35B A3B 和 Qwen3.6 27B 的测试)。我通常采用受限写作测试。

Chat about quantum mechanics with Qwen3.6

一年前,这类任务还是最前沿的技术,需要独一无二且极其昂贵的 GPT-4.5,例如 vibe 翻译 Quantum Flytrap 这个案例。

我还让它写了一首关于 Zouk 舞蹈和量子物理的八行诗,详见记录。它的思考过程很有道理,无论是在量子术语的斟酌还是押韵方面。

接着,我让它在 OpenCode 中使用 pnpm 创建一个六边形扫雷游戏。它成功了:

一次提示就成功了,生成了一个完整的 Node 包。混合专家模型 Qwen3.6 35B A3B 速度更快……但忽略了我创建包的要求,而是做成了一个单独的 index.html 文件。

实际工作

当然,关于量子力学的创意写作,或者又一个扫雷游戏的克隆,很少是日常工作。但 Qwen3.6 27B 在处理常规任务时也相当不错。

Maciej Cielecki's candle-shop prompt running in OpenCode

由我的朋友 Maciej Cielecki 在华沙 AI Tinkerers 活动上提供的提示词。

它运行了几分钟,创建了以下内容:

A landing page by Qwen3.6 27B

由 Qwen3.6 27B 生成的着陆页——查看在线页面。

按照当前前沿模型的标准来看,这并不出彩。但这已经是一项实用的工作了。它运行成功、响应式布局、默认样式也很美观——全部来自一个简短的提示词。

使用 llama.cpp 本地运行 Qwen3.6

运行本地模型从未如此简单。只需几行 CLI 命令即可开始。

我推荐 llama.cpp —— 一个直接、开源的工具,可以在各种设备上运行模型。你不需要 Ollama,而且坦白说——基于道德考量,我建议不要使用它。

首先,我们去 Hugging Face 获取合适的量化版本,即缩小尺寸的模型——流行的版本来自 unsloth 或 bartowski 等。默认模型通常采用 BF16 精度。常见的 8 位量化可以节省一半空间,且几乎不损失质量。进一步降低量化后,模型会更小(也可能更快),但会牺牲质量,请参见 27B 模型的对比以及 35B A3B 模型的另一份对比。

我们下载 unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0,这是一个支持多 token 预测(MTP)的 8 位量化模型。

llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
    --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080

它的作用是:

  • -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 从 Hugging Face 获取模型,后续运行时会复用该缓存
  • -m ~/models/Qwen3.6-27B-Q8_0.gguf 如果你已有该文件,则使用此路径
  • draft-mtp 我们使用一个快速模型来预测后续 token,从而加速推理
  • -ngl 999 将所有层加载到 GPU
  • -fa 开启 flash attention
  • -c 65536 将上下文大小设置为 64k tokens(这个值我们可以调整,因为 Qwen3.6 27B 的原生上下文是 256k)
  • --port 8080 最好固定端口,因为其他配置也会用到它

如果你打开 http://127.0.0.1:8080,就可以直接与它对话。

完全相同的服务器也可以用于 vibe coding。智能体的选择取决于个人目标和主观偏好——全能型选 OpenCode,极简型选 Pi,自我改进型选 Hermes。

对于 OpenCode,只需在 ~/.config/opencode/opencode.jsonc 中添加以下内容:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "llama": {
      "name": "llama.cpp (local)",
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
        "apiKey": "local"
      },
      "models": {
        "qwen3.6-27b": { "name": "Qwen3.6-27B Q8 +MTP" }
      }
    }
  },
  "model": "llama/qwen3.6-27b"
}

如果你只想聊天并且是终端的重度用户,可以用 llama-cli 代替 llama-server:

llama-cli -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
    -ngl 999 -fa on -c 65536

性能测试

它够快吗?

我在我的 MacBook M5 Max 128 GB 上运行了一些测试(源代码在 GitHub 上),分别测试了开启和关闭多 token 预测的情况,并与 35B A3B 模型以及量化版的 DeepSeek V4 Flash 版本 DwarfStar4 进行了对比。

tokens / 秒

内存

Qwen3.6-35B-A3B

· 8 位

MLX

85 tok/s

85

37 GB 内存

37 GB

llama.cpp

93 tok/s

93

44 GB 内存

44 GB

llama.cpp + MTP

105 tok/s

105

45 GB 内存

45 GB

Qwen3.6-27B

· 8 位

MLX

17 tok/s

17

28 GB 内存

28 GB

llama.cpp

18 tok/s

18

41 GB 内存

41 GB

llama.cpp + MTP

32 tok/s

32

42 GB 内存

42 GB

DeepSeek-V4-Flash

· Q2–Q4

llama.cpp

33 tok/s

33

103 GB 内存

103 GB

每秒 30 个 token 并不差,完全在主流前沿模型 API 的典型范围内。虽然 mlx-lm 专门针对 Apple Silicon 设备优化,且 AI 智能体强烈推荐它,但实际测试中 llama.cpp 速度更快。它使用了 95% 的 GPU,说明能高效利用可用资源。

MacBook M5 Max 性能强劲(至少对于笔记本电脑而言),但在其他设备上也能表现不错。如你所见,Qwen3.6 的两个变体都能在 48 GB 的 Apple Silicon 共享内存中运行。4-bit 量化版本不到 18 GB,可以在 32 GB 设备上运行。在消费级 NVIDIA RTX 显卡上,需要激进量化,但推理速度甚至更快。

我今天在 5090 上以 Q6_K 量化和 Q4_0 KV 缓存设置跑了一下,在 123k 上下文下稳定达到 50 tok/s,通过 LM Studio 占用约 28/32 GB 显存。——gfosco 在 Hacker News 上的评论

虽然 35B A3B 速度快 3 倍,但我更喜欢 27B。我宁愿生成少三分之二的代码,但质量更高。

它们与之前最先进的模型相比如何?

人工检查固然好,但基准测试有助于建立直观感受。以下是 Artificial Analysis 的评分,与前沿模型对比:

Gemma 4 31B

29

≈ 2024 年底

o1 / Claude 3.5 Sonnet

Qwen3.6-35B-A3B

32

≈ 2025 年初

o3 / Claude 4 Sonnet

Qwen3.6-27B

37

≈ 2025 年中

GPT-5 / Claude Sonnet 4.5

DeepSeek-V4-Flash

40

≈ 2025 年底

GPT-5.2 / Claude Opus 4.5

这些笔记中还有更多基准测试,但整体趋势类似。这里加入了 Gemma 4 31B,因为很多人将其作为本地编码的默认模型。但无论是基准测试还是网络上的普遍看法,都明显更倾向于 Qwen3.6 27B。

这里有一个注意事项——Qwen3.6 的 8-bit 量化可能对结果影响不大,但 DwarfStar4 对 DeepSeek V4 Flash 使用了更激进的量化(2-4 bit)。这肯定不如完整模型。我个人印象是,在这些量化级别下,Qwen3.6 27B 与 DwarfStar4 表现相当(甚至可能略好)。不过,如果对于更长上下文项目 DS4 更有优势,我也不会感到意外。

下一步是什么

我认为我们正在进入一个迷人的时代,运行自己的模型变得切实可行。

这一趋势将因专有前沿模型的现状而进一步加速。Claude Fable 5 已被下架。其他前沿模型目前以巨额补贴的方式运行,用户每月支付 100 美元,就能获得价值数千美元的模型 token。让我们趁此折扣还在,好好利用吧!

本地运行的模型可以根据我们的需求进行微调,并且不会被下架。企业可以将其用于专有和敏感数据。我们个人也可以将其用于离线项目,或者在我们不愿与美国或中国分享内心最深处的秘密或医疗数据时使用。

随着前沿级开源权重模型 GLM 5.2 的发布,一个新时代已经到来。虽然 Qwen3.6 是垫脚石,但即使是前沿级的 GLM 5.2 也可以在本地运行。它无法在你的 MacBook 或单张 RTX 5090 上运行,但即便如此,用公司的预算还是可以负担的。

此外,我坚信我们将拥有比当前最先进模型更智能的模型,同时还能在本地设备(甚至可能是智能手机)上运行。当前的模型将原始智能和事实知识混合在相同的权重中。未来的模型很可能会将两者分离,将大量知识卸载到工具调用中。

在 Hacker News、LinkedIn 或 X 上参与讨论。

敬请关注未来的文章和发布。

或者

Compare harnesses, not models: Blitzy vs. GPT-5.4 on SWE-Bench Pro

来源:Hacker News 热门(buzzing.cc 中文翻译)· quesma.com