Skip to content

350 亿参数只激活 30 亿:Qwen3.6-35B-A3B 让本地部署不再是妥协

2026年4月21日

📰 概要

2026年4月19日,阿里开源 Qwen3.6-35B-A3B 模型。采用 MoE(混合专家)架构,总参数 350 亿、推理时仅激活 30 亿,以更低算力消耗完成更高性能输出。

编程方面,在 Terminal-Bench 2.0、NL2Repo、QwenClawBench 等基准测试中,大幅超越前代 Qwen3.5-35B-A3B,可与 Qwen3.5-27B 和 Gemma4-31B 等稠密模型一较高下。

多模态推理在 MMBench、RealWorldQA、SimpleVQA 上表现媲美 Claude Sonnet 4.5。空间智能方面 RefCOCO 得分 92、ODInW13 得分 50.8。


🔍 解读

350 亿参数只激活 30 亿——这个 10:1 的稀疏比是 MoE 模型的核心卖点。意味着你在本地跑的时候,实际计算量和 3B 稠密模型差不多,但能力接近 27B 稠密模型。这对显存有限的开发者来说,不是"能用",是"好用"。

编程和 Agent 能力的提升是这次最值得关注的。QwenClawBench 是专门测真实世界 Agent 能力的基准,Qwen3.6-35B-A3B 在上面超越前代和同级模型,说明阿里的 Agent 路线在认真追 Claude。

但前提是:MoE 模型的推理效率取决于实现。3B 激活不等于 3B 稠密模型的推理速度——专家路由本身有开销。实际跑分和体验还需要实测。


💎 深挖

对比一下同级开源 MoE 模型:

模型总参数激活参数编程能力多模态
Qwen3.6-35B-A3B35B3B超Gemma4-31B媲美Sonnet4.5
Qwen3.5-35B-A3B35B3B低于新版弱于新版
Gemma4-26B-A4B26B4B低于Qwen3.6

3B 激活、35B 总参数,这是目前开源 MoE 里效率最高的配比之一。

深度兼容 OpenClaw、Qwen Code、Claude Code 是另一个重要信号。阿里不只是在做一个模型,是在做一个本地 Agent 生态的入口。你的 Agent 能在本地跑 35B 级别的能力,不依赖云端 API——这对隐私敏感场景(金融、医疗、政企)是刚需。

对开发者来说,建议直接下载 HuggingFace 或魔搭的权重,在本地跑几个你真实场景的测试:编程任务、Agent 多步推理、多模态识别。对比你当前用的模型看效果。如果你的 GPU 是 8GB 显存,3B 激活刚好能跑;16GB 以上体验更佳。

风险在于:MoE 的显存占用不是只看激活参数,35B 的全部权重都得加载进内存。8GB 显存跑 35B 的模型需要量化到 W4A16 或更低,精度会有损失。如果你的场景对推理精度敏感,建议先用 FP16 在 24GB 显卡上测基线,再决定量化级别。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来