Appearance
📰 概要
2026年4月19日,阿里开源 Qwen3.6-35B-A3B 模型。采用 MoE(混合专家)架构,总参数 350 亿、推理时仅激活 30 亿,以更低算力消耗完成更高性能输出。
编程方面,在 Terminal-Bench 2.0、NL2Repo、QwenClawBench 等基准测试中,大幅超越前代 Qwen3.5-35B-A3B,可与 Qwen3.5-27B 和 Gemma4-31B 等稠密模型一较高下。
多模态推理在 MMBench、RealWorldQA、SimpleVQA 上表现媲美 Claude Sonnet 4.5。空间智能方面 RefCOCO 得分 92、ODInW13 得分 50.8。
🔍 解读
350 亿参数只激活 30 亿——这个 10:1 的稀疏比是 MoE 模型的核心卖点。意味着你在本地跑的时候,实际计算量和 3B 稠密模型差不多,但能力接近 27B 稠密模型。这对显存有限的开发者来说,不是"能用",是"好用"。
编程和 Agent 能力的提升是这次最值得关注的。QwenClawBench 是专门测真实世界 Agent 能力的基准,Qwen3.6-35B-A3B 在上面超越前代和同级模型,说明阿里的 Agent 路线在认真追 Claude。
但前提是:MoE 模型的推理效率取决于实现。3B 激活不等于 3B 稠密模型的推理速度——专家路由本身有开销。实际跑分和体验还需要实测。
💎 深挖
对比一下同级开源 MoE 模型:
| 模型 | 总参数 | 激活参数 | 编程能力 | 多模态 |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | 3B | 超Gemma4-31B | 媲美Sonnet4.5 |
| Qwen3.5-35B-A3B | 35B | 3B | 低于新版 | 弱于新版 |
| Gemma4-26B-A4B | 26B | 4B | 低于Qwen3.6 | — |
3B 激活、35B 总参数,这是目前开源 MoE 里效率最高的配比之一。
深度兼容 OpenClaw、Qwen Code、Claude Code 是另一个重要信号。阿里不只是在做一个模型,是在做一个本地 Agent 生态的入口。你的 Agent 能在本地跑 35B 级别的能力,不依赖云端 API——这对隐私敏感场景(金融、医疗、政企)是刚需。
对开发者来说,建议直接下载 HuggingFace 或魔搭的权重,在本地跑几个你真实场景的测试:编程任务、Agent 多步推理、多模态识别。对比你当前用的模型看效果。如果你的 GPU 是 8GB 显存,3B 激活刚好能跑;16GB 以上体验更佳。
风险在于:MoE 的显存占用不是只看激活参数,35B 的全部权重都得加载进内存。8GB 显存跑 35B 的模型需要量化到 W4A16 或更低,精度会有损失。如果你的场景对推理精度敏感,建议先用 FP16 在 24GB 显卡上测基线,再决定量化级别。
