Appearance
📰 概要
2026年4月29日,英伟达发布 Nemotron 3 Nano Omni——一款开源全模态推理模型。采用30B-A3B混合 MoE 架构,单 token 仅激活约3B参数。
性能数据很强:视频推理吞吐量比其他开源全模态模型最高提升9.2倍,多文档推理吞吐量提升4.2倍。
支持文本、图像、视频、音频、文档、图表和 GUI 屏幕等多种输入。属于 Nemotron 3 系列的 Nano(轻量)级别。
🔍 解读
Nemotron 3 Nano Omni 最值得关注的不是参数大小,而是"全模态 + 高吞吐 + 开源"的组合。
30B 总参数但只激活3B,意味着它能在消费级 GPU 上跑。企业不需要买 H100 集群才能部署。加上开源,开发者可以自由微调和定制。
英伟达的产品策略很清晰:Nano 做端侧和轻量部署,Super 做高频执行,Ultra 做复杂规划。三层覆盖从手机到数据中心的全部场景。
对比 Meta 的 Llama 系列,英伟达这次加了全模态能力——不仅能理解文字,还能看视频、听音频、读图表。这对 AI Agent 场景尤其重要。
💎 深挖
技术架构上,Nemotron 3 Nano Omni 混合了 Mamba-2 和 Transformer 两种架构。Mamba 是状态空间模型,擅长长序列处理。 配合稀疏 MoE,实现高吞吐和低延迟。
100万 token 上下文窗口意味着可以一次性处理整本教材或长达数小时的视频。在视频推理任务中,固定延迟阈值下的聚合吞吐量提升9.2倍,对视频分析、监控、内容审核等场景意义重大。
英伟达在 Nemotron 3 训练中用了 SFT + RLVR + RLHF 多阶段对齐。RLVR(可验证奖励强化学习)是2025年兴起的新技术,擅长训练推理和工具调用能力。
什么情况不建议用 Nemotron 3 Nano Omni?如果你的场景需要超大规模参数(1000B+ 级别),Nano 的 30B 不够用,应选 Ultra。 另外,MoE 架构对显存带宽有要求,消费级显卡虽能跑但速度受限。
对开发者来说,Nemotron 3 Nano Omni 的开源价值很大。全模态开源模型很少,英伟达填补了空白。 适合做 AI Agent 的基础模型——一个模型处理视觉、听觉、文本,不用拼凑多个模型。
