Skip to content

英伟达开源Nemotron 3 Nano Omni:30B全模态模型,吞吐量飙升9倍

2026年4月29日

📰 概要

2026年4月29日,英伟达发布 Nemotron 3 Nano Omni——一款开源全模态推理模型。采用30B-A3B混合 MoE 架构,单 token 仅激活约3B参数。

性能数据很强:视频推理吞吐量比其他开源全模态模型最高提升9.2倍,多文档推理吞吐量提升4.2倍。

支持文本、图像、视频、音频、文档、图表和 GUI 屏幕等多种输入。属于 Nemotron 3 系列的 Nano(轻量)级别。


🔍 解读

Nemotron 3 Nano Omni 最值得关注的不是参数大小,而是"全模态 + 高吞吐 + 开源"的组合。

30B 总参数但只激活3B,意味着它能在消费级 GPU 上跑。企业不需要买 H100 集群才能部署。加上开源,开发者可以自由微调和定制。

英伟达的产品策略很清晰:Nano 做端侧和轻量部署,Super 做高频执行,Ultra 做复杂规划。三层覆盖从手机到数据中心的全部场景。

对比 Meta 的 Llama 系列,英伟达这次加了全模态能力——不仅能理解文字,还能看视频、听音频、读图表。这对 AI Agent 场景尤其重要。


💎 深挖

技术架构上,Nemotron 3 Nano Omni 混合了 Mamba-2 和 Transformer 两种架构。Mamba 是状态空间模型,擅长长序列处理。 配合稀疏 MoE,实现高吞吐和低延迟。

100万 token 上下文窗口意味着可以一次性处理整本教材或长达数小时的视频。在视频推理任务中,固定延迟阈值下的聚合吞吐量提升9.2倍,对视频分析、监控、内容审核等场景意义重大。

英伟达在 Nemotron 3 训练中用了 SFT + RLVR + RLHF 多阶段对齐。RLVR(可验证奖励强化学习)是2025年兴起的新技术,擅长训练推理和工具调用能力。

什么情况不建议用 Nemotron 3 Nano Omni?如果你的场景需要超大规模参数(1000B+ 级别),Nano 的 30B 不够用,应选 Ultra。 另外,MoE 架构对显存带宽有要求,消费级显卡虽能跑但速度受限。

对开发者来说,Nemotron 3 Nano Omni 的开源价值很大。全模态开源模型很少,英伟达填补了空白。 适合做 AI Agent 的基础模型——一个模型处理视觉、听觉、文本,不用拼凑多个模型。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来