Appearance
📰 概要
英伟达又开源了一个大模型——这次是全模态的。
2026年4月28日(美东时间),英伟达正式开源全模态推理模型Nemotron 3 Nano Omni。
300亿参数(30B),Mamba+MoE混合架构,单模型打通视频/音频/图像/文本。
演示案例很直观:处理一段老黄的3分钟GTC演讲视频,几秒钟完成——吞吐量是同类模型的9倍。
目前免费使用,已经在GitHub和HuggingFace上线。
🔍 解读
全模态是什么意思?
之前的多模态模型,通常只能处理2-3种模态的组合(比如文本+图像,或者文本+语音)。
Nemotron 3 Nano Omni宣称是"全模态"——文本、图像、音频、视频、文档、图表、图形界面,全部可以输入,统一以文本形式输出。
这意味着一个AI模型可以完成过去需要多个模型配合才能做到的事:
- 看视频+听音频+读文档+理解界面
- 统一理解,统一输出
300亿参数是什么水平?
对比一下:
- GPT-4:约1.8万亿参数(闭源)
- Claude 3:约2万亿参数(闭源)
- Llama 3 70B:700亿参数(开源)
- Nemotron 3 Nano Omni:300亿参数
300亿参数在开源模型中属于中等规模,但加上Mamba+MoE混合架构,效率比纯稠密模型高得多。
MoE(Mixture of Experts)的好处是:虽然总参数多,但每次推理只激活部分参数——所以实际算力消耗比看起来低。
💎 深挖
技术细节:Mamba+MoE
Nemotron 3系列的技术路线很有意思:
Mamba是一种新的Transformer替代架构,专门为长序列设计,在视频和音频处理上有优势。相比传统Transformer,Mamba的推理效率更高、显存占用更低。
MoE(混合专家)让模型在保持大参数量的同时,每次只激活相关的"专家"子网络。这意味着:300亿参数的模型,实际推理成本可能只相当于60-100亿参数的稠密模型。
两者结合:Mamba负责高效处理长序列,MoE负责保持大模型的表达能力。这是英伟达在模型架构上的一次创新尝试。
为什么"几秒搞定3分钟演讲"很重要?
GTC演讲视频通常是连续的长视频,包含口播、PPT演示、代码演示等多种内容形态。传统多模态模型处理这类内容需要:
- 视频解码(大量算力)
- 音频转录(慢)
- 跨模态对齐(复杂)
几秒完成意味着英伟达在这三个环节都做了优化。这对需要实时处理视频内容的AI应用场景(比如视频摘要、视频问答、视频编辑)有直接价值。
谁会用这个模型?
第一类:需要构建AI Agent的开发者。一个模型处理多种输入,比集成多个模型更简单。
第二类:需要处理大量多媒体内容的企业。比如视频平台、内容审核、在线教育。
第三类:边缘设备厂商。MoE架构让300亿参数模型可以在相对低的算力下运行,有潜力在本地部署。
什么情况不建议用
如果你的场景只需要纯文本处理,没有视频/音频需求,这个模型对你来说是"杀鸡用牛刀"——用GPT-4o Mini或者Llama 3 8B可能更划算。
如果你的场景需要实时语音交互(如语音助手),Nemotron 3 Nano Omni的输出形式还是文本,需要额外接TTS(文本转语音)模块,不是开箱即用的语音对话方案。
