Skip to content

英伟达开源全模态模型:300亿参数搞定视频/音频/文本,吞吐量9倍

2026年5月5日

📰 概要

英伟达又开源了一个大模型——这次是全模态的。

2026年4月28日(美东时间),英伟达正式开源全模态推理模型Nemotron 3 Nano Omni。

300亿参数(30B),Mamba+MoE混合架构,单模型打通视频/音频/图像/文本。

演示案例很直观:处理一段老黄的3分钟GTC演讲视频,几秒钟完成——吞吐量是同类模型的9倍。

目前免费使用,已经在GitHub和HuggingFace上线。


🔍 解读

全模态是什么意思?

之前的多模态模型,通常只能处理2-3种模态的组合(比如文本+图像,或者文本+语音)。

Nemotron 3 Nano Omni宣称是"全模态"——文本、图像、音频、视频、文档、图表、图形界面,全部可以输入,统一以文本形式输出。

这意味着一个AI模型可以完成过去需要多个模型配合才能做到的事:

  • 看视频+听音频+读文档+理解界面
  • 统一理解,统一输出

300亿参数是什么水平?

对比一下:

  • GPT-4:约1.8万亿参数(闭源)
  • Claude 3:约2万亿参数(闭源)
  • Llama 3 70B:700亿参数(开源)
  • Nemotron 3 Nano Omni:300亿参数

300亿参数在开源模型中属于中等规模,但加上Mamba+MoE混合架构,效率比纯稠密模型高得多。

MoE(Mixture of Experts)的好处是:虽然总参数多,但每次推理只激活部分参数——所以实际算力消耗比看起来低。


💎 深挖

技术细节:Mamba+MoE

Nemotron 3系列的技术路线很有意思:

Mamba是一种新的Transformer替代架构,专门为长序列设计,在视频和音频处理上有优势。相比传统Transformer,Mamba的推理效率更高、显存占用更低。

MoE(混合专家)让模型在保持大参数量的同时,每次只激活相关的"专家"子网络。这意味着:300亿参数的模型,实际推理成本可能只相当于60-100亿参数的稠密模型。

两者结合:Mamba负责高效处理长序列,MoE负责保持大模型的表达能力。这是英伟达在模型架构上的一次创新尝试。

为什么"几秒搞定3分钟演讲"很重要?

GTC演讲视频通常是连续的长视频,包含口播、PPT演示、代码演示等多种内容形态。传统多模态模型处理这类内容需要:

  • 视频解码(大量算力)
  • 音频转录(慢)
  • 跨模态对齐(复杂)

几秒完成意味着英伟达在这三个环节都做了优化。这对需要实时处理视频内容的AI应用场景(比如视频摘要、视频问答、视频编辑)有直接价值。

谁会用这个模型?

第一类:需要构建AI Agent的开发者。一个模型处理多种输入,比集成多个模型更简单。

第二类:需要处理大量多媒体内容的企业。比如视频平台、内容审核、在线教育。

第三类:边缘设备厂商。MoE架构让300亿参数模型可以在相对低的算力下运行,有潜力在本地部署。

什么情况不建议用

如果你的场景只需要纯文本处理,没有视频/音频需求,这个模型对你来说是"杀鸡用牛刀"——用GPT-4o Mini或者Llama 3 8B可能更划算。

如果你的场景需要实时语音交互(如语音助手),Nemotron 3 Nano Omni的输出形式还是文本,需要额外接TTS(文本转语音)模块,不是开箱即用的语音对话方案。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来