3月11日,英伟达正式发布开源大模型Nemotron 3 Super。这是一个拥有1200亿参数、支持100万token超长上下文的开放权重模型,专为复杂多智能体系统设计。它的发布,标志着英伟达在AI芯片之外,正加速向模型与软件生态的上游延伸。
事件详情:120B参数、百万级上下文
Nemotron 3 Super的核心规格相当激进:
- 1200亿总参数,混合专家架构:采用Mamba-Transformer混合架构结合多token预测技术,每次推理仅激活约120亿参数,兼顾能力与效率;
- 100万token上下文窗口:在开源模型中属于第一梯队,可一次性处理超长文档、完整代码库或多轮智能体交互历史;
- 推理吞吐大幅领先:官方数据显示,其推理吞吐达到GPT-OSS-120B的2.2倍,是上一代Nemotron Super版本的5倍;
- 真正开放:以宽松许可证开放模型权重,同时公开了10万亿token的合成训练数据,并提供NVIDIA NeMo微调工具支持;
- 多渠道可用:已上线build.nvidia.com、Hugging Face、Perplexity、OpenRouter和DeepInfra等平台,API定价约为每百万token输入0.10美元、输出0.50美元;
- 自托管门槛:BF16精度下自托管需要8张H100 80GB显卡,支持vLLM、TensorRT-LLM、SGLang推理框架和NIM微服务部署。
在第三方评测中,Nemotron 3 Super登顶Artificial Analysis效率与开放性榜单,并在DeepResearch Bench上排名第一。英伟达明确将其定位为多智能体任务的底座模型,重点优化了网络安全分析、代码库理解等需要多个智能体协作的场景。
背景分析:芯片巨头为何下场做模型
英伟达发布开源模型并非心血来潮。从Nemotron系列、Llama Nemotron到此次的Nemotron 3 Super,英伟达正在构建一条清晰的逻辑链:最好的AI芯片,需要最好的参考模型来证明其推理效率;而最好的参考模型,又能反过来锁定开发者生态,让更多工作负载跑在自家GPU上。
这与Meta开源Llama、谷歌开放Gemma的逻辑异曲同工,但英伟达的独特之处在于软硬一体:Nemotron 3 Super从训练之初就针对自家推理栈(TensorRT-LLM、NIM)做了深度优化,企业用户拿到的是一个开箱即用的高性能方案,而不只是一组权重文件。
另一方面,开源大模型的竞争在2026年已进入白热化。GPT-OSS系列、DeepSeek、千问、Llama等玩家各据一方,120B这个参数量级恰好卡在”单机可部署”与”能力够用”的甜点区——8张H100是许多中型企业实验室和云厂商的标配。英伟达此举,意在把这个甜点区变成自己的主场。
影响展望:多智能体落地的加速器
对开发者而言,Nemotron 3 Super的最大价值在于”开箱即用的多智能体能力”。100万上下文意味着智能体可以在一次任务中记住全部工具调用历史和中间结果,这对代码重构、安全审计等长程任务至关重要。
对行业而言,英伟达的持续加码正在改写开源模型的权力结构:当最大的算力供应商同时成为最强的开源模型供应商之一,独立模型厂商的生存空间将被进一步挤压。但硬币的另一面是,企业用户获得了前所未有的议价能力和迁移自由——开放权重意味着没有厂商锁定,这正是许多 regulated 行业选择开源模型的根本原因。
可以预见,随着GTC 2026上Nemotron Coalition(六个开放前沿模型家族)的推进,英伟达的”芯片+模型+软件”三位一体战略将更加清晰。AI基础设施的竞争,正在从单一硬件维度,升级为全栈生态的较量。
对于想要上手的团队,建议从云端API开始验证场景,再决定是否自托管。8张H100的门槛意味着它更适合有一定基础设施的企业或研究机构,个人开发者通过聚合平台按量调用反而更划算。英伟达把权重、训练数据、微调工具一次性给齐,实质是在降低“模型落地最后一公里”的门槛——而这正是2026年企业AI竞争的关键:模型能力大家都有,拼的是谁能更快、更便宜地把它变成生产力。