

。 OpenAI、Meta这些巨头不管谁搞出了新模型,最终都得靠英伟达的芯片来运行。
这种稳赚不赔的生意,让英伟达市值一路飙升,成了全球最赚钱的科技公司之一。可谁也没想到,2025年底英伟达突然改变了玩法,它不想只做背后的供货商,反而亲自下场“挖矿”。
这次它推出的开源AI模型家族Nemotron 3,看似是给开发者送福利,实则藏着掌控整个AI生态的大计划。 更有意思的是,这款被寄予厚望的模型,在开源榜单上排名却只有第120位,这波操作实在让人看不懂。
过去这些年,英伟达靠CUDA生态和高性能GPU,在AI芯片领域几乎没对手。 谷歌的TPU虽然能与之抗衡,但短期内还没法撼动它的地位。 可随着市场竞争加剧,英伟达的危机感也越来越强。
就在12月初,英伟达正式发布了全新的开源模型家族Nemotron 3,涵盖了Nano、Super和Ultra三个规格,目标是覆盖从手机、电脑到超级计算机的全场景需求。 这可不是一次简单的产品更新,而是英伟达从硬件巨头向全栈生态霸主转型的信号。
现已发布的Nemotron 3 Nano总参数量有300亿,推理时激活参数却只有30亿左右,在消费级显卡上就能流畅运行。 按照规划,2026年上半年还会推出1000亿参数的Super和5000亿参数的Ultra,其中Ultra更是直接对标GPT-5。 值得一提的是,为了应对竞争对手的冲击,英伟达还在悄悄加固自己的护城河。
12月17日网易报道称,代码移植库ZLUDA迎来重大升级,支持AMD最新的ROCm 7软件框架,能让原本专属英伟达的AI工作负载在AMD硬件上运行。 这无疑是对英伟达CUDA生态的直接挑战,也难怪英伟达要急着推出自己的模型。
Nemotron 3最亮眼的地方,就是融合了Mamba、Transformer和MoE三大顶尖技术。 要知道,Transformer架构虽然是大模型的主流,但处理超长文本时,计算量和内存消耗会呈平方级增长,很容易撑爆显存。
而Mamba架构就不一样了,它处理文本的方式更像人类读书,会把过去的内容“消化”成固定大小的记忆,不管文本多长,推理消耗都几乎恒定。 英伟达把这两种架构结合起来,让Nemotron 3 Nano拥有了100万token的超长上下文窗口,推理速度也比同尺寸纯Transformer模型快了4倍。
MoE架构则解决了算力浪费的问题,就像一个“专家团”,不同问题由不同专家处理,不用调动全部参数。 可即便有这么多技术亮点,Nemotron 3的表现却不尽如人意。 数据显示,Nemotron 3 Nano在文本排行榜上排名第120位,得分为1328分,在开源模型中也只排第47位。
有开发者试用后表示,这款模型在处理复杂逻辑推理时,精准度不如同类开源模型。 看来英伟达虽然在硬件领域风生水起,但在模型研发上,还需要多下点功夫。
其实英伟达推出开源模型,根本不是为了和其他厂商比拼模型性能,而是为了绑定自己的硬件生态。 这一点,从Nemotron 3采用的NVFP4格式就能看出来。
这种格式是英伟达下一代GPU架构Blackwell的原生支持格式,相比现在常用的FP16或BF16,能将模型体积压缩3.5倍,而且还能保持高性能。 这意味着未来运行Nemotron 3 Super和Ultra,最好的选择就是英伟达的Blackwell显卡。
更关键的是,Mamba架构对硬件优化要求极高,目前只有在英伟达的GPU上,才能发挥出它的最佳性能。
英伟达就是想通过开源模型,诱导开发者使用Mamba架构和NVFP4格式,最终实现“模型—软件—硬件”的全栈垄断。
这种玩法其实早有先例,某国产芯片厂商也曾通过开源模型推广自己的芯片,虽然效果不错,但也引发了行业对生态垄断的担忧。 不过对于开发者来说,多一种选择总归是好的,毕竟有竞争才有进步。
英伟达推出Nemotron 3,是一次大胆的战略转型,虽然目前模型排名不尽如人意,但背后的生态野心不容小觑。 随着AI行业的不断发展,这种全栈竞争会越来越激烈。 无论最终结果如何,技术创新总会给行业带来新的可能,这对整个AI领域来说,都是一件值得期待的事情。返回搜狐,查看更多