NVIDIA最近推出了一款名为《Nemotron 3.5 Lightning》的AI模型。这款模型采用了开放权重、混合专家(MoE)技术,拥有300亿参数(其中30亿为活跃参数),专门设计来处理和编排始终在线的代理执行大量常规任务。
对于不熟悉的人来说,编排是指协调多个专业AI代理共同高效工作以解决复杂、多步骤任务的过程,这些任务单靠一个AI代理是无法完成的。这种代理级别的编排包括多个步骤,如任务接收和分解、代理选择、上下文和状态共享(代理A完成步骤后,编排器会将结果和相关数据传递给代理B,确保进度不会重置),以及定期验证和错误纠正。硬件级别的编排则发生在CPU中,负责管理数据在内存和计算核心之间的流动,以最小化延迟并最大化吞吐量。
《Nemotron 3.5 Lightning》的架构包含四个关键元素:混合Mamba-Transformer、多令牌预测(MTP)、潜在混合专家(MoE)和推测性解码。
尽管NVIDIA宣称《Nemotron 3.5 Lightning》在生成令牌的速度上是“类似大小模型”的4倍,但这仅使实际代理任务的加速提高了30%。也就是说,尽管模型将令牌输出提升了四倍,但在代理任务加速方面却出现了递减的回报。这表明真正的瓶颈在于编排层。



