NVIDIAは、Nemotron 3.5 Lightningという新しいオープンウェイトの専門家混合(MoE)モデルを発表した。このモデルは300億パラメータ(30億アクティブパラメータ)を持ち、継続的なタスクを管理するエージェントを調整するために設計されている。モデルは同規模の他のモデルと比べてトークン生成速度を4倍に高速化するが、エージェントタスクでは30%の速度向上しか実現できない。これは実際のボトルネックがオーケストレーション層にあることを示している。
Nemotron 3.5 Lightningは、ハイブリッドMamba-Transformerアーキテクチャ、マルチトークン予測(MTP)、潜在的な専門家混合(MoE)、推測的デコーディングの4つの主要なアーキテクチャ要素を組み合わせている。これらの機能はモデルのパフォーマンスを向上させ、トークン生成速度を高速化するために設計されている。しかし、モデルのArtificial Analysis Intelligence Indexにおける24点は、以前のNemotron 3 Nanoモデルと比べて大きな改善ではあるが、エージェントタスクでの速度向上には限界があることを示している。
NVIDIAのNemotron 3.5 Lightningモデルはトークン生成速度で大きな進歩を遂げているが、エージェントタスクでの速度向上の限界は、オーケストレーション層とエージェントプールが実際のボトルネックであることを示している。
