NVIDIA, Nemotron 3.5 Lightning adında yeni bir açık ağırlıklı, uzmanlar karışımı (MoE) modeli tanıttı. Bu model, 30 milyar parametreye (3 milyar aktif parametre) sahip ve sürekli görevleri yöneten ajanları koordine etmek için tasarlanmıştır. Model, token üretim hızını benzer büyüklükteki modellerden 4 kat daha hızlı hale getiriyor, ancak ajan görevlerinde yalnızca %30 hızlanma sağlıyor. Bu, gerçek darboğazın orchestrasyon katmanında olduğunu göstermektedir.

Nemotron 3.5 Lightning, hibrit Mamba-Transformer mimarisini, çoklu token tahmini (MTP), gizli uzmanlar karışımı (MoE) ve spekülatif kod çözme gibi dört ana mimari unsuru birleştiriyor. Bu özellikler, modelin performansını artırmak ve token üretim hızını hızlandırmak için tasarlanmıştır. Ancak, modelin Artificial Analysis Intelligence Index'teki 24 puanı, önceki Nemotron 3 Nano modeline göre önemli bir iyileşme olsa da, ajan görevlerinde hızlanmanın sınırlı olduğunu göstermektedir.

NVIDIA'nın Nemotron 3.5 Lightning modeli, token üretim hızında önemli bir artış sağlıyor, ancak ajan görevlerinde hızlanmanın sınırlı olması, orchestrasyon katmanının ve ajan yamağının gerçek darboğaz olduğunu göstermektedir.