NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODEL WATCH
NVIDIA、エージェント実行層向けオープンモデル「Nemotron 3.5 Lightning」を公開 — 30B MoE・3Bアクティブで最大4倍の出力速度
長期間稼働するエージェントの実行層(ツール呼び出し・結果検証)に特化した30B総パラメータ/3BアクティブのMoEモデル。Mamba-2+MoEのハイブリッド構成とマルチトークン予測(MTP)による投機的復号を備え、類似サイズ比で最大4倍の出力速度を謳う。重み・データ・レシピをOpenMDW-1.1で公開。
NVIDIAは2026年8月11日、長期間稼働するAIエージェントの実行層(execution layer)に特化したオープンモデル「Nemotron 3.5 Lightning」を公開した。総パラメータ30B・アクティブ3BのMixture-of-Experts(MoE)モデルで、フロンティアモデルに比べてツール呼び出しや結果の検証、サブエージェントへの委任といった高頻度・低遅延の処理を担うことを想定している。重みだけでなく学習データとレシピもOpenMDW-1.1ライセンスで公開された。
エージェント実行層に特化した設計
- 長期間動き続けるエージェントは、ツール呼び出し・結果検証・サブエージェント委任といった「実行」の処理に大部分の時間を費やす。フロンティア推論モデルを全ステップに使うとコストと遅延が膨らむため、この層に小さく速いモデルを置く設計が広がっている
- Nemotron 3.5 LightningはNemotron 3ファミリー最小のモデルで、Mamba-2とMoEレイヤーを交互に配置し、一部にAttentionレイヤーを持つハイブリッドMoEアーキテクチャを採用
- 事前学習段階からマルチトークン予測(MTP)を組み込み、ネイティブな投機的復号(speculative decoding)を可能にした。加えてDFlashとDSparkの2つのドラフトモデルも提供される
- 学習データは20Tトークン超。英語と19の言語、43のプログラミング言語をカバーし、最大1Mトークンのコンテキスト長に対応する(モデルカードより)
- エージェント用ハーネス(OpenClaw、Hermes Agentなど)での呼び出し精度を高める「ハーネス最適化学習」を実施したとされる
公表された性能と速度
NVIDIAが公表した主な結果は以下の通り(すべてNVIDIA公称値・独自測定)。
- Artificial Analysis Intelligence Index(エージェント・コーディング・科学推論・一般知能の9評価を統合)で、小型オープンモデルとして精度と速度のパレート最前線に位置し、類似サイズ比で最大4倍の出力速度を謳う
- PinchBenchでは86%の精度を達成し、10,000タスクの完了がQwen3.6 35Bと同等精度で30%高速だった
- モデルカード掲載の標準ベンチマークでは、MMLU 78.59、MMLU-Pro(5-shot)67.94、GSM8K(8-shot CoT)91.28、MBPP(3-shot)78.59、HumanEval 77.44(いずれもNVIDIA計測)
- NVFP4量子化チェックポイントをBF16と併せて提供し、Blackwell・Hopper・Ampere世代のGPUで同じファイルをデータセンターからDGX Sparkまで使い回せる設計
ライセンスと提供形態
- ライセンスはOpenMDW-1.1(オープンウェイト・データ・モデル契約)で、商用・非商用ともに利用可能。重み・データ・レシピが公開され、LoRA/フルSFT、NeMo RL/NeMo Gymによるカスタマイズが想定されている
- 学習データの一部として、コーディングエージェント能力の訓練に使われたオープンなエージェントRLデータセット「Nemotron-RL Agentic Terminal Pivot」も公開された
- モデルルーティング用ライブラリ「NeMo Switchyard」で、フロンティアモデル(計画)とNemotron 3.5 Lightning(実行)を振り分ける構成を取れる
- Hugging Face・ModelScopeで重みを配布し、build.nvidia.comとOpenRouterで試用可能。vLLM・SGLang・TensorRT-LLM向けのデプロイガイドが用意されている
動画出典: NVIDIA Developer(DGX SparkでのNemotron 3.5 Lightningデプロイ解説)
出典
- NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents(NVIDIA Technical Blog)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Base-BF16(Hugging Faceモデルカード)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4(Hugging Faceモデルカード)
- Nemotron 3.5 Lightning(build.nvidia.com)