「Lightning」なのに遅い?〜Nemotronの新版と旧版を測って比べた
NVIDIA の Nemotron シリーズに新版が出ていました。名前に「Lightning(稲妻)」と付いています。前の版より、本当に速くなっているのでしょうか。
2026年9月時点の実測です。
Nemotron の新旧を、どう比べたか
| モデル | 公開 | サイズ(Q4_K_M) | 構成 |
|---|---|---|---|
| nemotron-3-nano:30b | 2025年12月 | 22.60GiB | ハイブリッドMoE |
| Nemotron-3.5-Lightning-30B-A3B | 2026年8月 | 23.52GiB | ハイブリッドMoE(NemotronHForCausalLM) |
公開の間隔は約9か月、サイズの差は4%程度です。どちらも「30B・活性3B」を示す A3B の名を持ち、モデルの種別(architecture)も同じ NemotronHForCausalLM でした。測定条件は次のとおりです。
| 機体 | GMKtec EVO-X2(Ryzen AI Max+ 395・ユニファイドメモリ128GB) |
| GPU | 内蔵の Radeon 8060S |
| 実行するもの | llama.cpp(ビルド b11192・2026年9月28日に測り直し)・Vulkan |
| 指標 | pp512(512トークン読ませる速さ)/ tg128(128トークン書かせる速さ)[tok/s] |
| 回数 | 1条件につき5回。並べ替えて上下の外れを1つずつ落とし、中央3点の中央値 |
読む速さと書く速さは、どう変わったか
| モデル | 読む速さ pp512 [tok/s] | 書く速さ tg128 [tok/s] |
|---|---|---|
| nemotron-3-nano:30b(旧) | 1,495.4 | 66.3 |
| Nemotron-3.5-Lightning-30B-A3B(新) | 1,537.4 | 57.5 |
読む速さは、新しいほうが約3%速い程度で、ほぼ同じでした(1,537.4 ÷ 1,495.4 ≒ 1.03)。一方、書く速さは新しいほうが約13%遅い結果になりました(57.5 ÷ 66.3 ≒ 0.87)。5回の値の幅は、旧が65.8〜66.9、新が55.4〜58.4 tok/s で、差は測定のブレより大きい値です。
なお、9月13日に古いビルド(b10605)で測ったときは、読む速さが新旧で同じ値になっていました。記録を写すときの間違いが疑われたため、9月28日に同じ機体・新しいビルドで両方を測り直し、上の値に差し替えています。書く速さで新しいほうが遅いという向きは、測り直しても変わりませんでした(9月13日は約16%遅い)。
なぜ、名前に反して遅いのか
読む速さ(プロンプトの処理)はほぼ同じで、書く速さ(生成)だけが落ちています。当ブログでこれまで測ってきた範囲では、書く速さはおおよそ次の割り算で決まります。
| 書く速さ ≒ メモリの帯域 ÷ 1トークンあたりに読む量 |
同じ機体で測っているので分子(帯域)は共通です。差が出たのは分母、1トークンを書くたびに読む量のほうです。両方とも「30B・活性3B」を名乗るMoE構成ですが、活性化される部分の実際の設計(層数や配分など)が変わり、1トークンあたりに読む量が増えた可能性があります。設計が変わったかどうかは配布元のモデルカードに詳細な記載が無く、断定はできません。
「Lightning」という名前は速さを連想させますが、公式がベンチマークで何を根拠にその名を付けたのかは確認できていません。少なくとも、当ブログの環境と指標では、前世代より遅い結果になりました。
この記事で確かめていないこと
- 賢さは測っていません。速さと置き場所だけの比較です。「Lightning」が賢さや別の指標についての名前である可能性は残ります
- 両モデルとも1つの量子化(Q4_K_M・UD-Q4_K_M)のみでの比較です
- 測定は内蔵GPU1台での値です。別の機体・別のGPUでは異なる数字が出る可能性があります
- 公式のリリースノート・ベンチマーク根拠は確認できていません。名前の由来は推測です
まとめ〜名前と中身は、別の話
Nemotron-3.5-Lightning-30B-A3B は、前世代の nemotron-3-nano:30b と比べて、読む速さはほぼ同じ(新しいほうが約3%速い)、書く速さは約13%遅いという結果になりました。名前から連想される「速い」というイメージとは逆です。
同じ系列・似た容量のモデルでも、実測してみるまで速さは分かりません。今回で、当ブログが同一系列の後継モデルを実測した例は3件目(Ornith 1.0→1.5、Nemotron 3→3.5)になりましたが、うち2件は「ほぼ変わらない」、1件は「遅くなった」という結果で、いずれも新版が明確に速くなったケースはまだありません。
ほかに調べた記事も、このまとめページから見つかります。