VRAM8GBで何が動く?〜ローカルLLMを必要メモリ別に22本測って並べた
ローカルLLMを動かしていると、いつも同じところで詰まります。「このモデル、うちのメモリで動くのか?」
モデルのページに書いてあるのはファイルの大きさで、動かすのに要るメモリではありません。手元にある22本のモデルについて、必要なメモリの大きさに合わせて並べました。
この記事で調べたことと、測り方
3つです。動かすのに要るメモリはファイルサイズと何が違うのか。どのメモリ量で何が動くのか。メモリを増やすと何が増えるのか。
速さの数字は、次の条件で揃えました。
| 機体 | GMKtec EVO-X2(Ryzen AI Max+ 395・ユニファイドメモリ128GB) |
| GPU | 内蔵の Radeon 8060S |
| 実行するもの (A) |
llama.cpp(ビルド b10605)・Vulkan/ pp512・tg128 [tok/s]/測定日 2026年9月10日 |
| 実行するもの (B) |
ollama(0.32.15)・ROCm/ ollama 内蔵のタイマー [tok/s]/測定日 2026年9月21日 |
| 回数 | 1条件につき5回。並べ替えて上下の外れを1つずつ落とし、中央3点の中央値(Bは読み込みを含む1回目を捨ててから5回) |
条件を揃えるために、測定環境は、EVO-X2の内蔵GPUとしました。
測り方が2つあるのは、llama.cpp では読み込めないモデルがいくつもあったからです。同じ表に並べますが、AとBは別の列として見てください。実行系が Vulkan と ROCm で違い、時間の数え方も違います。AとBの数字を足したり平均したりはできません。実際、同じモデルで B は A のおよそ1.8倍が出ています。
動かすのに要るメモリは、ファイルサイズより少し大きい
手元の実測から出た目安です。
| 動かすのに要るメモリ ≒ ファイルサイズ + 約0.7GiB |
実例を出します。Qwen3.8-27B の UD-Q4_K_M はファイルが 15.33GiB です。この15.33GiBに上乗せがかかり、実際に必要な量は 16,397MiB でした。
16GBのグラフィックボードで使える量は 16,304MiB です。約100MiB足りず、載りませんでした。
16GBのカードに16GBのモデルは入りません。カタログの数字どうしで足りるように見えても落ちます。判断はこの上乗せを足してから行います。
ただし、載り切らなければそこで終わり、というわけでもありません。多くのソフトはグラフィックボードのメモリに入り切らないぶんをパソコン本体のメモリへ逃がします。逃がしたぶんは本体側のメモリを通るため、全部が載っているときより遅くなります。どれだけ遅くなるかは、はみ出した量で変わります。
MoEの場合は事情が少し違います。MoEは1トークンを書くたびに中の一部しか使いません。そのためよく使う部分がグラフィックボード側に残っていれば、はみ出していても実用の速さで動くことがあります。密なモデルは毎回すべてを読むので、はみ出したぶんが毎回そのまま効いてきます。同じだけはみ出しても、MoEのほうが傷は浅く済みます。
この記事で並べているのは、モデル全体がGPU側のメモリに載り切った状態の数字です。はみ出させた状態は測っていません。まず載るかどうかを決めて、載らないときに逃がし方を考える、という順番で読んでいただければと思います。
実際に触ってみたモデル一覧(動かなかったものを含む)
| 要メモリ | モデル | 公開 | パラメータ | 量子化 | 構成 | サイズ | A llama.cpp・Vulkan | B ollama・ROCm | ||
|---|---|---|---|---|---|---|---|---|---|---|
| 読む | 書く | 読む | 書く | |||||||
| 8GB | llama3.2:1b | 2024/09 | 1.2B | Q8_0 | 密 | 1.23GB | 7,107.3 | 158.0 | 21,539.3 | 253.2 |
| phi4-mini | 2025/02 | 3.8B | Q4_K_M | 密 | 2.32GB | 2,368.4 | 79.7 | 6,965.7 | 140.0 | |
| nemotron-3-nano:4b | 2026/03 | 4.0B | Q4_K_M | ハイブリッド | 2.64GB | 1,392.6 | 69.5 | 4,178.2 | 132.3 | |
| llama2:7b | 2023/07 | 7B | Q4_0 | 密 | 3.56GB | ― | ― | 2,247.9 | 71.6 | |
| qwen3:8b | 2025/04 | 8.2B | Q4_K_M | 密 | 4.87GB | 1,191.0 | 41.0 | 3,496.2 | 76.9 | |
| llama3.1:8b | 2024/07 | 8.0B | Q4_K_M | 密 | 4.58GB | ― | ― | 2,169.2 | 64.0 | |
| Ornith-1.0-9B | 2026/06 | 8.95B | Q4_K_M | 密 | 5.24GB | 1,073.8 | 39.1 | 2,403.0 | 72.8 | |
| 16GB | qwen3:14b | 2025/04 | 14.8B | Q4_K_M | 密 | 8.64GB | 728.5 | 24.5 | 1,900.5 | 44.0 |
| 24GB | qwen3.6:27b | 2026/04 | 27.8B | Q4_K_M | ハイブリッド | 17.0GB | ― | ― | 275.0 | 12.1 |
| qwen3-coder:30b | 2025/07 | 30.5B | Q4_K_M | MoE | 17.28GB | 1,211.9 | 92.4 | 894.6 | 59.1 | |
| gemma4:31b | 2026/03 | 31.3B | Q4_K_M | 密 | 19.0GB | ― | ― | 248.8 | 10.1 | |
| glm-4.7-flash | 2026/01 | 29.9B | Q4_K_M | MoE | 19.0GB | ― | ― | 698.9 | 50.5 | |
| Ornith-1.0-35B | 2026/06 | 34.7B | Q4_K_M | MoE | 19.71GB | 1,073.9 | 75.6 | 828.7 | 57.9 | |
| 32GB | nemotron-3-nano:30b | 2025/12 | 31.6B | Q4_K_M | ハイブリッドMoE | 22.60GB | 921.4 | 69.6 | 741.5 | 64.0 |
| qwen3.6:35b-a3b | 2026/04 | 36.0B | Q4_K_M | MoE | 23.0GB | ― | ― | 770.8 | 52.1 | |
| 64GB | llama3.3:70b | 2024/11 | 70.6B | Q4_K_M | 密 | 39.60GB | 102.0 | 5.3 | 122.7 | 5.0 |
| qwen3-coder-next | 2026/01 | 79.7B | Q4_K_M | MoE | 51.0GB | ― | ― | 489.8 | 47.6 | |
| 128GB | gpt-oss:120b | 2025/08 | 116.8B | MXFP4 | MoE | 65.0GB | ― | ― | 356.2 | 35.1 |
| GLM-4.5-Air | 2025/07 | 110.5B | Q4_K_M | MoE | 67.85GB | 276.9 | 25.6 | 225.1 | 22.3 | |
| qwen3-235b | 2025/04 | 235.1B | Q2_K | MoE | 79.81GB | 159.4 | 21.8 | 106.4 | 17.9 | |
| nemotron-3-super:120b-a12b | 2026/03 | 123.6B | Q4_K_M | MoE | 86.0GB | ― | ― | 202.0 | 20.4 | |
| minimax-m2.7 | 2026/04 | 228.7B | IQ4_XS | MoE | 100.97GB | 201.4 | 29.1 | 39.7 | 20.1 | |
公開日を入れたのは、動くことと、いま選ぶ理由があることは別だからです。
A列に「―」が並んでいるのは、llama.cpp が読み込めなかったからです。理由は次の節に分けて書きます。B列には全部の数字が入っています。
llama2:7b と llama3.1:8b は、同じメーカーの新旧を比べるために今回あとから入れたものです。A列が空いているのは、この2本をBの測り方でしか測っていないためです。
もう一つ、minimax-m2.7 だけはBのほうが遅く出ています。他はどれもBがAの1.8倍前後なのに、この1本だけ29.1 tok/s から20.1 tok/s へ下がりました。測っているあいだ、ollama はこのモデルの76%をパソコン本体側に置いていました。110GBはこの機体のメモリに対して大きすぎて、載り切らなかったという形です。さきほどの「はみ出すと遅くなる」が、そのまま数字に出ています。
同じ大きさでも、速さが違うのはなぜか
ほとんど同じ大きさのものどうしで並べると、構成の差だけが残ります。下の4本はどれも同じ日に、Bの測り方(ollama・ROCm)で測ったものです。
| モデル | サイズ | 構成 | 書く速さ [tok/s] |
|---|---|---|---|
| gemma4:31b | 19.0GB | 密 | 10.1 |
| Ornith-1.0-35B | 19.71GB | MoE | 57.9 |
| qwen3.6:27b | 17.0GB | ハイブリッド | 12.1 |
| qwen3-coder:30b | 17.28GB | MoE | 59.1 |
19GB前後の2本で5.7倍、17GB前後の2本で4.9倍です。置き場所は同じだけ要るのに、書く速さがこれだけ離れます。
理由は、1トークンを書くたびに読む量が違うからです。
密なモデルは、全部の重みを毎回読みます。70Bの密なモデルなら、39.6GB を毎回通します。MoEは違います。中がいくつかの担当に分かれていて、1回につき担当のぶんだけを読みます。minimax-m2.7 は 228.7B ありますが、毎回動くのはその一部です。
生成の速さは、おおよそ次の割り算で決まります。
| 書く速さ ≒ メモリの帯域 ÷ 1トークンあたりに読む量 |
分母が小さいMoEは、総量が大きくても速く出ます。ただし載せるほうは総量ぶん要ります。101GBのモデルは、速く動いても101GBの置き場所が要ります。
置き場所は総量で決まり、速さは1トークンあたりに読む量で決まります。メモリを選ぶときは総量で、速さを見るときは活性のぶんで考えます。
モデルの公開日は気にすべきなのか
公開日の列を見ていて、気になったことがあります。1年新しいと、速さは変わるのでしょうか。メーカーをまたぐと作りの違いが混ざるので、同じ Meta の llama を新旧で並べました。どちらもBの測り方です。
| モデル | 公開 | サイズ | 構成 | 書く速さ [tok/s] |
|---|---|---|---|---|
| llama2:7b | 2023/07 | 3.56GB | 密 | 71.6 |
| llama3.1:8b | 2024/07 | 4.58GB | 密 | 64.0 |
| llama3.3:70b | 2024/11 | 39.60GB | 密 | 5.0 |
1年空いても、速さはほとんど変わりませんでした。新しい llama3.1 のほうが少し遅いのは、ファイルが1GB大きいからです。1秒あたりに読んでいる量に直すと 255GB と 293GB で、むしろ新しいほうが多く読めています。いずれにせよ、1年の差にしては小さい動きでした。
では速さを変えているのは何か。ここまでの表を見ると、答えははっきりしています。年式ではなく構成です。同じ Meta でも llama3.3:70b は39.60GBの密なつくりで、5.0 tok/s まで落ちます。一方、2025年12月の nemotron-3-nano:30b は22.60GBのハイブリッドMoEで、同じBの測り方で64.0 tok/s です。容量は半分ちょっとで、速さは12.8倍でした。
つまり「新しいほうが速い」のではなく、MoEという作り方が新しいモデルに増えてきた、という順序です。もし年式そのものが効いているのなら、llama2 と llama3.1 のあいだにも差が出たはずですが、差は出ませんでした。
賢さは測っていないので、そちらは比べられません。置き場所と速さだけで選ぶなら、見るべきは公開日ではなく構成の列です。
llama.cpp で読めなかったのは、なぜか
表のA列が「―」になっている6本は、llama.cpp が読み込めませんでした。最初はビルド b10605 で、あらためて b10941 でも試しています。どちらでも同じでした。
容量の問題ではありません。いちばん小さい qwen3.6:27b は17GBで、空きが75GBあっても落ちました。ファイル自体も壊れていません。
止まり方はモデルごとに違いました。b10941 が出した文言です。
| モデル | 止まった理由 | 種類 |
|---|---|---|
| gpt-oss:120b | 知らないアーキテクチャだと言われる(unknown model architecture: 'gptoss') | 未対応 |
| glm-4.7-flash | 同じく知らないと言われる('glm4moelite') | 未対応 |
| qwen3.6:27b / 35b-a3b | 設定値の並びの長さが合わない(4つ来るはずが3つ) | 食い違い |
| gemma4:31b | テンソルの数が合わない(1189のはずが833) | 食い違い |
| qwen3-coder-next | あるはずのテンソルが無い(blk.0.ssm_dt.bias) | 食い違い |
| nemotron-3-super:120b-a12b | テンソルの形が合わない | 食い違い |
ここが分かれ目です。llama.cpp がそのモデル自体を知らないのは、gpt-oss:120b と glm-4.7-flash の2本だけでした。残りの4種類は、llama.cpp の側に読むための実装があります。それでも落ちるのは、ollama が配っているファイルの中身と、llama.cpp が期待している形が食い違っているためです。
つまり「llama.cpp が新しいモデルに追いついていない」という一言では片づきません。追いついていないものと、両方が新しいのに噛み合っていないものが混ざっています。後者は、どちらか一方を待てば直る類のものではありません。
同じファイルを ollama から使うと、6本とも動きました。表のB列に数字が入っているのはそのためです。動かないときは、モデルを諦める前に、動かす道具のほうを換えてみる価値があります。
超大型モデル〜192GBから2TBまでファイルサイズで並べる
ここから先は、私の環境では動かないモデルです。例えば、Mac Studioなど、大きなメモリーを積んだPCで、やっと動かせる領域です。逆に、これらのPCを手に入れれば、どんなモデルが動くようになるのでしょうか。
サイズは Hugging Face の配布ファイルを数えた値です(2026年9月10日)。
| 入るメモリ | モデル | 公開 | 総パラメータ | 刻み | サイズ | 速さ |
|---|---|---|---|---|---|---|
| 192GB | DeepSeek V4 Flash | 2026/04 | — | UD-Q8_K_XL | 161.9GB | — |
| MiniMax M2.7 | 2026/04 | 228.7B | UD-Q6_K_XL | 207.4GB | — | |
| 256GB | GLM-5.2 / 5.3 | 2026/06 | 744B | UD-IQ1_S | 216.7GB | — |
| MiniMax M2.7 | 2026/04 | 228.7B | Q8_0 | 243.1GB | — | |
| 512GB | GLM-5.2 / 5.3 | 2026/06 | 744B | UD-Q4_K_XL | 467.3GB | — |
| Kimi K3 | 2026/06 | 2.8T | UD-Q1_0 | 466.4GB | — | |
| MiniMax M2.7 | 2026/04 | 228.7B | BF16 | 457.5GB | — | |
| 1TB | GLM-5.2 / 5.3 | 2026/06 | 744B | Q8_0 | 801.4GB | — |
| Kimi K3 | 2026/06 | 2.8T | UD-Q2_K_XL | 861.3GB | — | |
| DeepSeek V4 Pro | 2026/04 | 1.6T級 | UD-Q8_K_XL | 873.4GB | — | |
| 2TB | Qwen3.8-2.4T | 2026/08 | 2.4T | UD-IQ4_XS | 1,310.9GB | — |
| GLM-5.2 / 5.3 | 2026/06 | 744B | BF16 | 1,508.0GB | — | |
| Kimi K3 | 2026/06 | 2.8T | UD-Q8_K_XL | 1,561.2GB | — | |
| 2TBでも入らない | Kimi K2.6 | 2026/04 | — | BF16 | 2,054.1GB | — |
| Qwen3.8-2.4T | 2026/08 | 2.4T | BF16 | 4,893.2GB | — |
ここで、パラメータ数の順番とサイズの順番が合っていません。Kimi K3 は 2.8T、Qwen3.8-2.4T は 2.4T ですが、元の精度でのサイズは Qwen3.8 のほうが3倍以上あります。
メモリーが512GBあると、何が動くようになるのか
メモリーが512GBあると、128GBの時と比べて、手が届く上位のモデルが2種類増えます。
128GBでも、DeepSeek V4 Flash も MiniMax M2.7 も Qwen3-235B も動きます。動かないのは GLM-5.2 と Kimi K3 の2本です。この2本は、いちばん削った1bit級ですら 216.7GB と 466.4GB あり、削っても入りません。
512GBにすると、GLM-5.2 が Q4(467.3GB)で載ります。1bitまで削らずに済みます。Kimi K3 も1bitでぎりぎり入ります。
この2本に触りたいかどうかが、512GBを選ぶ理由になるかどうかの分かれ目です。それ以外の目的なら、多少量子化が必要ではあるものの、メモリー128GBのPCでもだいたい動くと言えるのではないでしょうか。
更に巨大なメモリーでは何が動くのか
例えば、Mac Studioなどを2台、3台と繋げて(スタックして)巨大なメモリーを準備することも、(金銭的な余裕があれば、)一般人でもできる時代になりました。これらの巨大なメモリーを実装したとすれば、何ができるようになるのでしょうか。メモリーを1TB準備すれば、Kimi K3 が1bitから2bit(861.3GB)へ上がり、GLM-5.2 は Q8(801.4GB)まで上がり、ほぼ無劣化で置けます。
4台で2TBにすると、GLM-5.2 が BF16(1,508.0GB)で動きます。配布元がそのまま出している精度です。Kimi K3 も Q8(1,561.2GB)に届きます。
台数を増やして広がるのは、速さではありません。量子化から抜けられることです。1台や2台では、大きいモデルは必ずどこかを削って載せます。2TBあると、削らずに置けるものが出てきます。
ただし速さは別の話です。AMDが同じチップの機体4台を5Gbpsの有線LANで繋ぎ、1兆パラメータのモデルを 9.45 tok/s で動かした記録があります。繋げば動きますが、機体をまたぐぶん遅くなります。4台にしても4倍速くはなりません。
この記事で確かめていないこと
- 賢さは測っていません。この記事は置き場所と速さだけを見ています
- 上乗せの約0.7GiBは、Qwen3.8-27Bの刻みから出した目安です。モデルや設定が変われば変わります
- 速さは1つの機体・1つのGPUで測った値です。別の機体では別の数字が出ます
- llama.cpp は b10605 と b10941 の2つの版で試しました。さらに新しい版では動く可能性がありますが、そこは試していません
- A列とB列は実行系が違います(Vulkan と ROCm)。差のうちどれだけが実行系の違いで、どれだけがソフトの違いなのかは分けていません
- B列の値は ollama 内蔵のタイマーによるもので、llama-bench の pp512/tg128 とは前提が違います
- 192GB以降の表は配布元のファイルサイズを数えただけです。
- 複数台をつないだ構成も試していません。9.45 tok/s はAMDの発表による数字です
まとめ〜メモリは総量で、速さは読む量で決まる
動かすのに要るメモリは、ファイルサイズに約0.7GiBを足した量です。16GBのカードに16GBのモデルは入りません。
ほとんど同じ大きさでも、MoEと密では速さが5倍以上違います。19.71GBのMoEが57.9 tok/s、19.0GBの密なモデルが10.1 tok/s でした。置き場所は総量で決まり、速さは1トークンあたりに読む量で決まります。
公開日そのものは、速さにあまり効きません。同じ Meta の llama2:7b と llama3.1:8b は、1年空いても71.6 tok/s と64.0 tok/s でした。効いているのは構成のほうで、22.60GBのハイブリッドMoEは39.60GBの密なものより12.8倍速く出ています。
そして、動かす道具でも結果が変わります。llama.cpp で読めなかった6本は、ollama では全部動きました。読めなかった理由も「llama.cpp が追いついていない」だけではなく、配布されているファイルと噛み合っていないものが混ざっていました。
128GBで動かないのは GLM-5.2 と Kimi K3 の2本です。512GBはこの2本のために要ります。台数を増やすと量子化から降りられますが、速くはなりません。
自分のメモリで何が動くかが分かると、次に何を足すかも決めやすくなるのではないでしょうか。