DeepSeek V4.1-Flashは何GBあれば動く?〜配布されている量子化を全部調べた
DeepSeek V4.1-Flash が話題になっています。自分のパソコンで動かそうとしたとき、いちばん気になるのは「何GBのメモリがあれば動くのか」ではないでしょうか。Hugging Face で配布されている量子化を、2026年9月28日の時点で全部数え直しました。家庭で使えるパソコンに収まるものは、あるのでしょうか?
2026年9月28日時点で調べた内容です。
当ブログの GMKtec EVO-X2(メモリ128GB)に入れて、SSDに漏れる前提であっても無理矢理動かそうとして、無理だった記録は、こちらに書きました。
DeepSeek V4.1-Flash とは?
DeepSeek V4.1-Flash は、中国の DeepSeek が2026年9月10日に Hugging Face で公開した生成AIのモデルです。ライセンスは MIT で、重み(モデル本体のデータ)を誰でもダウンロードできます。
公式の説明(モデルカードと技術レポート)によると、ねらいは大きく2つです。1つは、AIが道具を使って複数の手順をこなす「エージェント」の作業に強くすること。もう1つは、長い会話を覚えておく領域(KVキャッシュ)を小さくすることです。この領域の大きさは、1トークンあたりで比べると、1つ前の V4-Flash の約4分の1、初代の DeepSeek V1 の約437分の1まで小さくなったと説明されています。100万トークンの長い文脈を扱える点と、画像も読める点も新しくなりました。
「Flash」は、DeepSeek の中で速さと軽さを優先した位置付けのモデルに付く名前です。V4 の世代では、軽い「V4-Flash」と、大きい「V4-Pro」の2つが出ていました。V4.1 の世代では、9月28日時点で出ているのは Flash だけで、V4.1-Pro は出ていません。
| モデル | 公開 | 全体の大きさ | 1回の計算で使う量(活性化パラメータ) | 文脈の長さ | 画像 |
|---|---|---|---|---|---|
| DeepSeek V4-Flash | 2026年4月22日(7月31日に更新版) | 284B | 13B | — | — |
| DeepSeek V4-Pro | 2026年4月22日(8月13日に更新版) | 1.6T | 49B | — | — |
| DeepSeek V4.1-Flash | 2026年9月10日 | 552B(ほかに記憶用の Engram 196B) | 8B/16B | 100万トークン | 読める |
B は10億です。表の「全体の大きさ」と「1回に使う量」は、公式のモデルカードの値です。V4.1-Flash は、名前は Flash でも、全体は V4-Flash の約2倍の大きさになりました。一方で、1回の計算で使う量は 8B(入力を読むとき)と 16B(文章を書くとき)で、V4-Flash の 13B と同じくらいです。ただし、計算で使うのが一部でも、自分のパソコンで動かすには全体をメモリに置く必要があります。必要なメモリを決めるのは、全体の大きさのほうです。ファイルが大きくなる理由は、全体の大きさと、Engram という記憶用の部品(196B)を持っていることにあります。
公式が示す基本の性能では、V4.1-Flash は MMLU-Pro(幅広い知識の試験)で74.1と、全体が約3倍大きい V4-Pro(73.5)と同じくらいの点を取っています。ただし、これは開発元の評価で、当ブログでは確かめていません。
何を、どこまで調べたか
Hugging Face で「DeepSeek-V4.1」を名前に含むリポジトリと、「DeepSeek-V4.1-Flash を元にした」と登録されているリポジトリを全部集め、GGUF(llama.cpp などで読み込む形式)のファイルを量子化の刻みごとに合計しました。分割ファイルが全部そろっているものだけを数えています。画像を読む部分だけのファイルや、中身が空のファイルしかないリポジトリは除きました。
公式の DeepSeek は GGUF を出していません。下の表はすべて、有志が変換して配っているものです。
配布されている量子化は何GB?
| 量子化 | 大きさ [GiB] | 配布元 | llama.cpp の改造ファイル |
|---|---|---|---|
| DSV41-mixedq2(独自の混合) | 157.3 | apetersson | — |
| Q2_K | 246.3 | AMAImedia・vcruz305 | 同梱 |
| EngramQ5-Q2_K(独自) | 312.3 | smalinin | — |
| Q3_K_M | 323.4 | Solstice-AI・vcruz305 | 同梱 |
| Q2(独自・単一ファイル) | 340.6 | antirez(ほか安全対策を外した版が2つ) | — |
| EngramQ8-IQ2_XXS 系(独自) | 345.9 | smalinin | — |
| ROCMFP2S/MIX10/ROCMFP23(独自) | 356.4〜377.5 | Lucebox | — |
| MXFP4 | 375.8〜473.1 | mxxm-t・kernelpool・JigSawPT・smalinin | — |
| EngramQ8-Q2_K_Protected(独自) | 385.0 | smalinin | — |
| GSQ-RCO 3.0bit(独自) | 387.2 | pfeifferj・taurusduan | 同梱 |
| EngramQ8-IQ3_XS(独自) | 404.2 | smalinin | — |
| Q4_K_M | 414.2 | AMAImedia・Solstice-AI・vcruz305 | 同梱 |
| Q8_0 | 473.1 | Solstice-AI・vcruz305 | 同梱 |
| Q4(独自) | 483.0 | antirez | — |
いちばん軽いのは MixedQ2 の157.3GiB で、標準的な刻みでいちばん軽い Q2_K でも246.3GiB あります。9月13日に見たときには Q1_0 という98.6GiB の刻みもありましたが、9月28日の時点では見つかりませんでした。削除されたと考えられます。
右の列の「同梱」は、llama.cpp を書き換えるためのファイル(patches)が一緒に置かれていることを表します。そのまま公式の llama.cpp で読めるのではなく、改造した llama.cpp が前提になっていると読めます。
どの機械なら収まる?
GiB と GB は少し違います。1GiB は約1.07GB で、「メモリ192GB」の機械は約178.8GiB です。以下はその換算で比べています。
メモリをCPUとGPUで分け合う作り(ユニファイドメモリ)の機械でも、全部をGPUに回せるわけではありません。OSの分として、数GiBは残す必要があります。
| 機械(メモリ) | GPUに回せる量の目安 | 収まる量子化 | 見立て |
|---|---|---|---|
| GMKtec EVO-X2(128GB) | 約112〜120GiB(当ブログの実測・Linux) | なし | 無理 |
| GMKtec EVO-X5 Pro(192GB)・Windows | 最大160GB(公式)=約149GiB | なし(いちばん軽い MixedQ2 でも157.3GiB で、約149GiB を超える) | 厳しい |
| GMKtec EVO-X5 Pro(192GB)・Linux | 約170GiB(EVO-X2 と同じ設定をした場合の推測) | MixedQ2(157.3GiB) | 容量は収まる見込み |
| Mac Studio(256GB) | 約230GiB(設定で上限を上げた場合の推測) | GGUF はなし。専門家を削った MLX 版(198.3GiB) | 有志が削った版なら可能性あり |
| NVIDIA DGX Spark を2台つないだもの(128GB×2=256GB) | 2台合わせて約230GiB(1台あたり約115GiBとした推測) | MixedQ2(157.3GiB)。2台に分けて動かすソフトが前提 | 容量は収まる見込み |
| 512GB級 | 約470GiB | Q2_K〜Q4_K_M | 容量には余裕 |
DGX Spark は、NVIDIA の小型の AI 向けコンピューターです。1台に128GB のメモリを持ち、背面の ConnectX-7(最大200Gbps)で2台を直接つなげます。NVIDIA は「2台をつなぐと、4ビット(FP4)で最大4,050億パラメータのモデルまで扱える」と説明しています。V4.1-Flash は全体で5,520億パラメータ(ほかに記憶用の1,960億)あるため、この公式の目安は超えます。ただし、2.45ビット相当の MixedQ2 なら、2台のメモリを合わせた容量には収まる計算です。1つのモデルを2台に分けて動かすソフトの対応が、ここでも前提になります。
Mac Studio の行の MLX 版は、GGUF ではなく Mac 用の形式です。rapid-mlx が、モデルの中の専門家の一部を削って(REAP という方法)2ビットにしたもので、元のモデルより賢さが落ちている可能性があります。
容量の前に、動かすソフトはある?
容量が足りても、読み込むソフトが対応していなければ動きません。V4.1-Flash は、Causal Encoder-Decoder という新しい作りを採っています。当ブログの llama.cpp(ビルド b10605)では、容量の手前、読み込みの段階で止まりました。
いちばん軽い MixedQ2 の配布元は、説明のページに「重みだけを置いたもので、最後まで動いたと示せたソフトはまだない」と書いています。Q2_K や Q4_K_M の配布元の多くは、llama.cpp の改造ファイルを同梱しています。9月28日時点では、公式の llama.cpp だけで動かせる形は見当たりません。
当ブログでは、外部で見つけたプログラムを動かさないことにしています。改造した llama.cpp は試していません。
1つ前の V4-Flash なら動く?
1つ前の世代の DeepSeek V4-Flash(284B)には、128GB の機械に収まる GGUF が多く出ています。
| 配布元 | 量子化 | 大きさ [GiB] |
|---|---|---|
| takanori-ishikawa(専門家を削った 155B 版) | UD-IQ3_XXS | 55.0 |
| unsloth | UD-IQ1_S | 76.9 |
| unsloth | UD-IQ2_XXS | 84.6 |
| unsloth(7月31日の更新版) | UD-IQ3_S | 108.1 |
| ggml-org | Q2_K | 109.3 |
ggml-org は、llama.cpp を作っているところです。そこが GGUF を出していることから、V4-Flash は公式の llama.cpp で読める作りと考えられます。当ブログでは、まだ動かしていません。
V4-Flash で先に GGUF と対応がそろったことを考えると、V4.1-Flash も、公式の llama.cpp の対応や、もっと小さく削った版が出れば、家庭の機械で動かせるようになる可能性があります。
自分のパソコンで動かせないなら、どこで使える?
DeepSeek V4.1-Flash は、ネット経由のサービスなら、すぐに使えます。2026年9月28日時点で確認できた主な使い方は次のとおりです。
| 使い方 | 料金の形 | 料金の目安(100万トークンあたり) |
|---|---|---|
| DeepSeek の公式サイト・アプリ(チャット) | 無料 | — |
| DeepSeek 公式の API(モデル名 deepseek-flash) | 従量制 | 入力 $0.15・出力 $0.60(混んでいない時間帯)。混む時間帯は2倍 |
| Ollama のクラウド(deepseek-v4.1-flash:cloud) | 月額プラン(Pro・Max・Team)か、無料アカウントの従量制 | 従量は DeepSeek 公式の API と同じと Ollama が案内 |
| OpenRouter(複数の提供元をまとめた窓口) | 従量制 | 提供元によって違う(DeepSeek 自身の窓口は公式と同じ $0.15/$0.60) |
| Fireworks | 従量制 | 入力 $0.22・出力 $0.66(OpenRouter の掲載) |
DeepSeek 公式の API の「混む時間帯」は、平日の日本時間10時〜13時と15時〜19時です(中国の祝日を除く)。入力の一部が前と同じ場合(キャッシュが効く場合)は、入力が $0.003 まで下がります。料金は変わることが多いので、使う前に各サービスの料金ページを確かめてください。
自分のパソコンで試したい理由が「情報を外に出したくない」なら、V4.1-Flash はまだ向きません。1つ前の V4-Flash の軽い GGUF を使うか、V4.1 の小さい版が出るのを待つことになります。
この記事で確かめていないこと
- 実機での起動・速さ・賢さは、どの量子化も測っていません(収まる機械が当ブログにないため)
- EVO-X5 Pro(Linux)と Mac Studio の「GPUに回せる量」は、EVO-X2 での実測や一般的な設定からの推測です
- 改造した llama.cpp や SGLang で本当に動くかは、試していません
- 9月13日に見えた Q1_0(98.6GiB)が削除された理由は分かりません
- 公式の性能の値は開発元の評価で、当ブログでは確かめていません
まとめ〜V4.1-Flash は自分のパソコンで動かせるか
DeepSeek V4.1-Flash は、DeepSeek が2026年9月10日に出した、エージェントの作業と長い文脈に向けた大きなモデルです。名前は Flash でも、全体は V4-Flash の約2倍あり、配布されている GGUF はいちばん軽くても157.3GiB でした。
まとめると、EVO-X2(128GB)では無理、EVO-X5 Pro(192GB)では Windows だと厳しく Linux なら容量は収まる見込み、256GB級では有志が削った版なら可能性があり、512GB級なら容量には余裕がある、という状況です。どの機械でも、動かすソフトの対応が前提になります。
結論として、V4.1-Flash は、高価な機材がなければ自分のパソコンでは動かせないモデルです。V4 の世代では、有志が小さく削った版や、公式の llama.cpp で読める GGUF が後から出そろいました。V4.1 でも、小さいサイズの版が出るかもしれません。それまでは、待つしかない状況です。
いま試すなら、手軽なのは公式のチャットや API です。自分のパソコンにこだわるなら、1つ前の V4-Flash の軽い GGUF(77〜109GiB)が、128GB の機械で現実的な選択肢です。メモリの量ごとに動くモデルを探すなら、こちらの記事も参考になります。
関連する記事は、ローカルAIのまとめページに一覧があります。
参考にしたサイト
- DeepSeek V4.1-Flash のモデルカード(公式)
- apetersson:MixedQ2 の配布ページ
- vcruz305:Q2_K〜Q8_0 の配布ページ
- smalinin:Engram 系・MXFP4 の配布ページ
- rapid-mlx:専門家を削った MLX 版
- ggml-org:DeepSeek V4-Flash の GGUF
- unsloth:DeepSeek V4-Flash(7月31日版)の GGUF
- DeepSeek API:モデルと料金(公式)
- Ollama:deepseek-v4.1-flash
- OpenRouter:DeepSeek V4.1 Flash
- Leadtek:NVIDIA DGX Spark Founders Edition(2台接続で最大405B)