DeepSeek V4.1-Flashは何GBあれば動く?〜配布されている量子化を全部調べた

本ページは広告(アフィリエイトプログラム)を含みます。詳しくはプライバシーポリシーをご覧ください。

DeepSeek V4.1-Flash が話題になっています。自分のパソコンで動かそうとしたとき、いちばん気になるのは「何GBのメモリがあれば動くのか」ではないでしょうか。Hugging Face で配布されている量子化を、2026年9月28日の時点で全部数え直しました。家庭で使えるパソコンに収まるものは、あるのでしょうか?

2026年9月28日時点で調べた内容です。

当ブログの GMKtec EVO-X2(メモリ128GB)に入れて、SSDに漏れる前提であっても無理矢理動かそうとして、無理だった記録は、こちらに書きました。

スポンサーリンク

DeepSeek V4.1-Flash とは?

DeepSeek V4.1-Flash は、中国の DeepSeek が2026年9月10日に Hugging Face で公開した生成AIのモデルです。ライセンスは MIT で、重み(モデル本体のデータ)を誰でもダウンロードできます。

公式の説明(モデルカードと技術レポート)によると、ねらいは大きく2つです。1つは、AIが道具を使って複数の手順をこなす「エージェント」の作業に強くすること。もう1つは、長い会話を覚えておく領域(KVキャッシュ)を小さくすることです。この領域の大きさは、1トークンあたりで比べると、1つ前の V4-Flash の約4分の1、初代の DeepSeek V1 の約437分の1まで小さくなったと説明されています。100万トークンの長い文脈を扱える点と、画像も読める点も新しくなりました。

「Flash」は、DeepSeek の中で速さと軽さを優先した位置付けのモデルに付く名前です。V4 の世代では、軽い「V4-Flash」と、大きい「V4-Pro」の2つが出ていました。V4.1 の世代では、9月28日時点で出ているのは Flash だけで、V4.1-Pro は出ていません。

モデル公開全体の大きさ1回の計算で使う量(活性化パラメータ)文脈の長さ画像
DeepSeek V4-Flash2026年4月22日(7月31日に更新版)284B13B——
DeepSeek V4-Pro2026年4月22日(8月13日に更新版)1.6T49B——
DeepSeek V4.1-Flash2026年9月10日552B(ほかに記憶用の Engram 196B)8B/16B100万トークン読める

B は10億です。表の「全体の大きさ」と「1回に使う量」は、公式のモデルカードの値です。V4.1-Flash は、名前は Flash でも、全体は V4-Flash の約2倍の大きさになりました。一方で、1回の計算で使う量は 8B(入力を読むとき)と 16B(文章を書くとき)で、V4-Flash の 13B と同じくらいです。ただし、計算で使うのが一部でも、自分のパソコンで動かすには全体をメモリに置く必要があります。必要なメモリを決めるのは、全体の大きさのほうです。ファイルが大きくなる理由は、全体の大きさと、Engram という記憶用の部品(196B)を持っていることにあります。

公式が示す基本の性能では、V4.1-Flash は MMLU-Pro(幅広い知識の試験)で74.1と、全体が約3倍大きい V4-Pro(73.5)と同じくらいの点を取っています。ただし、これは開発元の評価で、当ブログでは確かめていません。

スポンサーリンク

何を、どこまで調べたか

Hugging Face で「DeepSeek-V4.1」を名前に含むリポジトリと、「DeepSeek-V4.1-Flash を元にした」と登録されているリポジトリを全部集め、GGUF(llama.cpp などで読み込む形式)のファイルを量子化の刻みごとに合計しました。分割ファイルが全部そろっているものだけを数えています。画像を読む部分だけのファイルや、中身が空のファイルしかないリポジトリは除きました。

公式の DeepSeek は GGUF を出していません。下の表はすべて、有志が変換して配っているものです。

配布されている量子化は何GB?

量子化大きさ [GiB]配布元llama.cpp の改造ファイル
DSV41-mixedq2(独自の混合)157.3apetersson—
Q2_K246.3AMAImedia・vcruz305同梱
EngramQ5-Q2_K(独自)312.3smalinin—
Q3_K_M323.4Solstice-AI・vcruz305同梱
Q2(独自・単一ファイル)340.6antirez(ほか安全対策を外した版が2つ)—
EngramQ8-IQ2_XXS 系(独自)345.9smalinin—
ROCMFP2S/MIX10/ROCMFP23(独自)356.4〜377.5Lucebox—
MXFP4375.8〜473.1mxxm-t・kernelpool・JigSawPT・smalinin—
EngramQ8-Q2_K_Protected(独自)385.0smalinin—
GSQ-RCO 3.0bit(独自)387.2pfeifferj・taurusduan同梱
EngramQ8-IQ3_XS(独自)404.2smalinin—
Q4_K_M414.2AMAImedia・Solstice-AI・vcruz305同梱
Q8_0473.1Solstice-AI・vcruz305同梱
Q4(独自)483.0antirez—

いちばん軽いのは MixedQ2 の157.3GiB で、標準的な刻みでいちばん軽い Q2_K でも246.3GiB あります。9月13日に見たときには Q1_0 という98.6GiB の刻みもありましたが、9月28日の時点では見つかりませんでした。削除されたと考えられます。

右の列の「同梱」は、llama.cpp を書き換えるためのファイル(patches)が一緒に置かれていることを表します。そのまま公式の llama.cpp で読めるのではなく、改造した llama.cpp が前提になっていると読めます。

スポンサーリンク

どの機械なら収まる?

GiB と GB は少し違います。1GiB は約1.07GB で、「メモリ192GB」の機械は約178.8GiB です。以下はその換算で比べています。

メモリをCPUとGPUで分け合う作り(ユニファイドメモリ)の機械でも、全部をGPUに回せるわけではありません。OSの分として、数GiBは残す必要があります。

機械(メモリ)GPUに回せる量の目安収まる量子化見立て
GMKtec EVO-X2(128GB)約112〜120GiB(当ブログの実測・Linux)なし無理
GMKtec EVO-X5 Pro(192GB)・Windows最大160GB(公式)=約149GiBなし(いちばん軽い MixedQ2 でも157.3GiB で、約149GiB を超える)厳しい
GMKtec EVO-X5 Pro(192GB)・Linux約170GiB(EVO-X2 と同じ設定をした場合の推測)MixedQ2(157.3GiB)容量は収まる見込み
Mac Studio(256GB)約230GiB(設定で上限を上げた場合の推測)GGUF はなし。専門家を削った MLX 版(198.3GiB)有志が削った版なら可能性あり
NVIDIA DGX Spark を2台つないだもの(128GB×2=256GB)2台合わせて約230GiB(1台あたり約115GiBとした推測)MixedQ2(157.3GiB)。2台に分けて動かすソフトが前提容量は収まる見込み
512GB級約470GiBQ2_K〜Q4_K_M容量には余裕

DGX Spark は、NVIDIA の小型の AI 向けコンピューターです。1台に128GB のメモリを持ち、背面の ConnectX-7(最大200Gbps)で2台を直接つなげます。NVIDIA は「2台をつなぐと、4ビット(FP4)で最大4,050億パラメータのモデルまで扱える」と説明しています。V4.1-Flash は全体で5,520億パラメータ(ほかに記憶用の1,960億)あるため、この公式の目安は超えます。ただし、2.45ビット相当の MixedQ2 なら、2台のメモリを合わせた容量には収まる計算です。1つのモデルを2台に分けて動かすソフトの対応が、ここでも前提になります。

Mac Studio の行の MLX 版は、GGUF ではなく Mac 用の形式です。rapid-mlx が、モデルの中の専門家の一部を削って(REAP という方法)2ビットにしたもので、元のモデルより賢さが落ちている可能性があります。

スポンサーリンク

容量の前に、動かすソフトはある?

容量が足りても、読み込むソフトが対応していなければ動きません。V4.1-Flash は、Causal Encoder-Decoder という新しい作りを採っています。当ブログの llama.cpp(ビルド b10605)では、容量の手前、読み込みの段階で止まりました。

いちばん軽い MixedQ2 の配布元は、説明のページに「重みだけを置いたもので、最後まで動いたと示せたソフトはまだない」と書いています。Q2_K や Q4_K_M の配布元の多くは、llama.cpp の改造ファイルを同梱しています。9月28日時点では、公式の llama.cpp だけで動かせる形は見当たりません。

当ブログでは、外部で見つけたプログラムを動かさないことにしています。改造した llama.cpp は試していません。

スポンサーリンク

1つ前の V4-Flash なら動く?

1つ前の世代の DeepSeek V4-Flash(284B)には、128GB の機械に収まる GGUF が多く出ています。

配布元量子化大きさ [GiB]
takanori-ishikawa(専門家を削った 155B 版)UD-IQ3_XXS55.0
unslothUD-IQ1_S76.9
unslothUD-IQ2_XXS84.6
unsloth(7月31日の更新版)UD-IQ3_S108.1
ggml-orgQ2_K109.3

ggml-org は、llama.cpp を作っているところです。そこが GGUF を出していることから、V4-Flash は公式の llama.cpp で読める作りと考えられます。当ブログでは、まだ動かしていません。

V4-Flash で先に GGUF と対応がそろったことを考えると、V4.1-Flash も、公式の llama.cpp の対応や、もっと小さく削った版が出れば、家庭の機械で動かせるようになる可能性があります。

自分のパソコンで動かせないなら、どこで使える?

DeepSeek V4.1-Flash は、ネット経由のサービスなら、すぐに使えます。2026年9月28日時点で確認できた主な使い方は次のとおりです。

使い方料金の形料金の目安(100万トークンあたり)
DeepSeek の公式サイト・アプリ(チャット)無料—
DeepSeek 公式の API(モデル名 deepseek-flash)従量制入力 $0.15・出力 $0.60(混んでいない時間帯)。混む時間帯は2倍
Ollama のクラウド(deepseek-v4.1-flash:cloud)月額プラン(Pro・Max・Team)か、無料アカウントの従量制従量は DeepSeek 公式の API と同じと Ollama が案内
OpenRouter(複数の提供元をまとめた窓口)従量制提供元によって違う(DeepSeek 自身の窓口は公式と同じ $0.15/$0.60)
Fireworks従量制入力 $0.22・出力 $0.66(OpenRouter の掲載)

DeepSeek 公式の API の「混む時間帯」は、平日の日本時間10時〜13時と15時〜19時です(中国の祝日を除く)。入力の一部が前と同じ場合(キャッシュが効く場合)は、入力が $0.003 まで下がります。料金は変わることが多いので、使う前に各サービスの料金ページを確かめてください。

自分のパソコンで試したい理由が「情報を外に出したくない」なら、V4.1-Flash はまだ向きません。1つ前の V4-Flash の軽い GGUF を使うか、V4.1 の小さい版が出るのを待つことになります。

スポンサーリンク

この記事で確かめていないこと

  • 実機での起動・速さ・賢さは、どの量子化も測っていません(収まる機械が当ブログにないため)
  • EVO-X5 Pro(Linux)と Mac Studio の「GPUに回せる量」は、EVO-X2 での実測や一般的な設定からの推測です
  • 改造した llama.cpp や SGLang で本当に動くかは、試していません
  • 9月13日に見えた Q1_0(98.6GiB)が削除された理由は分かりません
  • 公式の性能の値は開発元の評価で、当ブログでは確かめていません

まとめ〜V4.1-Flash は自分のパソコンで動かせるか

DeepSeek V4.1-Flash は、DeepSeek が2026年9月10日に出した、エージェントの作業と長い文脈に向けた大きなモデルです。名前は Flash でも、全体は V4-Flash の約2倍あり、配布されている GGUF はいちばん軽くても157.3GiB でした。

まとめると、EVO-X2(128GB)では無理、EVO-X5 Pro(192GB)では Windows だと厳しく Linux なら容量は収まる見込み、256GB級では有志が削った版なら可能性があり、512GB級なら容量には余裕がある、という状況です。どの機械でも、動かすソフトの対応が前提になります。

結論として、V4.1-Flash は、高価な機材がなければ自分のパソコンでは動かせないモデルです。V4 の世代では、有志が小さく削った版や、公式の llama.cpp で読める GGUF が後から出そろいました。V4.1 でも、小さいサイズの版が出るかもしれません。それまでは、待つしかない状況です。

いま試すなら、手軽なのは公式のチャットや API です。自分のパソコンにこだわるなら、1つ前の V4-Flash の軽い GGUF(77〜109GiB)が、128GB の機械で現実的な選択肢です。メモリの量ごとに動くモデルを探すなら、こちらの記事も参考になります。

関連する記事は、ローカルAIのまとめページに一覧があります。

参考にしたサイト

スポンサーリンク