スマホやアプリで動かすならどれ?〜小さい生成AIモデル23本を賢さ・速さ・サイズで比べた
2026年9月6日、中国の OpenBMB が MiniCPM5-2B という小さな生成AIのモデルを公開しました。公式の説明では、スマートフォンやパソコンなどの端末の中で動かすことを前提に作ったモデルだとしています。端末で動かすなら、ほかの小さいモデルとどう違うのでしょうか?
2026年9月29日時点の実測です。
MiniCPM5-2B はどんなモデル?
MiniCPM5-2B は、中国の清華大学系の研究グループ OpenBMB が出したモデルです。5月に出た MiniCPM5-1B に続く2本目で、同じ作り方のまま大きさを2B(20億パラメータ)にしたものです。
公式のモデルカードには「端末の上での利用(on-device)、ローカルでの利用、資源が限られた環境」のために作ったと書かれています。同じくらいの大きさのオープンなモデルの中で最高水準で、4B 級とも競り合うとしています。ライセンスは Apache-2.0 で、アプリに組み込んで配ることや商用での利用がしやすい条件です。
ただし、性能の説明は開発元の評価です。そこで、同じくらいの大きさのモデルを集めて、当ブログの物差しで賢さ・速さ・サイズを並べてみました。
何を、どう比べたか
比べたのは、0.6B〜7.5B の小さいモデル23本です。2024年の Llama 3.2 から、2026年に出た Qwen3.5・Gemma 4・MiniCPM5 まで入れました。形式は、すべて4ビットに縮めた Q4_K_M にそろえています。
| 見たもの | 測り方 |
|---|---|
| サイズ | Q4_K_M のファイルの大きさ(アプリに入れたり、ダウンロードさせたりするときの重さ) |
| 賢さ | 当ブログの物差し AEB L1。プログラミングの問題7問と、ひっかけの問題6問の正解数。RTX 3090 で、答えのぶれを抑える設定(temperature 0)で各1回 |
| 速さ | GMKtec EVO-X2 で、文章を書く速さ(tok/s)を2通り。内蔵GPU(Radeon 8060S)を使った場合と、GPU を使わず CPU の4スレッドだけで動かした場合。どちらも5回の中央の値 |
| ライセンス | 公式の配布ページの表示 |
tok/s は、1秒あたりに書き出すトークン(言葉のかけら)の数です。日本語なら、1トークンがおおよそ1〜2文字です。
CPU だけの値は、GPU の無い機械で動かしたときの目安です。スマートフォンの CPU とは作りも電力の条件も違うので、スマートフォンでの速さそのものではありません。
23本の結果は?
| モデル | サイズ [GiB] | プログラミング /7 | ひっかけ /6 | 書く速さ GPU [tok/s] | 書く速さ CPU [tok/s] | ライセンス |
|---|---|---|---|---|---|---|
| Qwen3.5-4B | 2.54 | 7/7 | 6/6 | 65.4 | 17.7 | Apache-2.0 |
| Nemotron 3 Nano 4B | 2.63 | 7/7 | 6/6 | 69.5 | 18.8 | NVIDIA 独自 |
| MiniCPM5-2B | 1.50 | 6/7 | 6/6 | 123.8 | 34.9 | Apache-2.0 |
| Gemma 4 E2B | 2.88 | 6/7 | 6/6 | 116.1 | 34.0 | Apache-2.0 |
| Gemma 4 E4B | 4.62 | 6/7 | 6/6 | 61.0 | 17.0 | Apache-2.0 |
| Qwen3-4B | 2.32 | 6/7 | 5/6 | 77.5 | 21.1 | Apache-2.0 |
| Gemma 3n E4B | 4.22 | 7/7 | 4/6 | 54.7 | 17.6 | Gemma 独自 |
| Llama 3.2 3B | 1.87 | 5/7 | 5/6 | 99.2 | 26.2 | Llama 3.2 独自 |
| Gemma 3n E2B | 2.81 | 6/7 | 4/6 | 88.3 | 31.3 | Gemma 独自 |
| Gemma 3 4B | 2.31 | 3/7 | 6/6 | 75.7 | 20.7 | Gemma 独自 |
| Granite 3.3 2B | 1.44 | 5/7 | 4/6 | 119.9 | 33.7 | Apache-2.0 |
| LFM2-2.6B | 1.45 | 4/7 | 4/6 | 122.6 | 34.1 | LFM 独自 |
| Granite 4.1 3B | 1.95 | 4/7 | 4/6 | 91.4 | 25.1 | Apache-2.0 |
| SmolLM3-3B | 1.78 | 5/7 | 3/6 | 96.8 | 27.1 | Apache-2.0 |
| LFM2-1.2B | 0.68 | 3/7 | 2/6 | 257.0 | 71.1 | LFM 独自 |
| Qwen3-1.7B | 1.03 | 2/7 | 3/6 | 167.8 | 46.0 | Apache-2.0 |
| Qwen3.5-2B | 1.18 | 4/7 | 1/6 | 135.8 | 37.4 | Apache-2.0 |
| Phi-4-mini | 2.31 | 2/7 | 3/6 | 79.2 | 21.3 | MIT |
| Qwen3-0.6B | 0.36 | 1/7 | 2/6 | 356.2 | 113.3 | Apache-2.0 |
| Qwen3.5-0.8B | 0.49 | 3/7 | 0/6 | 245.9 | 78.0 | Apache-2.0 |
| Gemma 3 1B | 0.74 | 1/7 | 1/6 | 200.2 | 58.7 | Gemma 独自 |
| Llama 3.2 1B | 0.74 | 2/7 | 0/6 | 242.2 | 64.4 | Llama 3.2 独自 |
| MiniCPM5-1B | 0.64 | 1/7 | 0/6 | 291.3 | 85.6 | Apache-2.0 |
並びは、プログラミングとひっかけの正解数の合計が多い順です。
賢さとサイズの関係は?
上位は、Qwen3.5-4B と Nemotron 3 Nano 4B の2本で、どちらも13問すべてに正解しました。どちらも2.5GiB 前後あります。
MiniCPM5-2B は、1.50GiB でプログラミング6問・ひっかけ6問に正解し、4B 級の上位とほぼ同じ位置に入りました。サイズは Qwen3.5-4B の約6割です。公式の「2B 級で最高水準・4B 級とも競り合う」という説明は、当ブログの物差しでもおおむね当てはまりました。
一方、1B 以下のモデル(Qwen3-0.6B・Qwen3.5-0.8B・Gemma 3 1B・Llama 3.2 1B・MiniCPM5-1B)は、プログラミングが1〜3問でした。小さくするほど、賢さは大きく落ちます。
速さはどれくらい違う?
書く速さは、ほぼサイズで決まりました。同じ機械・同じ条件なら、読む量が少ないモデルほど速く書けます。GPU で書く速さは、MiniCPM5-2B が123.8 tok/s、Qwen3.5-4B が65.4 tok/s で、約1.9倍の差です。CPU だけでも、34.9 tok/s と17.7 tok/s で、同じくらいの比になりました。
いちばん速いのは Qwen3-0.6B(GPU 356.2 tok/s・CPU 113.3 tok/s)ですが、賢さは23本の中で最も低い部類です。
賢さ・速さ・サイズ、どれを優先して選ぶ?
| 優先すること | 候補 | 理由 |
|---|---|---|
| 賢さ | Qwen3.5-4B(2.54GiB) | 13問すべて正解。作り話をする割合も今回いちばん低い。書く速さは MiniCPM5-2B の約半分 |
| つり合い | MiniCPM5-2B(1.50GiB)/Gemma 4 E2B(2.88GiB) | 上位とほぼ同じ賢さで、書く速さは約1.8〜1.9倍。MiniCPM5-2B はサイズも小さい |
| 速さとサイズ | Qwen3.5-2B(1.18GiB)/LFM2-1.2B(0.68GiB) | GPU で130〜260 tok/s。ただし賢さは上位より明らかに落ちる。決まった形の短い文を作る用途向け |
| ライセンスの扱いやすさ | Apache-2.0 か MIT のもの | アプリに組み込んで配るなら、独自ライセンス(Gemma 3・Llama 3.2・LFM・NVIDIA)は条件を読んでから |
どれを優先するかは、端末のメモリと使い道で決まります。アプリの中で短い返事を素早く返したいなら速さとサイズ、文章の要約や簡単なプログラム作りに使うなら賢さを優先するのが目安です。
この見立てが外れる条件も書いておきます。書く速さがサイズで決まるなら、同じくらいのサイズのモデルは同じくらいの速さになるはずです。実際、1.44〜1.50GiB の3本(MiniCPM5-2B・LFM2-2.6B・Granite 3.3 2B)は、GPU で119.9〜123.8 tok/s とそろいました。もし同じサイズで速さが大きく違うモデルがあれば、サイズ以外の要素(MoE などの作り)が速さを左右していることになります。
この記事で確かめていないこと
- スマートフォンの実機では測っていません。CPU だけの値は、PC の CPU の4スレッドでの値です
- 賢さは、当ブログの物差し(プログラミング7問・ひっかけ6問)の各1回です。文章の自然さや日本語のうまさは測っていません
- Q4_K_M 以外の縮め方(Apple や Google の端末向けの形式など)では測っていません
まとめ〜端末で動かすなら、まず MiniCPM5-2B か Qwen3.5-4B
端末向けとして出た MiniCPM5-2B は、1.5GiB の小ささで、4B 級とほぼ同じ賢さを出し、速さは約2倍でした。公式の説明どおり、サイズ・速さ・賢さのつり合いが良いモデルです。
最初の1本に迷ったら、メモリに余裕があり賢さを取りたいなら Qwen3.5-4B、軽さと速さも欲しいなら MiniCPM5-2B を試してみてください。どちらも Apache-2.0 で、アプリに組み込む場合も扱いやすいライセンスです。1B 以下のモデルは、用途を短い定型の返事に絞ったときの候補です。
メモリの量ごとに、もっと大きいモデルも含めて何が動くかは、こちらにまとめています。
ほかの記事は、このまとめページから探せます。