機器に小さなAIを入れるには?〜スマホ・組込み用基板・超小型の機器で動く小型LLMと、必要なハードウェアを調べた
ふだんはミニPCでローカルLLMを動かしています。9月に Meta が、AIエージェント「Muse」と、Muse と話すためのキーホルダー型の端末を発表しました。Meta の公式発表では、Muse は専用のクラウド上のコンピュータで動くとされています。では、クラウドに頼らずに、自分で作る機器へ小さなAIを入れるには、どんなハードウェアが要るのでしょうか。
本記事では、スマホ、組込み用基板、スマホより小さい機器の順に、公式の資料を中心に調べた内容をまとめます。あわせて、小さな端末から自宅のローカルLLMにつなぐ構成も取り上げます。ミニPCは対象外です。
2026年10月3日時点の内容です。取り上げた機器は動かしていません。この記事は調べた内容をまとめたもので、実機で測った記録ではありません。数値には、公式・報道・第三者のどれに出ているかを添えました。
何を調べたのか
機器に小さなAI(小型のLLM)を入れるときの「AIの置き場所」を、3つに分けて調べました。
| 置き場所 | 中身 | この記事での対象 |
|---|---|---|
| ①端末の中 | モデルを機器の中のメモリに置き、機器だけで動かす | スマホ、組込み用基板、スマホより小さい機器 |
| ②自宅のサーバー | 機器は音声などを送るだけ。モデルは自宅のPCやサーバーで動かす | 小さな端末+自宅のローカルLLM(頭脳の置き場所として触れる) |
| ③クラウド | 機器は通信するだけ。モデルは事業者のクラウドで動く | Meta の Muse を例に確認 |
調べたのは、動かせるモデルの大きさの目安と、そのために機器へ載せる部品(メモリ、AI用のチップ、電力)です。
Meta の Muse は、どこで動いているのか
Meta は2026年9月8日に Muse を発表しました。Meta の公式発表(2026年9月8日)には、Muse は専用のクラウド上のコンピュータで動き、他の人のエージェントが届かないよう隔離される、と書かれています。端末側(キーホルダー型の端末、スマホ、グラス)でエージェントが動く、という記述は確認できませんでした。
9月23日の Meta Connect で披露されたキーホルダー型の端末「Muse Charm」について、Meta が公式に述べているのは、Muse と話すための端末であることと、年末に出荷する予定であることです。約2インチの画面、前後のカメラ、5G の内蔵などは報道(Bloomberg 由来の二次報道)で、Meta は確認していません。大きさ、電池、チップ、価格は非公表です。
グラス向けには、Meta は2026年9月23日の公式エンジニアリングブログで「Private Processing」を説明しています。通話やメッセージ返信など、多くの音声の指示は端末の中で完結します。一方、文脈の検索や長期の記憶のように大きなモデルが要る処理は、クラウドの暗号化された仮想マシンで実行するそうです。Private Processing が Muse に使われるかどうかは、ブログに Muse の名前が出てこないため、確認できませんでした。
ここから、Muse Charm のような端末は、クラウドのAIへの入出力装置と考えられます。5G を内蔵してスマホなしでつなぐ構成も、端末にLLMを載せない前提と合います(これは推測で、Meta は端末内の推論の有無を明らかにしていません)。
スマホの中で動くAIは、どのくらいの大きさか
スマホは、AIの置き場所①のなかで、公式の資料がいちばん揃っています。
| 実装 | モデルの大きさ | 公式の記載 | 出どころ |
|---|---|---|---|
| Apple(iOS 26 世代の端末内モデル) | 約3B(30億パラメータ) | 重みは2ビット量子化。対象は iPhone 15 Pro 以降。RAM 容量は公式ページに記載なし | 公式(2025年6月・7月) |
| Apple(AFM 3 Core・iOS 27 世代) | 3B | iPhone 16 以降と、15 Pro・15 Pro Max が対象。速度の公式値なし | 公式(2026年6月8日) |
| Google Gemma 3n(オープンモデル) | 実効 約2B(E2B)/約4B(E4B) | メモリの目安は E2B で 2GB、E4B で 3GB。生のパラメータは 5B超・8B | 公式(2025年6月) |
| Google Gemini Nano(AICore) | 公式ドキュメントに記載なし | Gemini Intelligence の機能は RAM 12GB 以上などが条件と報道(Google 公式ページの脚注の引用) | 報道(2026年5月) |
「RAM が何GBなら何Bまで動くか」を、公式がまとめた資料は確認できませんでした。第三者の集約ブログには概算がありますが、実測ではなく、検索結果の要約だけで本文は読んでいないため、載せていません。
端末内で動かす理由として、Android の公式ドキュメントは、プロンプトをサーバーへ送らず機密データが端末に留まること、ネットに接続しなくても動くことを挙げています。Google の Recorder アプリの要約機能の担当者は、プライバシー、遅延の短さ、ネット不要を理由に挙げています(2024年8月)。
組込み用基板に、小型LLMを載せられるか
機器に組み込む基板では、とくに生成の段階で、メモリの大きさとメモリの速さ(帯域)が大きな制約になるようです。公式や第三者の資料で確認できた5種類を並べます。
| 基板 | メモリ | AI性能 | 消費電力 | 公式のLLM対応・実測 | 価格(取得日) |
|---|---|---|---|---|---|
| Raspberry Pi 5 + AI HAT+ 2(Hailo-10H) | AI HAT 側 8GB | 40 TOPS(INT4) | Hailo-10H は標準 2.5W(公式) | 発売時の対応モデルは 1B〜1.5B 級の5つ(公式) | 公式ページ $200、発売時の公式ニュース $130(食い違い) |
| NVIDIA Jetson Orin Nano Super | 8GB・102GB/s | 67 TOPS(スパース INT8) | 7〜25W | 公式ブログの実測: Llama 3.1 8B 19.14 tok/s、Qwen2.5 7B 21.75 tok/s、Llama 3.2 3B 43.07 tok/s(MLC・INT4) | 米国 $249、国内 106,920円(税込・2026年10月1日) |
| Rockchip RK3588 系(Radxa ROCK 5B+ など) | 最大 32GB | NPU 6 TOPS(公式) | 実消費は確認できず | 公式の RKLLM が Qwen・Llama・Gemma などに対応 | 確認できず |
| Rockchip RK1820/RK1828(LLM用コプロセッサ) | 専用 DRAM 2.5GB/5GB(CNX Software の報道) | 20 TOPS(INT8)(同報道) | 確認できず | 対象モデルは 3B/7B、59〜180 tok/s と報道(CNX Software)。公式のデータシートは読めず | 開発キット $889〜$1,029(報道) |
| Arduino UNO Q(Qualcomm QRB2210) | 2GB または 4GB | 公式に TOPS の表記なし | 確認できず | 公式ページに「小型のLLMを搭載できる」とあるのみ。モデル名・速度の記載なし | 4GB 版で発売時 $59。2026年10月1日に検索結果で確認した米ストアの表示は $79(在庫切れ表示) |
表のなかで、TOPS(AIチップの演算能力の目安)は、横並びで比べられません。Hailo-10H の 40 TOPS は INT4、Jetson の 67 TOPS はスパース INT8 という、別々の条件の数字です。
TOPS だけでは決まらない?
CNX Software の測定では、Raspberry Pi 5 の CPU のほうが、40 TOPS の AI HAT+ 2 より生成が速い結果でした。たとえば Llama 3.2 3B で、CPU が 4.78 tok/s、AI HAT+ 2 が 2.60 tok/s です(第三者の実測)。Raspberry Pi 社の Eben Upton は、Pi 5 と Hailo-10 のメモリ系が同じ LPDDR4X-4267 で、律速はメモリ帯域だと述べたと、CNX Software が引用しています。
NVIDIA の公式ブログも、LLM の生成の段階は、重みなどをメモリから読み出す速さが遅延を決め、計算の速さではないと説明しています。ただし、Raspberry Pi・Rockchip・NVIDIA の各公式が「メモリ帯域が律速」と一般論として述べた文は、今回は確認できませんでした。
スマホより小さい機器では、何が動くのか
グラス・ウォッチ・イヤホン
| 機器 | 端末内で動くとされるモデル | 出どころ |
|---|---|---|
| スマートグラス(Qualcomm Snapdragon AR1+ Gen 1) | 最大 1B(10億)パラメータの小型LLM。ライブデモで Llama 1B を端末内で実行(2025年6月) | 報道(Qualcomm の発言の引用)。量産製品としての日程は確認できず |
| スマートウォッチ(Qualcomm Snapdragon Wear Elite) | 最大 2B(20億)パラメータ(2026年3月) | 報道。Qualcomm の公式リリース本文は取得できず |
| イヤホン・補聴器 | 端末内でLLMが動くと公式が説明した例は確認できず | - |
Meta の Ray-Ban Meta 系グラスについては、Meta 公式の仕様表を取得できず、端末内にLLMがあるかどうかは確認できませんでした。Ray-Ban Display については、Meta 公式のヘルプに、Meta AI を使うには Meta AI アプリを入れたスマホと Wi-Fi が必要と書かれています。
マイコン
マイコン(小型の制御用チップ)では、今回見つかった例は、TinyStories のように用途を限った小さなモデルが中心でした。
| チップ | 動かしたモデル | 速さ | 出どころ |
|---|---|---|---|
| ESP32-S3 | 26万パラメータの TinyStories(子ども向けの短い物語を作るだけのモデル) | 19.13 tok/s | 第三者(GitHub・作者の自己申告) |
| ESP32-S3(約8ドルの開発ボード) | 2,890万パラメータの TinyStories(4ビット) | 約9.5 tok/s | 第三者(GitHub・作者の自己申告)。質問への返答や指示の実行はできない |
| Raspberry Pi Pico 2 + microSD | Qwen3-0.6B(Q4_0・321MB) | 約19.4 秒/トークン | 第三者(GitHub)。重みを SD カードから読むため |
| Arm Ethos-U85(FPGA での試作) | 1,500万パラメータの Tiny Llama2 | 7.5〜8 tok/s | 公式(Arm・2024年11月) |
今回調べた範囲では、数億パラメータ以上の汎用の小型LLMが、マイコン単体で実用的な速さで動いた例は確認できませんでした。
超小型のモデル
端末内に置くモデルの候補として、公式のモデルカードと配布サイトで確認できた小型のモデルを並べます。ファイルのサイズは、多くが第三者の配布リポジトリで確認した実寸で、開発元の公式の値ではありません。
Gemma 3 270M の文脈長(32K)は、Hugging Face の公式モデルカードで確認しました(2026年10月3日)。
| モデル | パラメータ数 | 文脈長 | 4ビット量子化後のサイズ | 出どころ |
|---|---|---|---|---|
| Gemma 3 270M | 2.7億 | 32K(32,768 トークン) | 253.1MB(Q4_K_M) | 公式(仕様)+第三者(サイズ) |
| SmolLM2-135M | 約1.35億 | 8K(8,192 トークン) | 105.5MB(Q4_K_M) | 公式+第三者 |
| SmolLM2-360M | 3.6億 | 8K(8,192 トークン) | 270.6MB(Q4_K_M) | 公式+第三者 |
| LFM2-350M | 約3.5億 | 32K(32,768 トークン) | 229.3MB(Q4_K_M) | 公式(Liquid の配布) |
| Qwen3-0.6B | 6億 | 32K(32,768 トークン) | 639.4MB(Q8_0・8ビット) | 公式 |
| Llama 3.2 1B | 12.3億 | 128K(128,000 トークン) | 807.7MB(Q4_K_M) | 公式+第三者 |
用途を絞った使い方を掲げるモデルがあります。たとえば Gemma 3 270M は、感情分析・固有表現の抽出・分類などの微調整向けと公式に書かれています。Gemma 3 270M は、Pixel 9 Pro で 4ビット版を使った25回の会話で、電池が 0.75% 減ったと Google が書いています。日本語への対応は、今回確認できたのは LFM2-350M の公式記載だけです。
小さな端末から、自宅のローカルLLMにつなぐ
Muse のような「小さな端末+AI」を、クラウドではなく自宅のPCで動かす構成は、公式の仕組みとして存在します。Home Assistant(オープンソースの家庭用の自動化ソフト)の音声アシスタント「Assist」です。
| 役割 | 置き場所 | 公式の記載 |
|---|---|---|
| マイク・スピーカー | 小型の端末(ESP32 系の Voice PE、ATOM Echo、ESP32-S3-BOX-3 など) | 端末はマイクの音声を Home Assistant へ流し、処理は Home Assistant 側で行う(ESPHome 公式) |
| 音声認識(Whisper) | 自宅のサーバー | Raspberry Pi 4 で約 8 秒、Intel NUC で 1 秒未満(Home Assistant 公式) |
| LLM | 自宅のサーバー(Ollama など) | Ollama を、ネットワーク越しの外部サーバーとして接続できる(公式) |
| 音声合成(Piper) | 自宅のサーバー | ストリーミング対応で、話し始めるまでの時間が「5秒超」から「約 0.5 秒」へ(Piper・クラウドとも・Home Assistant 公式ブログ 2025年10月22日の計測文。小数まで出ている第三者の値は 0.56/0.51 秒)。LLM の最初の文が出た時点で音声を作り始める |
Home Assistant の公式は、8GB 以上の VRAM を使うローカルモデルは、クラウドのモデルに迫るところまで来ている、と書いています(2025年9月)。一方、小型のモデルは誤りやすく、Home Assistant で操作させる機器は25個未満にするよう推奨されています。Assist API を使ったLLM連携は、試験的な機能(experimental)とされています。
ウェアラブルの例では、OMI(オープンソースの AI ペンダント)が、自前のバックエンドの手順を公式に載せています。ただ、Firebase や OpenAI などクラウドの API が前提で、ローカルLLMへ差し替える手順は確認できませんでした。公式にOllamaに対応していたのは、OMI の ESP32-S3 のグラス(omiGlass)の画像説明だけです。
古い実装にも注意が要ります。Open Interpreter の 01 には Ollama を使うローカルモードがありますが、最後の更新は2024年11月1日で、約11か月止まっています。Home Assistant の旧サテライト実装 wyoming-satellite は2026年1月にアーカイブされ、後継は Linux Voice Assistant とされています。
外出先から自宅のサーバーへつなぐ方法として、Tailscale は、可能なら端末どうしを直接つなぎ、直接の接続が最も遅延が小さく、中継は遅いと公式が説明しています。ただし、電池や通信量への影響の公式の数字は確認できず、「小さなウェアラブル → 自宅のローカルLLM」として完成した公式の製品も見つかりませんでした。外出先の接続は、組み合わせとして考えられる構成です。
自作するなら、どんな部品が要るのか
モデルが載るか:メモリ容量
モデルの重みのサイズは、パラメータ数に1個あたりのバイト数をかけたものです。NVIDIA の公式ブログは、7B を 16ビット(FP16)で持つと約 14GB になると例を挙げています。llama.cpp などは 1.5〜8ビットの量子化で、メモリを減らせると説明しています。Google の Gemma 3n は、生のパラメータが 5B超・8B でも、アクセラレータ側のメモリは 2GB・3GB の規模で動くと公式が書いています(これは作業用のメモリの話で、ダウンロードの大きさではありません)。
速さが出るか:メモリ帯域
前の節の NVIDIA の説明のとおり、生成の段階はメモリを読む速さが支配します。論文には、AI用のチップ(NPU)は、入力を読み込む段階には強い一方、生成の段階では CPU のほうが良い場合がある、とするものがあります(arXiv・原文は未読)。スマホは続けて使うと発熱で速度が落ちる、という報告も論文にあるようですが、原文を読めていないため、数字は載せません。
端末側の部品の例
| 構成 | 端末側の部品の例 | 出どころ |
|---|---|---|
| クラウドか自宅につなぐ入出力端末 | ESP32-S3(Xtensa LX7・2コア・240MHz、Wi-Fi・Bluetooth LE)、マイク、スピーカー、電池。Seeed XIAO ESP32S3 Sense はカメラとマイクを内蔵し、PSRAM 8MB・フラッシュ 8MB、21×17.8mm | 公式 |
| 端末内に小型のLLMを載せる | Raspberry Pi Zero 2 W(Cortex-A53・4コア・1GHz、512MB、65×30mm)。SmolLM2-360M で生成 約2.99 tok/s、1回の応答に約40秒(作者の自己申告・追試なし) | 公式(仕様)+第三者(実測) |
今回確認した、端末内だけで動く自作の作例(Raspberry Pi Zero 2 W)は、応答に約40秒かかるものでした。カメラ付きで Meta のように即答する例は、確認できませんでした。
どんな応用があるのか
小型のLLMを機器に組み込んだ例を、出どころのあるものに絞り、出荷済みか試作かを分けました。
| 分野 | 例 | モデル情報・性能 | 状態 | 出どころ |
|---|---|---|---|---|
| スマホ・録音 | Pixel の Recorder の要約(Gemini Nano) | 公式に記載なし | 出荷済み(2024年8月) | 公式 |
| スマホ・OS | Apple Intelligence の端末内モデル | 約3B | 出荷済み | 公式 |
| PC | Windows Copilot+ PC の Phi Silica | 文脈長 4,000 トークン、最初のトークンまで 230 ミリ秒 | 出荷済み | 公式(2024年12月) |
| 翻訳 | Galaxy AI のインタープリター(言語パックを入れるとデータ通信なしで通訳) | 使用モデルは確認できず | 出荷済み | 公式 |
| 車載 | Cerence の CaLLM Edge(車の操作や地点検索を接続なしで) | 3.8B | 発表済み。搭載車は確認できず(2024年11月) | 報道(プレスリリースの転載) |
| 産業機器 | Rockwell の FactoryTalk Design Studio Copilot(制御パネルなどで動作可と説明) | 9B 級 | 発表(2025年11月)。出荷済みかは確認できず | 公式プレスリリース(2025年11月13日。Nemotron-Nano-9B-v2 を土台に FactoryTalk のデータで微調整し、操作パネルや専用機器で動かすと説明。本文は報道の引用で確認) |
| グラス | Snapdragon AR1+ Gen 1 のグラス | 1B | 試作・デモ(2025年6月) | 報道 |
| 部品・ロボット | M5Stack Module LLM(完全オフライン) | Qwen2.5-0.5B。NPU 3.2 TOPS、RAM 4GB、約1.5W | 製品(販売中) | 公式 |
| 介護・心理支援 | 病院のロボットでの研究(ローカルで運用。GDPR への適合が理由)/オフラインのメンタル支援アプリの研究 | 13B/1B | 研究 | 論文 |
家電メーカーの量産品、産業機器の異常の説明、量産のおもちゃについて、小型LLMが端末内で動く出荷済みの製品は、一次資料で確認できませんでした。
今回、確認できなかったこと
- Muse Charm の大きさ・電池・チップ・価格(Meta が非公表)。画面・カメラ・5G は報道のみ
- Meta の Ray-Ban Meta 系グラスの、端末内にLLMがあるかどうか(Meta 公式の仕様表を取得できず)
- スマホの「RAM が何GBなら何Bまで」という公式の一覧、Gemini Nano のパラメータ数
- イヤホンや補聴器で端末内のLLMが動くと、公式が説明した例
- 数億パラメータ以上の汎用の小型LLMが、マイコン単体で実用的な速さで動いた例
- ウェアラブルから自宅のローカルLLMへつなぐ、完成した公式の製品。Tailscale の電池・通信量の公式の数字
機器にAIを入れるなら、どこから始めるか
端末を入出力だけにして頭脳を自宅に置く構成では、端末とは別に自宅の PC かサーバーが要ります。調べた内容から、読者が決めたいことは、自分の機器のAIを、どこに置くかだと考えました。
| 作りたい機器 | AIの置き場所の目安 | 調べた根拠 |
|---|---|---|
| スマホのアプリ | OS 標準の端末内モデル(Apple、Gemini Nano)か、Gemma 3n のような小型モデル | 公式が用途(要約・書き換え・短い対話)と対応機種を示している |
| 手のひらサイズの専用機器(電源あり) | Jetson Orin Nano Super のようなメモリ 8GB・帯域 102GB/s 級の基板。Raspberry Pi 5 + AI HAT+ 2 の発売時の公式対応モデルには 1B〜1.5B 級が含まれる | 公式ブログの実測(Jetson)、第三者の実測(Raspberry Pi) |
| 家の中で音声で操作する小さな機器 | 端末は入出力だけにして、頭脳は自宅のサーバー(Home Assistant + Ollama) | 公式の構成。公式の数値は Whisper・Piper のみで、LLM の遅延は第三者の参考値 |
| 電池で動く超小型の機器 | マイコン単体で汎用の小型LLMを動かす現実的な例は、今回の調べでは確認できなかった。通信してクラウドか自宅につなぐ | マイコンの実例はおもちゃのサイズ |
| Muse のように外でも使う端末 | Muse はクラウドにつなぐ構成。自宅のサーバーにつなぐなら、VPN などの組み合わせが必要 | Meta の公式(クラウド)。Tailscale の公式説明 |
迷ったら、まず自宅のPCに Ollama を入れ、Home Assistant の公式の手順(Ollama 連携)で、小さな端末から話しかける構成を試すのが、いちばん情報の揃った入口です。ESP32 系の端末は、公式に対応する製品が複数あります。
参考にしたサイト
- Meta:Muse の公式発表(2026年9月8日)/Meta 公式エンジニアリングブログ「Private Processing」(2026年9月23日)
- Apple Machine Learning Research:Apple Foundation Models 2025 年版/2026 年6月8日の Apple Intelligence の発表
- Google Developers Blog:Gemma 3n、Gemma 3 270M/Android Developers:Gemini Nano
- Raspberry Pi:AI HAT+ 2/CNX Software:AI HAT+ 2 のレビュー(2026年1月20日)、RK1820・RK1828(2025年12月30日)
- NVIDIA Developer Blog:Jetson Orin Nano の高速化/LLM 推論の最適化
- Home Assistant:Assist・Ollama 連携・公式ブログ Voice Chapter 11(2025年10月22日)
- Hugging Face:各モデルのモデルカードと配布リポジトリ/GitHub:ESP32・Pico のLLM の作例/Arm:Small Language Model on Edge(2024年11月)