機器に小さなAIを入れるには?〜スマホ・組込み用基板・超小型の機器で動く小型LLMと、必要なハードウェアを調べた

本ページは広告(アフィリエイトプログラム)を含みます。詳しくはプライバシーポリシーをご覧ください。

ふだんはミニPCでローカルLLMを動かしています。9月に Meta が、AIエージェント「Muse」と、Muse と話すためのキーホルダー型の端末を発表しました。Meta の公式発表では、Muse は専用のクラウド上のコンピュータで動くとされています。では、クラウドに頼らずに、自分で作る機器へ小さなAIを入れるには、どんなハードウェアが要るのでしょうか。

本記事では、スマホ、組込み用基板、スマホより小さい機器の順に、公式の資料を中心に調べた内容をまとめます。あわせて、小さな端末から自宅のローカルLLMにつなぐ構成も取り上げます。ミニPCは対象外です。

2026年10月3日時点の内容です。取り上げた機器は動かしていません。この記事は調べた内容をまとめたもので、実機で測った記録ではありません。数値には、公式・報道・第三者のどれに出ているかを添えました。

何を調べたのか

機器に小さなAI(小型のLLM)を入れるときの「AIの置き場所」を、3つに分けて調べました。

置き場所中身この記事での対象
①端末の中モデルを機器の中のメモリに置き、機器だけで動かすスマホ、組込み用基板、スマホより小さい機器
②自宅のサーバー機器は音声などを送るだけ。モデルは自宅のPCやサーバーで動かす小さな端末+自宅のローカルLLM(頭脳の置き場所として触れる)
③クラウド機器は通信するだけ。モデルは事業者のクラウドで動くMeta の Muse を例に確認

調べたのは、動かせるモデルの大きさの目安と、そのために機器へ載せる部品(メモリ、AI用のチップ、電力)です。

Meta の Muse は、どこで動いているのか

Meta は2026年9月8日に Muse を発表しました。Meta の公式発表(2026年9月8日)には、Muse は専用のクラウド上のコンピュータで動き、他の人のエージェントが届かないよう隔離される、と書かれています。端末側(キーホルダー型の端末、スマホ、グラス)でエージェントが動く、という記述は確認できませんでした。

9月23日の Meta Connect で披露されたキーホルダー型の端末「Muse Charm」について、Meta が公式に述べているのは、Muse と話すための端末であることと、年末に出荷する予定であることです。約2インチの画面、前後のカメラ、5G の内蔵などは報道(Bloomberg 由来の二次報道)で、Meta は確認していません。大きさ、電池、チップ、価格は非公表です。

グラス向けには、Meta は2026年9月23日の公式エンジニアリングブログで「Private Processing」を説明しています。通話やメッセージ返信など、多くの音声の指示は端末の中で完結します。一方、文脈の検索や長期の記憶のように大きなモデルが要る処理は、クラウドの暗号化された仮想マシンで実行するそうです。Private Processing が Muse に使われるかどうかは、ブログに Muse の名前が出てこないため、確認できませんでした。

ここから、Muse Charm のような端末は、クラウドのAIへの入出力装置と考えられます。5G を内蔵してスマホなしでつなぐ構成も、端末にLLMを載せない前提と合います(これは推測で、Meta は端末内の推論の有無を明らかにしていません)。

スマホの中で動くAIは、どのくらいの大きさか

スマホは、AIの置き場所①のなかで、公式の資料がいちばん揃っています。

実装モデルの大きさ公式の記載出どころ
Apple(iOS 26 世代の端末内モデル)約3B(30億パラメータ)重みは2ビット量子化。対象は iPhone 15 Pro 以降。RAM 容量は公式ページに記載なし公式(2025年6月・7月)
Apple(AFM 3 Core・iOS 27 世代)3BiPhone 16 以降と、15 Pro・15 Pro Max が対象。速度の公式値なし公式(2026年6月8日)
Google Gemma 3n(オープンモデル)実効 約2B(E2B)/約4B(E4B)メモリの目安は E2B で 2GB、E4B で 3GB。生のパラメータは 5B超・8B公式(2025年6月)
Google Gemini Nano(AICore)公式ドキュメントに記載なしGemini Intelligence の機能は RAM 12GB 以上などが条件と報道(Google 公式ページの脚注の引用)報道(2026年5月)

「RAM が何GBなら何Bまで動くか」を、公式がまとめた資料は確認できませんでした。第三者の集約ブログには概算がありますが、実測ではなく、検索結果の要約だけで本文は読んでいないため、載せていません。

端末内で動かす理由として、Android の公式ドキュメントは、プロンプトをサーバーへ送らず機密データが端末に留まること、ネットに接続しなくても動くことを挙げています。Google の Recorder アプリの要約機能の担当者は、プライバシー、遅延の短さ、ネット不要を理由に挙げています(2024年8月)。

組込み用基板に、小型LLMを載せられるか

機器に組み込む基板では、とくに生成の段階で、メモリの大きさとメモリの速さ(帯域)が大きな制約になるようです。公式や第三者の資料で確認できた5種類を並べます。

基板メモリAI性能消費電力公式のLLM対応・実測価格(取得日)
Raspberry Pi 5 + AI HAT+ 2(Hailo-10H)AI HAT 側 8GB40 TOPS(INT4)Hailo-10H は標準 2.5W(公式)発売時の対応モデルは 1B〜1.5B 級の5つ(公式)公式ページ $200、発売時の公式ニュース $130(食い違い)
NVIDIA Jetson Orin Nano Super8GB・102GB/s67 TOPS(スパース INT8)7〜25W公式ブログの実測: Llama 3.1 8B 19.14 tok/s、Qwen2.5 7B 21.75 tok/s、Llama 3.2 3B 43.07 tok/s(MLC・INT4)米国 $249、国内 106,920円(税込・2026年10月1日)
Rockchip RK3588 系(Radxa ROCK 5B+ など)最大 32GBNPU 6 TOPS(公式)実消費は確認できず公式の RKLLM が Qwen・Llama・Gemma などに対応確認できず
Rockchip RK1820/RK1828(LLM用コプロセッサ)専用 DRAM 2.5GB/5GB(CNX Software の報道)20 TOPS(INT8)(同報道)確認できず対象モデルは 3B/7B、59〜180 tok/s と報道(CNX Software)。公式のデータシートは読めず開発キット $889〜$1,029(報道)
Arduino UNO Q(Qualcomm QRB2210)2GB または 4GB公式に TOPS の表記なし確認できず公式ページに「小型のLLMを搭載できる」とあるのみ。モデル名・速度の記載なし4GB 版で発売時 $59。2026年10月1日に検索結果で確認した米ストアの表示は $79(在庫切れ表示)

表のなかで、TOPS(AIチップの演算能力の目安)は、横並びで比べられません。Hailo-10H の 40 TOPS は INT4、Jetson の 67 TOPS はスパース INT8 という、別々の条件の数字です。

TOPS だけでは決まらない?

CNX Software の測定では、Raspberry Pi 5 の CPU のほうが、40 TOPS の AI HAT+ 2 より生成が速い結果でした。たとえば Llama 3.2 3B で、CPU が 4.78 tok/s、AI HAT+ 2 が 2.60 tok/s です(第三者の実測)。Raspberry Pi 社の Eben Upton は、Pi 5 と Hailo-10 のメモリ系が同じ LPDDR4X-4267 で、律速はメモリ帯域だと述べたと、CNX Software が引用しています。

NVIDIA の公式ブログも、LLM の生成の段階は、重みなどをメモリから読み出す速さが遅延を決め、計算の速さではないと説明しています。ただし、Raspberry Pi・Rockchip・NVIDIA の各公式が「メモリ帯域が律速」と一般論として述べた文は、今回は確認できませんでした。

スマホより小さい機器では、何が動くのか

グラス・ウォッチ・イヤホン

機器端末内で動くとされるモデル出どころ
スマートグラス(Qualcomm Snapdragon AR1+ Gen 1)最大 1B(10億)パラメータの小型LLM。ライブデモで Llama 1B を端末内で実行(2025年6月)報道(Qualcomm の発言の引用)。量産製品としての日程は確認できず
スマートウォッチ(Qualcomm Snapdragon Wear Elite)最大 2B(20億)パラメータ(2026年3月)報道。Qualcomm の公式リリース本文は取得できず
イヤホン・補聴器端末内でLLMが動くと公式が説明した例は確認できず-

Meta の Ray-Ban Meta 系グラスについては、Meta 公式の仕様表を取得できず、端末内にLLMがあるかどうかは確認できませんでした。Ray-Ban Display については、Meta 公式のヘルプに、Meta AI を使うには Meta AI アプリを入れたスマホと Wi-Fi が必要と書かれています。

マイコン

マイコン(小型の制御用チップ)では、今回見つかった例は、TinyStories のように用途を限った小さなモデルが中心でした。

チップ動かしたモデル速さ出どころ
ESP32-S326万パラメータの TinyStories(子ども向けの短い物語を作るだけのモデル)19.13 tok/s第三者(GitHub・作者の自己申告)
ESP32-S3(約8ドルの開発ボード)2,890万パラメータの TinyStories(4ビット)約9.5 tok/s第三者(GitHub・作者の自己申告)。質問への返答や指示の実行はできない
Raspberry Pi Pico 2 + microSDQwen3-0.6B(Q4_0・321MB)約19.4 秒/トークン第三者(GitHub)。重みを SD カードから読むため
Arm Ethos-U85(FPGA での試作)1,500万パラメータの Tiny Llama27.5〜8 tok/s公式(Arm・2024年11月)

今回調べた範囲では、数億パラメータ以上の汎用の小型LLMが、マイコン単体で実用的な速さで動いた例は確認できませんでした。

超小型のモデル

端末内に置くモデルの候補として、公式のモデルカードと配布サイトで確認できた小型のモデルを並べます。ファイルのサイズは、多くが第三者の配布リポジトリで確認した実寸で、開発元の公式の値ではありません。

Gemma 3 270M の文脈長(32K)は、Hugging Face の公式モデルカードで確認しました(2026年10月3日)。

モデルパラメータ数文脈長4ビット量子化後のサイズ出どころ
Gemma 3 270M2.7億32K(32,768 トークン)253.1MB(Q4_K_M)公式(仕様)+第三者(サイズ)
SmolLM2-135M約1.35億8K(8,192 トークン)105.5MB(Q4_K_M)公式+第三者
SmolLM2-360M3.6億8K(8,192 トークン)270.6MB(Q4_K_M)公式+第三者
LFM2-350M約3.5億32K(32,768 トークン)229.3MB(Q4_K_M)公式(Liquid の配布)
Qwen3-0.6B6億32K(32,768 トークン)639.4MB(Q8_0・8ビット)公式
Llama 3.2 1B12.3億128K(128,000 トークン)807.7MB(Q4_K_M)公式+第三者

用途を絞った使い方を掲げるモデルがあります。たとえば Gemma 3 270M は、感情分析・固有表現の抽出・分類などの微調整向けと公式に書かれています。Gemma 3 270M は、Pixel 9 Pro で 4ビット版を使った25回の会話で、電池が 0.75% 減ったと Google が書いています。日本語への対応は、今回確認できたのは LFM2-350M の公式記載だけです。

小さな端末から、自宅のローカルLLMにつなぐ

Muse のような「小さな端末+AI」を、クラウドではなく自宅のPCで動かす構成は、公式の仕組みとして存在します。Home Assistant(オープンソースの家庭用の自動化ソフト)の音声アシスタント「Assist」です。

役割置き場所公式の記載
マイク・スピーカー小型の端末(ESP32 系の Voice PE、ATOM Echo、ESP32-S3-BOX-3 など)端末はマイクの音声を Home Assistant へ流し、処理は Home Assistant 側で行う(ESPHome 公式)
音声認識(Whisper)自宅のサーバーRaspberry Pi 4 で約 8 秒、Intel NUC で 1 秒未満(Home Assistant 公式)
LLM自宅のサーバー(Ollama など)Ollama を、ネットワーク越しの外部サーバーとして接続できる(公式)
音声合成(Piper)自宅のサーバーストリーミング対応で、話し始めるまでの時間が「5秒超」から「約 0.5 秒」へ(Piper・クラウドとも・Home Assistant 公式ブログ 2025年10月22日の計測文。小数まで出ている第三者の値は 0.56/0.51 秒)。LLM の最初の文が出た時点で音声を作り始める

Home Assistant の公式は、8GB 以上の VRAM を使うローカルモデルは、クラウドのモデルに迫るところまで来ている、と書いています(2025年9月)。一方、小型のモデルは誤りやすく、Home Assistant で操作させる機器は25個未満にするよう推奨されています。Assist API を使ったLLM連携は、試験的な機能(experimental)とされています。

ウェアラブルの例では、OMI(オープンソースの AI ペンダント)が、自前のバックエンドの手順を公式に載せています。ただ、Firebase や OpenAI などクラウドの API が前提で、ローカルLLMへ差し替える手順は確認できませんでした。公式にOllamaに対応していたのは、OMI の ESP32-S3 のグラス(omiGlass)の画像説明だけです。

古い実装にも注意が要ります。Open Interpreter の 01 には Ollama を使うローカルモードがありますが、最後の更新は2024年11月1日で、約11か月止まっています。Home Assistant の旧サテライト実装 wyoming-satellite は2026年1月にアーカイブされ、後継は Linux Voice Assistant とされています。

外出先から自宅のサーバーへつなぐ方法として、Tailscale は、可能なら端末どうしを直接つなぎ、直接の接続が最も遅延が小さく、中継は遅いと公式が説明しています。ただし、電池や通信量への影響の公式の数字は確認できず、「小さなウェアラブル → 自宅のローカルLLM」として完成した公式の製品も見つかりませんでした。外出先の接続は、組み合わせとして考えられる構成です。

自作するなら、どんな部品が要るのか

モデルが載るか:メモリ容量

モデルの重みのサイズは、パラメータ数に1個あたりのバイト数をかけたものです。NVIDIA の公式ブログは、7B を 16ビット(FP16)で持つと約 14GB になると例を挙げています。llama.cpp などは 1.5〜8ビットの量子化で、メモリを減らせると説明しています。Google の Gemma 3n は、生のパラメータが 5B超・8B でも、アクセラレータ側のメモリは 2GB・3GB の規模で動くと公式が書いています(これは作業用のメモリの話で、ダウンロードの大きさではありません)。

速さが出るか:メモリ帯域

前の節の NVIDIA の説明のとおり、生成の段階はメモリを読む速さが支配します。論文には、AI用のチップ(NPU)は、入力を読み込む段階には強い一方、生成の段階では CPU のほうが良い場合がある、とするものがあります(arXiv・原文は未読)。スマホは続けて使うと発熱で速度が落ちる、という報告も論文にあるようですが、原文を読めていないため、数字は載せません。

端末側の部品の例

構成端末側の部品の例出どころ
クラウドか自宅につなぐ入出力端末ESP32-S3(Xtensa LX7・2コア・240MHz、Wi-Fi・Bluetooth LE)、マイク、スピーカー、電池。Seeed XIAO ESP32S3 Sense はカメラとマイクを内蔵し、PSRAM 8MB・フラッシュ 8MB、21×17.8mm公式
端末内に小型のLLMを載せるRaspberry Pi Zero 2 W(Cortex-A53・4コア・1GHz、512MB、65×30mm)。SmolLM2-360M で生成 約2.99 tok/s、1回の応答に約40秒(作者の自己申告・追試なし)公式(仕様)+第三者(実測)

今回確認した、端末内だけで動く自作の作例(Raspberry Pi Zero 2 W)は、応答に約40秒かかるものでした。カメラ付きで Meta のように即答する例は、確認できませんでした。

どんな応用があるのか

小型のLLMを機器に組み込んだ例を、出どころのあるものに絞り、出荷済みか試作かを分けました。

分野例モデル情報・性能状態出どころ
スマホ・録音Pixel の Recorder の要約(Gemini Nano)公式に記載なし出荷済み(2024年8月)公式
スマホ・OSApple Intelligence の端末内モデル約3B出荷済み公式
PCWindows Copilot+ PC の Phi Silica文脈長 4,000 トークン、最初のトークンまで 230 ミリ秒出荷済み公式(2024年12月)
翻訳Galaxy AI のインタープリター(言語パックを入れるとデータ通信なしで通訳)使用モデルは確認できず出荷済み公式
車載Cerence の CaLLM Edge(車の操作や地点検索を接続なしで)3.8B発表済み。搭載車は確認できず(2024年11月)報道(プレスリリースの転載)
産業機器Rockwell の FactoryTalk Design Studio Copilot(制御パネルなどで動作可と説明)9B 級発表(2025年11月)。出荷済みかは確認できず公式プレスリリース(2025年11月13日。Nemotron-Nano-9B-v2 を土台に FactoryTalk のデータで微調整し、操作パネルや専用機器で動かすと説明。本文は報道の引用で確認)
グラスSnapdragon AR1+ Gen 1 のグラス1B試作・デモ(2025年6月)報道
部品・ロボットM5Stack Module LLM(完全オフライン)Qwen2.5-0.5B。NPU 3.2 TOPS、RAM 4GB、約1.5W製品(販売中)公式
介護・心理支援病院のロボットでの研究(ローカルで運用。GDPR への適合が理由)/オフラインのメンタル支援アプリの研究13B/1B研究論文

家電メーカーの量産品、産業機器の異常の説明、量産のおもちゃについて、小型LLMが端末内で動く出荷済みの製品は、一次資料で確認できませんでした。

今回、確認できなかったこと

  • Muse Charm の大きさ・電池・チップ・価格(Meta が非公表)。画面・カメラ・5G は報道のみ
  • Meta の Ray-Ban Meta 系グラスの、端末内にLLMがあるかどうか(Meta 公式の仕様表を取得できず)
  • スマホの「RAM が何GBなら何Bまで」という公式の一覧、Gemini Nano のパラメータ数
  • イヤホンや補聴器で端末内のLLMが動くと、公式が説明した例
  • 数億パラメータ以上の汎用の小型LLMが、マイコン単体で実用的な速さで動いた例
  • ウェアラブルから自宅のローカルLLMへつなぐ、完成した公式の製品。Tailscale の電池・通信量の公式の数字

機器にAIを入れるなら、どこから始めるか

端末を入出力だけにして頭脳を自宅に置く構成では、端末とは別に自宅の PC かサーバーが要ります。調べた内容から、読者が決めたいことは、自分の機器のAIを、どこに置くかだと考えました。

作りたい機器AIの置き場所の目安調べた根拠
スマホのアプリOS 標準の端末内モデル(Apple、Gemini Nano)か、Gemma 3n のような小型モデル公式が用途(要約・書き換え・短い対話)と対応機種を示している
手のひらサイズの専用機器(電源あり)Jetson Orin Nano Super のようなメモリ 8GB・帯域 102GB/s 級の基板。Raspberry Pi 5 + AI HAT+ 2 の発売時の公式対応モデルには 1B〜1.5B 級が含まれる公式ブログの実測(Jetson)、第三者の実測(Raspberry Pi)
家の中で音声で操作する小さな機器端末は入出力だけにして、頭脳は自宅のサーバー(Home Assistant + Ollama)公式の構成。公式の数値は Whisper・Piper のみで、LLM の遅延は第三者の参考値
電池で動く超小型の機器マイコン単体で汎用の小型LLMを動かす現実的な例は、今回の調べでは確認できなかった。通信してクラウドか自宅につなぐマイコンの実例はおもちゃのサイズ
Muse のように外でも使う端末Muse はクラウドにつなぐ構成。自宅のサーバーにつなぐなら、VPN などの組み合わせが必要Meta の公式(クラウド)。Tailscale の公式説明

迷ったら、まず自宅のPCに Ollama を入れ、Home Assistant の公式の手順(Ollama 連携)で、小さな端末から話しかける構成を試すのが、いちばん情報の揃った入口です。ESP32 系の端末は、公式に対応する製品が複数あります。

参考にしたサイト

  • Meta:Muse の公式発表(2026年9月8日)/Meta 公式エンジニアリングブログ「Private Processing」(2026年9月23日)
  • Apple Machine Learning Research:Apple Foundation Models 2025 年版/2026 年6月8日の Apple Intelligence の発表
  • Google Developers Blog:Gemma 3n、Gemma 3 270M/Android Developers:Gemini Nano
  • Raspberry Pi:AI HAT+ 2/CNX Software:AI HAT+ 2 のレビュー(2026年1月20日)、RK1820・RK1828(2025年12月30日)
  • NVIDIA Developer Blog:Jetson Orin Nano の高速化/LLM 推論の最適化
  • Home Assistant:Assist・Ollama 連携・公式ブログ Voice Chapter 11(2025年10月22日)
  • Hugging Face:各モデルのモデルカードと配布リポジトリ/GitHub:ESP32・Pico のLLM の作例/Arm:Small Language Model on Edge(2024年11月)