iPhoneおよびiPadでのローカルLLM:動作するアプリとモデル vraiment
iPhoneでローカルLLMを動かすことは可能で、実際に動作します。Apple Siliconチップ(AシリーズとMシリーズ)とMLXフレームワークにより、10億〜80億パラメータのモデルを、オフラインで端末上で直接実行できます。このガイドでは、うたい文句どおりに使えるアプリを見極め、お使いのiPhoneやiPadによってRAMが実際に何を左右するのかを説明し、宣伝文句に頼らず、実用的な性能の目安を示します。
#iPhone でローカル LLM を実行する意義は何か
iOS上のローカルLLMは、すべての計算をお使いの端末上で実行します。サーバーもサブスクリプションも不要で、データがスマートフォンの外に出ることもありません。これは、メッセージを毎回クラウドに送信するChatGPTのようなアプリとは逆の仕組みです。これを求める理由は具体的です。完全なプライバシー(医療メモ、下書き、コード)、飛行機内やネットワークがない環境でも動作すること、そしてモデルをダウンロードした後は継続的な費用が一切かからないことです。
ただし、制約もあります。iPhoneには、RTX 4070を搭載したPCほどのメモリ容量も処理能力もありません。ポケットの中で70Bモデルを動かすことはできません。それでも、適切に量子化した3Bモデルなら、文章の要約、メールの言い換え、簡単な質問への回答、翻訳には十分です。すべてオフラインで、すぐに利用できます。
#Apple シリコン、MLXおよびNeural Engine
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
最近のiPhoneとiPadは、Macと同じApple Siliconアーキテクチャを採用しています。システムチップ(iPhoneではAシリーズ、iPad ProではMシリーズ)に加え、とりわけ重要なのが、CPU、GPU、Neural Engineで共有するユニファイドメモリです。この共通のRAM領域によって、モバイル端末でのLLM推論が可能になります。モデルは一度読み込めば、コピーせずにすべてのコアからアクセスできます。
MLXはAppleの機械学習フレームワークで、このユニファイドメモリを念頭に設計されています。本格的なiOSアプリは、チップのGPUを活用するためにMLX、またはMetal対応でコンパイルしたllama.cppを使います。推論の計算の大部分を担うのは、CPU単独ではなく、Metal経由で動作するGPUです。
- ユニファイドメモリ
- CPU、GPUおよびANEは同じRAMを共有します。これは、読み込むことができるモデルのサイズに関する制限要因1番です。
- GPU Metal
- MLXまたはllama.cppを通じて推論を実行します。これが毎秒のトークン数を決定します。
- Neural Engine (ANE)
- 強力ですが、特定の用途に特化しています。現時点では、LLMによるテキスト生成にはあまり活用されていません。
#前提条件および各デバイスのRAM
iOSでは、本当に重要な数値はRAM容量だけですが、Appleはそれをあまり前面に出していません。それでも、モデルを読み込めるか、アプリがクラッシュするかを左右するのはRAM容量です。最近のデバイスについて、目安を以下に示します。
- iPhone 15 / 15 Plus
- RAMは6 GB。Q4量子化の1B~3Bモデルなら快適に使えます。3Bモデルは動作しますが、7Bモデルは容量の限界に近く、システム用のメモリにほとんど余裕がありません。
- iPhone 15 Pro / 16 / 16 Pro
- 8GB。モバイルでのバランスが最もよい容量です。3Bは快適に動作し、7B〜8BもQ4でコンテキストを適度な長さに抑えれば実用可能です。
- iPhone 17 Pro
- 12 GB(最近のProシリーズ)。7B~8Bの快適な運用およびより長いコンテキストに対応する実際の余裕があります。
- iPad Pro M4
- 構成により16 GB以上。iOS で使う端末として最も適しており、8B モデルが快適に動作し、さらに大きなモデルも選択肢に入ります。
Q4で量子化したモデルのメモリ使用量の目安は、デスクトップと同じです。3Bモデルは約2GB、7Bモデルは約5GB、8Bモデルはそれより少し大きくなります。これに、会話が長くなるほど増えるコンテキスト用のメモリ(KVキャッシュ)を加えてください。そのため、正常に起動していたアプリでも、コンテキストが長くなるとクラッシュすることがあります。
#実用的なiOSアプリ
App Store には、クラウドサービスの窓口にすぎない「AI」アプリが数多くあります。本当にローカルで利用するには、モデルをデバイスにダウンロードし、MLX または llama.cpp で実行するアプリが必要です。以下に、信頼できる選択肢を紹介します。
- PocketPal AI
- 無料でオープンソースです。Hugging FaceからGGUF形式のモデルをダウンロードし、llama.cppで実行します。シンプルなチャット画面を備え、コンテキストと温度を設定できます。最初に使うアプリとしておすすめです。
- LLM Farm
- オープンソースで、設定を幅広く変更できます。多くの形式に対応し、推論を細かく調整できます。やや技術的な知識が必要ですが、さまざまなモデルを試すのに最適です。
- Enclave / MLXベースのアプリケーション
- AppleのフレームワークであるMLXを利用するアプリです。新しいApple Siliconでは良好な性能を発揮し、プライバシーを重視したものが多くあります。
- Private LLM
- 最適化された量子化モデルを備え、すぐに使える有料アプリです。設定は不要で、必要なものがすべてパッケージに含まれています。
#モデルのインストールと起動:ステップバイステップ
以下の例では、無料で一般的な操作の流れを示すのに適した PocketPal AI を使います。他のアプリでも基本的な手順は同じです。
- 01アプリをインストールするApp StoreからPocketPal AIをダウンロードしてください。アカウントは不要で、サーバーへの接続もありません。
- 02モデルを選択組み込みのモデルライブラリを開いてください。アプリにはモバイルに適したモデル(Qwen 3.5 2B、Granite 4.2 3B、Gemma 4 E2B、Qwen 3.5 4B)が用意されています。まずは Q4 の 2B または 3B といった小さいモデルから始めましょう。
- 03ダウンロードダウンロードを開始してください(サイズによって数百MBから約2GBまで変化します)。Wi-Fi経由で実行してください。ファイルはデバイスのローカルストレージに残ります。
- 04モデルを読み込むダウンロードしたモデルを選択して、メモリに読み込んでください。この段階でアプリが終了してしまう場合は、RAM不足です。より小さいモデルを選ぶか、ほかのアプリを閉じてください。
- 05オフラインでチャットするチャットを開き、質問をしてください。機内モードを有効にして確認してください。すべてが引き続き動作することが、端末の外に何も送信されていない証拠です。
興味がある方々に、最も直接的な方法として、llama.cpp を自前でコンパイルすることも可能です。ただし、iOS では署名されたアプリ内でのみ任意のコードの実行が許可されているため、実際には専用アプリを介する方法が、ほとんどのユーザーにとって現実的な唯一の手段となります。
#RAMに応じてどのモデルを選ぶか
適切なモデルを選ぶには、まず使用するデバイスが重要です。以下では、控えめな性能のものから高性能なものまで、具体的なおすすめを紹介します。いずれもQ4量子化です。
- iPhone 15 / 15 Plus (6 GB)
- 快適さを重視するなら Qwen 3.5 2B(1.9 GB)または Granite 4.2 3B(2.2 GB)、品質をさらに重視するなら Qwen 3.5 4B(3.4 GB)を選んでください。コンテキストは短く保ってください。
- iPhone 16 / 16 Pro (8 GB)
- 3B〜4Bモデルなら、日常的な用途で快適に使えます。8B〜9Bモデル(Granite 4.2 8Bは5.3 GB、Qwen 3.5 9Bは6.6 GBで、256kコンテキストと画像入力に対応)も、コンテキスト長を適度に抑えればQ4で動作します。速度は遅くなりますが、性能は大幅に上がります。
- iPhone 17 Pro (12 GB)
- 8B〜9Bモデルを快適に使え、より長いコンテキストにも対応できます。この容量帯で最高の品質を求めるなら、Q8のQwen 3.5 9B(11 GB)。
- iPad Pro M4 (16GB+)
- Qwen 3.5 9Bは実際の使用でもスムーズに動作します。約12Bまでのモデル(Gemma 4 12B、マルチモーダル、7.6 GB)も試せるようになり、M4 GPUのおかげで速度もまずまずです。
フランス語では、Gemma 4とQwen 3.5のモデルは、そのサイズの割によく対応できます。要約、言い換え、短い回答には3Bモデルで十分です。より本格的な推論やコーディングでは、モバイル端末の限界をすぐに感じるようになります。その段階で、自宅のマシンに切り替えるとよいでしょう。
#完全なプライバシー:データは一切端末の外に出ません
これが、モバイル端末でAIをローカル実行する最大の強みです。モデルをダウンロードした後は、チャットにネットワークリクエストは一切必要ありません。プロンプト、文書、下書きはiPhone内に留まります。会話のテレメトリ収集も、データを使った学習も、サーバーからの漏えいリスクもありません。
- 機内モードで確認してください
- 最も簡単なテストは、すべてのネットワーク接続を切り、チャットが引き続き動作するか確認することです。オフラインで動作すれば、ネットワーク経由でデータがやり取りされることはありません。
- ハイブリッドアプリに注意してください
- 一部の「AI」アプリは、ローカルモデルが失敗した際に静かにクラウドに切り替わります。疑問を解消するために、100%ローカルかつオープンソースのアプリを優先してください
- センシティブなデータ
- 健康に関するメモ、秘密保持契約(NDA)の対象となる業務文書、個人情報。これらが決して端末の外に出ないと確信できる唯一の方法は、ローカルで処理することです。
#トラブルシューティングとヒント
- モデルの読み込み時にアプリがクラッシュします
- RAM不足です。ほかのアプリをすべて閉じ、より小さいモデル(7Bではなく3B)か、より軽量な量子化(Q5/Q8ではなくQ4)を選んでください。
- 応答が非常に遅い
- コンテキストの長さと生成するトークン数を減らしてください。端末の発熱も確認してください。iPhoneが熱くなるとサーマルスロットリングが起こり、推論が遅くなります。
- iPhoneが熱くなり、バッテリー残量が急速に減る
- 推論ではGPUをフルに使用します。長時間のセッションでは、これは正常です。休憩を取り、連続で生成し続けるのを避け、高負荷で使用する際は電源に接続したままにしてください。
- モデルの回答が的外れ
- 非常に小さなモデルに複雑なタスクを任せる場合には、よくあることです。依頼内容を簡単にするか、RAMに余裕があればモデルのサイズを一段階上げてください。
- ダウンロードが進まない
- GGUFファイルはサイズが大きいため、Wi-Fi接続を維持し、ダウンロード中はアプリをバックグラウンドに移さないでください。
#さらに詳しく
モバイル端末は、外出先での利用や機密性を保った利用に最適ですが、負荷の高いタスクには本格的なマシンが欲しくなるでしょう。このガイドの内容をさらに掘り下げる、本サイトのガイドを紹介します:
- Android上でLLMをローカルで実行する
- Android側の類似製品:PocketPal、MLC ChatおよびTermux経由のllama.cpp。RAMの制限は同じです。
- macOS (Apple Silicon) に Ollama をインストール
- スマートフォンからMacへ移るなら、M1/M2/M3/M4のユニファイドメモリで扱えるモデルの規模は大幅に広がり、32Bモデルやそれ以上のモデルも対象になります。
- 量子化の選択(Q4、Q5、Q8、FP16)
- Q4_K_Mがモバイル端末でもPCでも推奨される妥協点である理由と、Q5/Q8に上げるべきタイミングを理解する。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。