ローカルにLLMをインストールする:ステップバイステップガイド (2026)
LLMをローカルにインストールするには、3つのものが必要です。目的のモデルサイズに見合う十分なRAMまたはVRAMを備えたマシン、モデルを動かすためのツール(ターミナル不要のLM Studio、コマンドラインで使うOllama、または上級者向けのllama.cpp)、そしてそのハードウェアに適した最初の量子化モデルです。比較的新しいマシンで最初のローカルチャットが使えるようになるまで、10〜15分を見込んでください。モデルをダウンロードした後は、インターネット接続は不要です。
PC や Mac で直接 AI を動かしたいのに、ツールやモデルの名前がどれも似ていて、どこから始めればよいか迷っていませんか?このガイドでは、選ぶ前に知っておきたい全体像を紹介します。お使いのマシンで動かせるかを確認し、3 つのインストール方法を比較し、最初に使うモデルを見つけ、初回の試行を台無しにする失敗を避けるためのガイドです。特定の点をさらに詳しく知りたい場合に備えて、各ステップから、より詳しい専用ガイドへ進めるようになっています。
#マシンの確認:RAM、VRAMおよびモデルサイズ
ツールを選ぶ前に、本当に重要なのは、手元のマシンがモデルにどれだけのメモリを割り当てられるかという点です。「7B」や「32B」という表記はモデルのパラメータ数を示しますが、実際に必要な容量を決めるのは、その量子化版です。量子化版は、精度をわずかに犠牲にして、メモリに収まるように圧縮されています。Q4 量子化(Q4_K_M と表記されることが多い)は、最初に使う際の標準的なバランスです。モデル本来の重みと比べて必要なメモリを大幅に減らしながら、品質の低下は通常、実際の使用ではあまり感じられません。
- 8GBのRAM、専用GPUなし
- Q4の3〜4B程度の軽量モデル:基本的な用途向けで、応答は遅めですが、実用になります。
- 16GBのRAM(CPU)または8GBのVRAM(GPU)
- 最も無理なく始められる構成で、Q4量子化の7〜8Bモデルを使えます。これは、初めて本格的に使う際に最も一般的な形式です。
- 12 GB の VRAM
- 14Bモデルにスムーズにアップグレードできる余裕があります。
- 24GBのVRAM(またはMacでの統合メモリは32〜48GB)
- Q4で量子化された32Bモデルが快適に動作します。
- 64GB以上のRAMまたは統合メモリ
- 70B前後のモデルも実行可能になりますが、CPUとGPUの間で部分的にオフロードするため、生成速度は大幅に低下します。
#方法を選ぶ:LM Studio、Ollama、llama.cpp
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
LLM をローカルで実行するには、主に3つの方法があります。これらは互いに排他的ではなく、異なる哲学に基づいています。選択は主に、ターミナルへの慣れ具合と、インストール後にモデルで何をしたいかによって決まります。
- LM Studio — ターミナル操作不要
- 充実したグラフィカルインターフェース、組み込みのモデル検索機能、視覚的に操作できるGPU設定を備えたデスクトップアプリです。初めて使う際に最も手軽な選択肢で、Windows、macOS(Apple Silicon)、Linuxで利用できます。
- Ollama — ターミナルおよびAPI
- 1つのコマンドでインストールでき、モデルライブラリをコマンドラインから操作できます。OpenAI互換のローカルAPIサーバーはデフォルトで有効です。スクリプトを作成したり、自動化したり、外部のツールを接続したりする予定なら、自然に候補となる選択肢です。
- llama.cpp — エキスパート向け
- LM Studioをはじめ、多くのツールが内部で利用している推論エンジンです。ソースからのコンパイル、各パラメータの細かな制御が可能で、インターフェースはありません。細部まで理解したい、あるいは最適化したい人向けです。
まとめると、ターミナルを一切開きたくないなら → LM Studio。スクリプト、自動化処理、アプリケーションからモデルを呼び出したいなら → Ollama。コンパイルの各パラメータを理解・調整したい、または一般的ではないハードウェアでモデルを動かしたいなら → llama.cpp。
#手順に沿ってすばやくインストール
以下に、3つの方法それぞれのインストール手順を簡潔にまとめます。ここでの目的は、全体像を把握して数分で使い始められるようにすることです。スクリーンショットを含む詳しい手順を知りたい場合は、各ツールの専用ガイドを参照できます。
LM Studioを使う場合(ターミナル操作不要):
- 011. インストーラをダウンロードLM Studioの公式サイトから、使用するシステムに合わせたバージョンをダウンロードしてください。
- 022. モデル検索を開く初回起動時に、検索タブ(Ctrl/Cmd+Shift+M キーで開く)を開いてカタログを確認してください
- 033. 適切なモデルを選択アプリケーションはダウンロード前に、VRAM 容量に基づく互換性の推定結果を表示します。お使いのマシンと互換性があると表示されたモデルを優先してください。
- 044. モデルをロードして会話するChatタブを開き、上部のメニューでダウンロードしたモデルを読み込んで、最初の質問をしてください。
Ollama(ターミナルおよびAPI)で:
- 011. Ollama のインストールLinuxでは公式スクリプト、WindowsとmacOSでは.exeまたは.dmg形式のインストーラーを使用します。デスクトップアプリはインストール後に自動的に起動します。
- 022. 最初のモデルを起動するターミナルで、モデルの名前を指定してollama run suivieを実行すると、モデルがダウンロードされ、ターミナル内で直接チャットが開始されます。
- 033. チャットする、または外部ツールを接続するターミナルで続けるか、OpenAI互換のアプリケーションの接続先をローカルAPIサーバーに設定してください(デフォルトのポートは11434)。
- 044. インストール済みモデルの管理モデルのリスト表示、変更、削除は、専用の管理コマンドでいつでも行えます。
llama.cpp(専門家向け):
- 011. バイナリをコンパイルするリポジトリをクローンし、あなたのハードウェア(CPU、CUDA、Metal、またはROCm)に応じてコンパイルを行ってください。
- 022. GGUFモデルをダウンロードする利用可能なメモリに合った量子化を選び、Hugging FaceからGGUF形式のファイルをダウンロードしてください。
- 033. チャットのバイナリを起動ダウンロードしたGGUFファイルを指定し、コンテキストとGPUオフロードのパラメータを好みに合わせて設定してください。
- 044. GPU/CPUのオフロード調整GPUとCPU間のレイヤーごとのメモリ配分を調整し、あなたの設定に最適な速度/メモリのバランスを見つけることができます。
#最初のモデルをダウンロードする
最初に選ぶモデルで特に大切なのは、その評判ではなく、お使いのマシンのメモリに無理なく収まるかどうかです。以下に、構成ごとの信頼できる目安を示します。
- 低スペックマシン(8〜16 GB RAM、専用GPUなし)
- Q4量子化した3〜4B程度の小型汎用モデル:CPUだけでも高速に動作し、会話や短い文章の要約・翻訳には十分です。
- 8〜12GBのVRAM
- 7〜8BのQ4_K_Mモデル、例えばQwen3 8BまたはMistral:日常使用における品質と速度のバランスが取れた最も一般的な選択肢です。
- 16〜24GBのVRAM
- 14Bモデル、またはこの容量範囲の上限に近ければQ4の32Bモデル。たとえばGemmaの最大サイズのモデルなどで、推論やコーディングにより余裕が生まれます。
- まだ何に使いたいか決まっていない場合
- 小さなモデルから始めましょう。軽量モデルが正しく応答するかを確認するには、数分しかかかりません。最初の試行がうまくいってから、より大きなモデルに進めばよいのです。
#よくある誤りを避ける
ローカルAIに対する悪い第一印象の大半は、ツールやモデルそのものの実際の問題よりも、設定の不備から生じます。初めてLLMをローカルにインストールする人が陥りやすい落とし穴と、それらを素早く見つける方法を紹介します。
- モデルがVRAMの容量を超過しています
- モデルがシステム RAM に溢れ出し、場合によっては読み込み時にクラッシュします。応答が非常に遅くなったり、メモリエラーが表示されたりします。モデルサイズを 1 つ下げたり、量子化レベルを 1 つ下げたりしてください。
- 量子化方式を適当に選ぶ
- 「一番良いものを使いたい」と、入手可能な中で最も重いバージョンをダウンロードすると、メモリに収まらないことがよくあります。まずは Q4_K_M を使い、メモリに本当に余裕がある場合にだけ、より重い量子化形式に進んでください。
- ファンが勢いよく回り、応答に時間がかかる
- 初めて大きなモデルを使うときには、これは正常です。推論はGPUやCPUに大きな負荷をかけます。遅すぎると感じるなら、そのモデルがマシンの性能に対して大きすぎるというサインであり、修正すべきバグではありません。
- テスト前にすべてをダウンロードする
- 数十GBのモデルのダウンロードを始める前に、小規模モデルが動作し、正しく応答することを確認しておくのがよいでしょう。
#次のステップは? RAG、コーディング支援、API
最初のモデルをインストールして正常に動作するようになったら、用途に応じて次のステップを選べます。自分の文書を使って対話する、エディタにコーディング支援ツールを接続する、あるいはローカルAPIサーバーを自分のスクリプトやアプリケーションから利用できるようにする、といった進め方があります。
- ドキュメントとの対話(RAG)
- LM Studioには、すぐに使えるRAG機能が組み込まれています。Ollamaで同等の結果を得るには、Open WebUIのようなサードパーティー製ツール、または専用のパイプラインを組み合わせる必要があります。
- コードエディタでAIの支援を受ける
- Ollama または LM Studio のOpenAI互換APIサーバーは、Clineなどの拡張機能に接続され、100%ローカルでコードを生成するサポートを提供できます。
- APIを介して自動化
- 両方のツールはOpenAI互換のローカルサーバーを公開しており、このAPIを前提として設計された既存のスクリプトやアプリケーションで、クライアント側の変更なしに再利用できます。
#よくある質問
ローカルにLLMをインストールすることは合法かつ無料ですか?+
始めるために最低限必要なハードウェア構成は?+
グラフィックスカードなしでLLMをローカルにインストールすることは可能ですか?+
どのくらいのディスク容量を確保しておく必要がありますか?+
最初にどのモデルを選ぶべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。