初心者 12 分インストール

ローカルにLLMをインストールする:ステップバイステップガイド (2026)

端的な回答

LLMをローカルにインストールするには、3つのものが必要です。目的のモデルサイズに見合う十分なRAMまたはVRAMを備えたマシン、モデルを動かすためのツール(ターミナル不要のLM Studio、コマンドラインで使うOllama、または上級者向けのllama.cpp)、そしてそのハードウェアに適した最初の量子化モデルです。比較的新しいマシンで最初のローカルチャットが使えるようになるまで、10〜15分を見込んでください。モデルをダウンロードした後は、インターネット接続は不要です。

PC や Mac で直接 AI を動かしたいのに、ツールやモデルの名前がどれも似ていて、どこから始めればよいか迷っていませんか?このガイドでは、選ぶ前に知っておきたい全体像を紹介します。お使いのマシンで動かせるかを確認し、3 つのインストール方法を比較し、最初に使うモデルを見つけ、初回の試行を台無しにする失敗を避けるためのガイドです。特定の点をさらに詳しく知りたい場合に備えて、各ステップから、より詳しい専用ガイドへ進めるようになっています。

著者 Mohamed Meguedmi·更新 2026-08-24·Windows・macOS・Linuxでテスト済み

#マシンの確認:RAM、VRAMおよびモデルサイズ

ツールを選ぶ前に、本当に重要なのは、手元のマシンがモデルにどれだけのメモリを割り当てられるかという点です。「7B」や「32B」という表記はモデルのパラメータ数を示しますが、実際に必要な容量を決めるのは、その量子化版です。量子化版は、精度をわずかに犠牲にして、メモリに収まるように圧縮されています。Q4 量子化(Q4_K_M と表記されることが多い)は、最初に使う際の標準的なバランスです。モデル本来の重みと比べて必要なメモリを大幅に減らしながら、品質の低下は通常、実際の使用ではあまり感じられません。

8GBのRAM、専用GPUなし
Q4の3〜4B程度の軽量モデル:基本的な用途向けで、応答は遅めですが、実用になります。
16GBのRAM(CPU)または8GBのVRAM(GPU)
最も無理なく始められる構成で、Q4量子化の7〜8Bモデルを使えます。これは、初めて本格的に使う際に最も一般的な形式です。
12 GB の VRAM
14Bモデルにスムーズにアップグレードできる余裕があります。
24GBのVRAM(またはMacでの統合メモリは32〜48GB)
Q4で量子化された32Bモデルが快適に動作します。
64GB以上のRAMまたは統合メモリ
70B前後のモデルも実行可能になりますが、CPUとGPUの間で部分的にオフロードするため、生成速度は大幅に低下します。
i
これらは参考情報であり、保証ではありません。
使用するコンテキスト長、オペレーティングシステム、ほかに開いているアプリケーションによって、実際に使えるメモリの余裕は変わります。快適に使える構成と考えるには、モデル自体のサイズに加えて、常に約 20〜30% の余裕を確保してください。

#方法を選ぶ:LM Studio、Ollama、llama.cpp

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

LLM をローカルで実行するには、主に3つの方法があります。これらは互いに排他的ではなく、異なる哲学に基づいています。選択は主に、ターミナルへの慣れ具合と、インストール後にモデルで何をしたいかによって決まります。

LM Studio — ターミナル操作不要
充実したグラフィカルインターフェース、組み込みのモデル検索機能、視覚的に操作できるGPU設定を備えたデスクトップアプリです。初めて使う際に最も手軽な選択肢で、Windows、macOS(Apple Silicon)、Linuxで利用できます。
Ollama — ターミナルおよびAPI
1つのコマンドでインストールでき、モデルライブラリをコマンドラインから操作できます。OpenAI互換のローカルAPIサーバーはデフォルトで有効です。スクリプトを作成したり、自動化したり、外部のツールを接続したりする予定なら、自然に候補となる選択肢です。
llama.cpp — エキスパート向け
LM Studioをはじめ、多くのツールが内部で利用している推論エンジンです。ソースからのコンパイル、各パラメータの細かな制御が可能で、インターフェースはありません。細部まで理解したい、あるいは最適化したい人向けです。

まとめると、ターミナルを一切開きたくないなら → LM Studio。スクリプト、自動化処理、アプリケーションからモデルを呼び出したいなら → Ollama。コンパイルの各パラメータを理解・調整したい、または一般的ではないハードウェアでモデルを動かしたいなら → llama.cpp。


#手順に沿ってすばやくインストール

以下に、3つの方法それぞれのインストール手順を簡潔にまとめます。ここでの目的は、全体像を把握して数分で使い始められるようにすることです。スクリーンショットを含む詳しい手順を知りたい場合は、各ツールの専用ガイドを参照できます。

LM Studioを使う場合(ターミナル操作不要):

  1. 01
    1. インストーラをダウンロード
    LM Studioの公式サイトから、使用するシステムに合わせたバージョンをダウンロードしてください。
  2. 02
    2. モデル検索を開く
    初回起動時に、検索タブ(Ctrl/Cmd+Shift+M キーで開く)を開いてカタログを確認してください
  3. 03
    3. 適切なモデルを選択
    アプリケーションはダウンロード前に、VRAM 容量に基づく互換性の推定結果を表示します。お使いのマシンと互換性があると表示されたモデルを優先してください。
  4. 04
    4. モデルをロードして会話する
    Chatタブを開き、上部のメニューでダウンロードしたモデルを読み込んで、最初の質問をしてください。

Ollama(ターミナルおよびAPI)で:

  1. 01
    1. Ollama のインストール
    Linuxでは公式スクリプト、WindowsとmacOSでは.exeまたは.dmg形式のインストーラーを使用します。デスクトップアプリはインストール後に自動的に起動します。
  2. 02
    2. 最初のモデルを起動する
    ターミナルで、モデルの名前を指定してollama run suivieを実行すると、モデルがダウンロードされ、ターミナル内で直接チャットが開始されます。
  3. 03
    3. チャットする、または外部ツールを接続する
    ターミナルで続けるか、OpenAI互換のアプリケーションの接続先をローカルAPIサーバーに設定してください(デフォルトのポートは11434)。
  4. 04
    4. インストール済みモデルの管理
    モデルのリスト表示、変更、削除は、専用の管理コマンドでいつでも行えます。

llama.cpp(専門家向け):

  1. 01
    1. バイナリをコンパイルする
    リポジトリをクローンし、あなたのハードウェア(CPU、CUDA、Metal、またはROCm)に応じてコンパイルを行ってください。
  2. 02
    2. GGUFモデルをダウンロードする
    利用可能なメモリに合った量子化を選び、Hugging FaceからGGUF形式のファイルをダウンロードしてください。
  3. 03
    3. チャットのバイナリを起動
    ダウンロードしたGGUFファイルを指定し、コンテキストとGPUオフロードのパラメータを好みに合わせて設定してください。
  4. 04
    4. GPU/CPUのオフロード調整
    GPUとCPU間のレイヤーごとのメモリ配分を調整し、あなたの設定に最適な速度/メモリのバランスを見つけることができます。
i
詳細については
この3つの方法はそれぞれ、スクリーンショットや高度なオプションを含む個別の手順ガイドで詳しく説明するだけの内容があります。この簡略版だけでも、最初のモデルを動かして回答を得るには十分です。AMD GPUのサポートやサーバーのネットワーク設定など、特定の点を詳しく知りたくなったら、専用ガイドに戻ってください。

#最初のモデルをダウンロードする

最初に選ぶモデルで特に大切なのは、その評判ではなく、お使いのマシンのメモリに無理なく収まるかどうかです。以下に、構成ごとの信頼できる目安を示します。

低スペックマシン(8〜16 GB RAM、専用GPUなし)
Q4量子化した3〜4B程度の小型汎用モデル:CPUだけでも高速に動作し、会話や短い文章の要約・翻訳には十分です。
8〜12GBのVRAM
7〜8BのQ4_K_Mモデル、例えばQwen3 8BまたはMistral:日常使用における品質と速度のバランスが取れた最も一般的な選択肢です。
16〜24GBのVRAM
14Bモデル、またはこの容量範囲の上限に近ければQ4の32Bモデル。たとえばGemmaの最大サイズのモデルなどで、推論やコーディングにより余裕が生まれます。
まだ何に使いたいか決まっていない場合
小さなモデルから始めましょう。軽量モデルが正しく応答するかを確認するには、数分しかかかりません。最初の試行がうまくいってから、より大きなモデルに進めばよいのです。
→
量子化方式の名前は単なる飾りではありません
Q4_K_M、Q5_K_M、Q8_0といったタグは、モデルの圧縮レベルを示します。数字が小さいほどモデルは軽量で高速になりますが、精度は低くなります。初めて試す際は、Q4_K_Mから始めるのが最適です。

#よくある誤りを避ける

ローカルAIに対する悪い第一印象の大半は、ツールやモデルそのものの実際の問題よりも、設定の不備から生じます。初めてLLMをローカルにインストールする人が陥りやすい落とし穴と、それらを素早く見つける方法を紹介します。

モデルがVRAMの容量を超過しています
モデルがシステム RAM に溢れ出し、場合によっては読み込み時にクラッシュします。応答が非常に遅くなったり、メモリエラーが表示されたりします。モデルサイズを 1 つ下げたり、量子化レベルを 1 つ下げたりしてください。
量子化方式を適当に選ぶ
「一番良いものを使いたい」と、入手可能な中で最も重いバージョンをダウンロードすると、メモリに収まらないことがよくあります。まずは Q4_K_M を使い、メモリに本当に余裕がある場合にだけ、より重い量子化形式に進んでください。
ファンが勢いよく回り、応答に時間がかかる
初めて大きなモデルを使うときには、これは正常です。推論はGPUやCPUに大きな負荷をかけます。遅すぎると感じるなら、そのモデルがマシンの性能に対して大きすぎるというサインであり、修正すべきバグではありません。
テスト前にすべてをダウンロードする
数十GBのモデルのダウンロードを始める前に、小規模モデルが動作し、正しく応答することを確認しておくのがよいでしょう。

#次のステップは? RAG、コーディング支援、API

最初のモデルをインストールして正常に動作するようになったら、用途に応じて次のステップを選べます。自分の文書を使って対話する、エディタにコーディング支援ツールを接続する、あるいはローカルAPIサーバーを自分のスクリプトやアプリケーションから利用できるようにする、といった進め方があります。

ドキュメントとの対話(RAG)
LM Studioには、すぐに使えるRAG機能が組み込まれています。Ollamaで同等の結果を得るには、Open WebUIのようなサードパーティー製ツール、または専用のパイプラインを組み合わせる必要があります。
コードエディタでAIの支援を受ける
Ollama または LM Studio のOpenAI互換APIサーバーは、Clineなどの拡張機能に接続され、100%ローカルでコードを生成するサポートを提供できます。
APIを介して自動化
両方のツールはOpenAI互換のローカルサーバーを公開しており、このAPIを前提として設計された既存のスクリプトやアプリケーションで、クライアント側の変更なしに再利用できます。
→
一つずつ進めます
初日からRAG、コード支援、自動化を目指す必要はありません。まずは、ローカルチャットがご自身の質問に正しく答えることを確認してください。この土台がしっかりできれば、より高度な使い方へと自然に進めます。

#よくある質問

ローカルにLLMをインストールすることは合法かつ無料ですか?+
はい。Ollama、LM Studio、llama.cppなどのツールは無料で、オープンウェイトモデル(Llama、Qwen、Mistral、Gemmaなど)は、個人利用を認めるライセンスで公開されています。一部のライセンスには、大規模な商用利用について特別な条件があるため、モデルごとにその詳細ページで確認してください。
始めるために最低限必要なハードウェア構成は?+
実際には、最初に数十億パラメータのモデルを動かすなら、16GBのRAMと比較的新しいプロセッサで十分です。モデルのサイズを大きくすると、少なくとも8GBのVRAMを搭載したGPU、または十分なユニファイドメモリを備えたApple Siliconチップがあれば、格段に快適に使えます。
グラフィックスカードなしでLLMをローカルにインストールすることは可能ですか?+
はい、ここで紹介する3つの方法はすべてCPUのみで動作します。3Bから8BのモデルはGPUなしでも利用できますが、専用のグラフィックカードを使う場合より応答が遅くなります。
どのくらいのディスク容量を確保しておく必要がありますか?+
量子化されたモデルのサイズは、最小のものでは数百MB、最大のものでは数十GBに及びます。使うモデルを決める前に複数のモデルを試す予定なら、SSDに十分な空き容量を確保してください。
最初にどのモデルを選ぶべきですか?+
Qwen3 8BやMistralなど、Q4_K_Mで量子化された7〜8Bの汎用モデルは、最近のほとんどのマシンで手堅い最初の選択肢です。その後、実際のRAMまたはVRAMの容量と最初に試した結果に応じて、モデルのサイズを調整してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。