初心者 9 分インターフェース

Linuxで使うLM Studio:Ubuntu、Debian、Arch、Fedora (2026)

Linux 版の LM Studio は、約 600 MB の AppImage です。グラフィカルインターフェース、Hugging Face に接続するモデルストア、llama.cpp 推論エンジン、OpenAI 互換サーバーがまとめられています。システムへのインストールも、デーモンも、リポジトリの追加も不要で、実行ファイルが一つあるだけです。このガイドでは、インストール、GGUF のダウンロード、ローカルサーバーの起動、Linux 固有の落とし穴(権限、FUSE、GPU)を解説します。

著者 Mohamed Meguedmi·更新 2026-08-27·Ubuntu 24.04でテスト済み
i
要約
Linux 版 LM Studio は約600 MB の AppImage です。システムへのインストールもデーモンも不要で、実行ファイルは1つだけです。· 手順は3つだけです。ファイルをダウンロードし、実行権限を付与(chmod +x)してから起動します。· 前提条件は glibc 2.35 以降を備えた比較的新しいディストリビューションで、Ubuntu 22.04 以降では libfuse2 パッケージも必要です。· AppImage は GPU を自動検出し、お使いのカードに応じて CUDA、ROCm、Vulkan のいずれかで推論を高速化します。

#LinuxでLM Studioを使う理由

Linux でローカル LLM を使うなら、まず候補になるのが Ollama です。systemd デーモン、使いやすい CLI を備え、デフォルトでは localhost:11434 で接続を待ち受けます。サーバー用途には優れた選択肢です。LM Studio は別の方向性、つまり GUI を備えたデスクトップ環境での利用を重視しています。

ターミナル不要の充実したインターフェース
チャット、Hugging Faceのモデルブラウザー、ダウンロードマネージャー、サンプリング設定を、すべてGUIで利用できます。本番環境に移行する前に、複数のモデルを手早く試したい場合に便利です。
ワンクリックで OpenAI 互換サーバーを構築
DeveloperタブにはOpenAIプロトコルをサポートするエンドポイント http://localhost:1234/v1 が公開されています。openai-python、LangChain、Continue.devなどの任意のSDKが、コードを変更せずにこれを呼び出せます。
システムインストール不要
AppImageはユーザー空間で動作します。sudoも、パッケージのインストールも、サードパーティーのリポジトリも不要です。情報システム部門によって利用が制限されたマシンや、一般的でないディストリビューションでは、大きな利点です。
GGUF形式にネイティブ対応
LM Studio は GGUF フォーマット(llama.cpp が使用するフォーマット)のみを読み取ります。これは Ollama が内部で使用するフォーマットと同一であり、そのため人気モデルの 100 % が利用可能です。
i
LM StudioとOllamaは問題なく併用できます
両方を使っても問題ありません。スクリプトや各種連携にはデーモンとして動かすOllamaを、対話型チャットや新しいモデルを探す用途にはLM Studioを利用できます。使用するポートが異なるため(11434と1234)、互いに干渉しません。

#前提条件

ローカルAIキット

LM StudioがLinux環境で動くようになったら、ローカルAIキットで次の段階に進めます。LM Studioの高度な設定(第5章)に加え、問題が起きたときには、動作が遅い、グラフィックスカードが使われない、モデルがすべて忘れてしまう、といった症状別の診断フローチャート(第14章)が役立ちます。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート
比較的新しいLinuxディストリビューション
Ubuntu 22.04以降、Fedora 38以降、Debian 12以降、Archまたはその派生版。LM Studio は主要なディストリビューションでテストされているが、AppImageはポータブルであり、他の環境(openSUSE、Linux Mint、Pop!_OS)でも動作する。
glibc 2.35以上
AppImageにはグラフィックス関連の依存ライブラリが同梱されていますが、glibcは含まれていません。非常に古いディストリビューション(CentOS 7、Debian 10)では動作しません。
FUSE
AppImage は FUSE を使って読み取り専用でマウントされます。ほとんどのディストリビューションではデフォルトでインストールされています。Ubuntu 22.04 以降では、libfuse2 パッケージを明示的にインストールする必要があります。
最低 8 GBのRAM
7BモデルをQ4で動かすための容量です。快適に使うなら16GB、14Bモデルを動かす場合や、IDEも同時に開いておく場合は32GB以上が目安です。
GPU(オプションですが推奨)
比較的新しいドライバー(CUDA 12以降)を使用するNVIDIA GPU、ROCm 6.xを使用するAMD GPU、またはVulkan経由で使用するIntel Arcに対応しています。GPUがなくてもCPUで動作します。3Bモデルなら実用になりますが、7Bモデルでは遅くなります。
!
Ubuntu 22.04 および FUSE
Ubuntu 22.04ではlibfuse2がデフォルトで含まれなくなったため、多くのAppImageが動作せず、「dlopen(): error loading libfuse.so.2」のような分かりにくいメッセージが表示されます。LM Studioを起動する前に、sudo apt install libfuse2でパッケージをインストールしてください。

#1. AppImageを取得する

公式サイトは自動的に使用中のOSを検出し、適切なバージョンを提案します。lmstudio.aiからダウンロードしていることを確認してください。信頼できないミラーが存在します。

公式サイト
https://lmstudio.ai
  1. 01
    .AppImageファイルをダウンロードしてください
    バイナリファイルのサイズは500~700MBです。llama.cpp、ElectronのUI、ランタイム全体が含まれています。慣例に従うなら ~/Applications/ または ~/.local/bin/ に保存してください。AppImageは自己完結型なので、実際にはどこに保存してもかまいません。
  2. 02
    実行可能にする
    chmod +x コマンドを使います。これを行わないと、ファイルは実行できない単なるアーカイブのままです。
  3. 03
    Lancez-le
    ファイルマネージャーでダブルクリックするか、コマンドラインから起動してください。初回起動時には、LM Studioが内容を~/.cache/AppImage/に展開します。これは正常な動作で、以後は更新のたびにだけ行われます。
CLIで素早くインストール
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
LM Studioをアプリケーションメニューに追加する
appimagedまたはAppImageLauncherをインストールしてください。これらのツールは~/Applications/内のAppImageを自動的に検出し、ネイティブアプリと同じようにメニューに表示されるよう、.desktopエントリを作成します。AppImageLauncherは更新の管理も行います。

#2. 初回起動

初回起動時、LM Studioはインターフェースレベルの選択を求めます。User(チャットのみ)、Power User(チャット+設定)、Developer(サーバーを含むすべて)から選びます。機能を試すにはPower Userで十分です。後でローカルサーバーを使用する場合は、Settings → UI ModeからDeveloperに切り替えることができます。

左側のサイドバーには、各ビューが整理されています:

Chat
ChatGPTのようなメイン画面です。利用時間の90%はこの画面を使うことになります。
Discover
モデルストアです。Hugging Face を直接検索でき、検出された VRAM に基づくハードウェア互換性の目安(Full GPU Offload / Partial / Likely too large)が表示されます。
My Models
ダウンロード済みのすべてのモデルを、サイズと量子化形式とともに一覧できます。不要なモデルの整理に役立ちます。
Developer
OpenAIと互換性のあるローカルサーバー。Power UserまたはDeveloperモードでのみ表示されます。

#3. GGUFモデルをダウンロードする

LM StudioはGGUFフォーマット(llama.cppのバイナリ形式、GGMLの後継)のみを読み取ります。Hugging Faceにモデルが存在していても、GGUF形式がなければ直接読み込めません。人気のあるモデルのほとんど(Qwen 3.5、Gemma 4、Mistral、Granite 4.2、DeepSeek、gpt-oss)にはコミュニティが維持するGGUFバージョンが存在します。

  1. 01
    Discover を開き、モデルを検索する
    初めて試すなら、Qwen 3.5 9BまたはGranite 4.2 8Bと入力してください。どちらも、VRAM 6〜8 GBクラスで2026年の定番として安心して選べるモデルです。LM Studioには、利用可能なGGUFの各バリエーションが表示されます。これらは通常、bartowski、unsloth、lmstudio-communityが公開しています。
  2. 02
    互換性タグを確認してください
    各バリエーションの右側には、緑・オレンジ・赤のインジケーターがあります。「Full GPU Offload」は、モデル全体がVRAMに収まることを意味します。「Partial」は、一部がシステムRAMに配置されることを意味します(動作は遅くなります)。「Likely too large」の場合は、そのモデルの使用を見送ってください。
  3. 03
    量子化を選択してください
    Q4_K_Mは、ほとんどの場合に最適なバランスです(品質の低下が小さく、サイズはFP16の約50%)。VRAMに30〜40%多く余裕があるならQ5_K_Mを選びます。十分な空き容量があり、最高の品質を求めるならQ8_0を選びます。FP16を使うのは、ファインチューニングや比較の場合だけです。
  4. 04
    Downloadをクリック
    7Bモデルのダウンロードサイズは、量子化方式によって4〜8 GBです。ダウンロードはバックグラウンドで進むため、複数を同時に開始できます。
→
モデルはどこに保存されていますか?
デフォルトでは、LM Studioはモデルを~/.cache/lm-studio/models/に保存します。Linuxでは、このフォルダの容量が急速に増えることがあります(モデル数個で50~200 GB)。/homeが容量の小さいSSD上にある場合は、Settings → Model Directoryから、モデルのフォルダをより容量の大きいディスクに移動してください。

モデルのダウンロードが完了したら、Chatに戻り、上部のドロップダウンメニューからモデルを選択し、GPU offloadスライダーを表示される最大値に設定して、Load modelをクリックしてください。読み込みには、モデルのサイズとディスクの速度に応じて5〜30秒かかります。

#4. ローカルサーバーをポート1234で起動

ここに、LM Studio が単なるグラフィカルなチャット画面を超える機能があります。Developer タブでは、OpenAI の API とまったく同じプロトコルを使う HTTP サーバーを公開できます。どの OpenAI クライアント(openai-python、LangChain、LlamaIndex、Continue.dev)でも、ベース URL を変更するだけで、それ以外の変更なしに接続できます。

  1. 01
    Developerモードに切り替える
    Settings → UI Mode → Developer。Developer タブ(ターミナルのアイコン)がサイドバーに表示されます。
  2. 02
    モデルを選択
    Developer タブ上部のメニューです。モデルはダウンロード済みである必要があります。VRAM 容量が足りれば、複数のモデルを同時に読み込めます。
  3. 03
    Context LengthとGPU Offloadを設定してください
    VRAMが許す範囲内でGPUオフロードを最大限に設定してください。デフォルトのコンテキスト長4096はほとんどの用途に十分ですが、RAGや長文処理の場合は8192または16384に設定してください。
  4. 04
    Start Serverをクリックしてください
    サーバーはデフォルトで127.0.0.1:1234で接続を待ち受けます。1234がすでに使用中の場合は、すぐ隣にある設定項目でポートを変更できます。
サーバーをテストする
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

Python側では、公式のopenaiクライアントだけで十分です。APIキーは任意の文字列で構いません。LM Studioはその値を検証しません。

Pythonクライアント
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
リアルタイムログ
Developer タブには Server Logs がリアルタイムで表示され、受信した各リクエスト、生成時間、トークン数を確認できます。連携機能のデバッグに不可欠です。

LAN上でサーバーを公開し、チームの他の端末からアクセスできるようにするには、サーバー設定のHostを127.0.0.1から0.0.0.0に変更してください。注意:LM Studioには標準の認証機能がありません。共有ネットワークでは、Basic認証を設定したCaddyまたはNginxをサーバーの前段に置くか、ファイアウォールでアクセスを制限してください。

#5. LinuxにおけるGPUアクセラレーション

Linux上でLM Studioの最もトリッキーなポイントです。AppImageはCPU、CUDA、ROCm、Vulkanの複数のバックエンドを内包しており、起動時に自動的に選択しますが、インストールされたドライバーによっては自動検出が誤りを起こすことがあります。

NVIDIA (CUDA)
バージョン535以降のプロプライエタリドライバーがインストールされていること(nvidia-smiが動作する必要があります)。CUDA 12.xはAppImageに同梱されているため、別途インストールする必要はありません。Settings → Hardwareで、GPUが一覧に表示され、バックエンドがCUDAになっていることを確認してください。
AMD (ROCm)
ホストにROCm 6.xドライバーがインストールされていること(Radeon RX 6800 XTとそれより新しいモデルは公式にサポートされています。RX 6700 XTとRX 7600も、HSA_OVERRIDE_GFX_VERSIONを使うと動作することが多いです)。使用するユーザーアカウントは、renderグループとvideoグループに属している必要があります。
Intel Arc / iGPU
Vulkanバックエンド。Arc A770/A750ではまずまずの性能ですが、NVIDIA/AMDには劣ります。vulkan-toolsをインストールし、vulkaninfoでGPUが検出されていることを確認してください。
GPU なし
自動的にCPUにフォールバックします。Ryzen 7でGranite 4.2 8B Q4を動かす場合、速度の目安は5〜8トークン/秒です。Qwen 3.5 2BやGranite 4.2 3Bのような3Bモデルなら、十分に実用的です。14Bを超えると、待ち時間に耐えられるかが問題になります。

ChatまたはDeveloperのGPU offloadスライダーは、モデルの何層をGPUに読み込むかを制御します。VRAMが許す範囲で最大に設定してください。実際のメモリ使用量をターミナルで確認してください:

VRAMの監視
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
モデルサイズごとのVRAMの参考値(Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB。この数値は、コンテキスト長が4096を超える場合にやや上昇します。
GPU選びの目安
RTX 3060 12GBなら7B〜14Bを余裕を持って動かせます。RTX 4070 12GBも同様で、さらに余裕があります。RTX 4080 16GBなら14BをQ5で動かせ、24Bにも手が届き始めます。RTX 4090 24GBなら32BをQ4、70BをQ3で動かせます。24〜48GBのユニファイドメモリを搭載したMac M4 Proでも、Apple Siliconで同様のことができますが、LM StudioのmacOS版を使います。
!
通知なしでCPUにフォールバックする落とし穴
指定したコンテキスト長でモデルを動かすのにVRAMが足りない場合、LM Studioは一部のレイヤーをRAMに移しますが、それを常に明確に知らせるとは限りません。その結果、生成速度は40トークン/秒以上ではなく、2〜5トークン/秒になります。生成中にSettings → Hardwareまたはnvidia-smiを確認してください。VRAMが使い切られていなければ、処理の一部がCPUで実行されています。

#よくある落とし穴

AppImageが起動しない
ターミナルから起動して、エラーメッセージを確認してください。最もよくある原因は、Ubuntu 22.04以降でlibfuse2がインストールされていないことです(sudo apt install libfuse2で解決できます)。次に多いのは、glibcが古すぎることです(LM Studioには2.35以上が必要なため、CentOS 7やDebian 10では動作しません)。
GPUが使用されていません
nvidia-smi(またはrocm-smi)を確認してください。GPUが表示されない場合は、ドライバーがインストールされていないか、古すぎます。GPUが表示されているのにLM StudioがCPUを使い続ける場合は、Settings → Hardwareでバックエンド(CUDA/ROCm/Vulkan)を指定できます。AMDの場合、ユーザーはrenderとvideoの両グループに所属している必要があります。usermodの実行後にログアウトし、再ログインしてください。
GPUを活用してもモデルが遅い
VRAMがいっぱいになり、通知なしに一部がオフロードされています。コンテキスト長を短くするか、GPU offloadスライダーを下げてしきい値を測定するか、ビット数をさらに減らした量子化(Q5 → Q4 → Q3)を選んでください。
ポート1234が既に使用中です
別の開発用サービスがそのポートを使用していることがよくあります。Developer → Settingsでポートを変更するか、プロセスを終了してください:ss -tulpn | grep 1234。localhostで使う場合、ファイアウォールを変更する必要はありません。
動作を壊す自動更新
LM Studioはデフォルトで自動更新されます。管理された環境(企業やCI/CD統合環境)では、Settings → Updatesから自動更新を無効にしてください。必要に応じて以前のバージョンに戻せるように、正常に動作するバージョンの番号を記録してください。
CLIでの自動補完がありません
AppImage版は、高機能なCLIを提供していません。本格的にスクリプトを組むなら、サーバーのHTTP API(ポート1234)を使うのが適切な方法です。本格的なCLIが必要なら、llama.cppやOllamaのほうが適しています。

#さらに詳しく

LM Studioのインストールが済み、GGUFが読み込まれ、OpenAI互換サーバーが稼働しています。次に進むなら、以下の選択肢が自然です。

APIサーバーをさらに使いこなす
「LM StudioをAPIサーバーにする」ガイドでは、ストリーミング、複数モデルの並列実行、安全なLANへの公開、パフォーマンス調整について詳しく説明しています。
Linux上でOllamaと比較する
「LinuxにOllamaをインストールする」ガイドでは、デーモン/サーバーとしての利用を重視した、もう一つの人気のソフトウェア構成を解説しています。多くの方にとって、Ollama(デーモン)と、その上でクライアントインターフェースとして使うLM Studioの組み合わせが理想的です。
適切な量子化の選択
「量子化の選び方(Q4、Q5、Q8、FP16)」ガイドでは、実際の品質低下を視覚的に比較し、品質と VRAM 使用量のバランスを判断する手助けをします。特に、GGUF ファイルを自分でダウンロードする場合に役立ちます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。