Linuxで使うLM Studio:Ubuntu、Debian、Arch、Fedora (2026)
Linux 版の LM Studio は、約 600 MB の AppImage です。グラフィカルインターフェース、Hugging Face に接続するモデルストア、llama.cpp 推論エンジン、OpenAI 互換サーバーがまとめられています。システムへのインストールも、デーモンも、リポジトリの追加も不要で、実行ファイルが一つあるだけです。このガイドでは、インストール、GGUF のダウンロード、ローカルサーバーの起動、Linux 固有の落とし穴(権限、FUSE、GPU)を解説します。
#LinuxでLM Studioを使う理由
Linux でローカル LLM を使うなら、まず候補になるのが Ollama です。systemd デーモン、使いやすい CLI を備え、デフォルトでは localhost:11434 で接続を待ち受けます。サーバー用途には優れた選択肢です。LM Studio は別の方向性、つまり GUI を備えたデスクトップ環境での利用を重視しています。
- ターミナル不要の充実したインターフェース
- チャット、Hugging Faceのモデルブラウザー、ダウンロードマネージャー、サンプリング設定を、すべてGUIで利用できます。本番環境に移行する前に、複数のモデルを手早く試したい場合に便利です。
- ワンクリックで OpenAI 互換サーバーを構築
- DeveloperタブにはOpenAIプロトコルをサポートするエンドポイント http://localhost:1234/v1 が公開されています。openai-python、LangChain、Continue.devなどの任意のSDKが、コードを変更せずにこれを呼び出せます。
- システムインストール不要
- AppImageはユーザー空間で動作します。sudoも、パッケージのインストールも、サードパーティーのリポジトリも不要です。情報システム部門によって利用が制限されたマシンや、一般的でないディストリビューションでは、大きな利点です。
- GGUF形式にネイティブ対応
- LM Studio は GGUF フォーマット(llama.cpp が使用するフォーマット)のみを読み取ります。これは Ollama が内部で使用するフォーマットと同一であり、そのため人気モデルの 100 % が利用可能です。
#前提条件
LM StudioがLinux環境で動くようになったら、ローカルAIキットで次の段階に進めます。LM Studioの高度な設定(第5章)に加え、問題が起きたときには、動作が遅い、グラフィックスカードが使われない、モデルがすべて忘れてしまう、といった症状別の診断フローチャート(第14章)が役立ちます。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
- 比較的新しいLinuxディストリビューション
- Ubuntu 22.04以降、Fedora 38以降、Debian 12以降、Archまたはその派生版。LM Studio は主要なディストリビューションでテストされているが、AppImageはポータブルであり、他の環境(openSUSE、Linux Mint、Pop!_OS)でも動作する。
- glibc 2.35以上
- AppImageにはグラフィックス関連の依存ライブラリが同梱されていますが、glibcは含まれていません。非常に古いディストリビューション(CentOS 7、Debian 10)では動作しません。
- FUSE
- AppImage は FUSE を使って読み取り専用でマウントされます。ほとんどのディストリビューションではデフォルトでインストールされています。Ubuntu 22.04 以降では、libfuse2 パッケージを明示的にインストールする必要があります。
- 最低 8 GBのRAM
- 7BモデルをQ4で動かすための容量です。快適に使うなら16GB、14Bモデルを動かす場合や、IDEも同時に開いておく場合は32GB以上が目安です。
- GPU(オプションですが推奨)
- 比較的新しいドライバー(CUDA 12以降)を使用するNVIDIA GPU、ROCm 6.xを使用するAMD GPU、またはVulkan経由で使用するIntel Arcに対応しています。GPUがなくてもCPUで動作します。3Bモデルなら実用になりますが、7Bモデルでは遅くなります。
#1. AppImageを取得する
公式サイトは自動的に使用中のOSを検出し、適切なバージョンを提案します。lmstudio.aiからダウンロードしていることを確認してください。信頼できないミラーが存在します。
- 01.AppImageファイルをダウンロードしてくださいバイナリファイルのサイズは500~700MBです。llama.cpp、ElectronのUI、ランタイム全体が含まれています。慣例に従うなら ~/Applications/ または ~/.local/bin/ に保存してください。AppImageは自己完結型なので、実際にはどこに保存してもかまいません。
- 02実行可能にするchmod +x コマンドを使います。これを行わないと、ファイルは実行できない単なるアーカイブのままです。
- 03Lancez-leファイルマネージャーでダブルクリックするか、コマンドラインから起動してください。初回起動時には、LM Studioが内容を~/.cache/AppImage/に展開します。これは正常な動作で、以後は更新のたびにだけ行われます。
#2. 初回起動
初回起動時、LM Studioはインターフェースレベルの選択を求めます。User(チャットのみ)、Power User(チャット+設定)、Developer(サーバーを含むすべて)から選びます。機能を試すにはPower Userで十分です。後でローカルサーバーを使用する場合は、Settings → UI ModeからDeveloperに切り替えることができます。
左側のサイドバーには、各ビューが整理されています:
- Chat
- ChatGPTのようなメイン画面です。利用時間の90%はこの画面を使うことになります。
- Discover
- モデルストアです。Hugging Face を直接検索でき、検出された VRAM に基づくハードウェア互換性の目安(Full GPU Offload / Partial / Likely too large)が表示されます。
- My Models
- ダウンロード済みのすべてのモデルを、サイズと量子化形式とともに一覧できます。不要なモデルの整理に役立ちます。
- Developer
- OpenAIと互換性のあるローカルサーバー。Power UserまたはDeveloperモードでのみ表示されます。
#3. GGUFモデルをダウンロードする
LM StudioはGGUFフォーマット(llama.cppのバイナリ形式、GGMLの後継)のみを読み取ります。Hugging Faceにモデルが存在していても、GGUF形式がなければ直接読み込めません。人気のあるモデルのほとんど(Qwen 3.5、Gemma 4、Mistral、Granite 4.2、DeepSeek、gpt-oss)にはコミュニティが維持するGGUFバージョンが存在します。
- 01Discover を開き、モデルを検索する初めて試すなら、Qwen 3.5 9BまたはGranite 4.2 8Bと入力してください。どちらも、VRAM 6〜8 GBクラスで2026年の定番として安心して選べるモデルです。LM Studioには、利用可能なGGUFの各バリエーションが表示されます。これらは通常、bartowski、unsloth、lmstudio-communityが公開しています。
- 02互換性タグを確認してください各バリエーションの右側には、緑・オレンジ・赤のインジケーターがあります。「Full GPU Offload」は、モデル全体がVRAMに収まることを意味します。「Partial」は、一部がシステムRAMに配置されることを意味します(動作は遅くなります)。「Likely too large」の場合は、そのモデルの使用を見送ってください。
- 03量子化を選択してくださいQ4_K_Mは、ほとんどの場合に最適なバランスです(品質の低下が小さく、サイズはFP16の約50%)。VRAMに30〜40%多く余裕があるならQ5_K_Mを選びます。十分な空き容量があり、最高の品質を求めるならQ8_0を選びます。FP16を使うのは、ファインチューニングや比較の場合だけです。
- 04Downloadをクリック7Bモデルのダウンロードサイズは、量子化方式によって4〜8 GBです。ダウンロードはバックグラウンドで進むため、複数を同時に開始できます。
モデルのダウンロードが完了したら、Chatに戻り、上部のドロップダウンメニューからモデルを選択し、GPU offloadスライダーを表示される最大値に設定して、Load modelをクリックしてください。読み込みには、モデルのサイズとディスクの速度に応じて5〜30秒かかります。
#4. ローカルサーバーをポート1234で起動
ここに、LM Studio が単なるグラフィカルなチャット画面を超える機能があります。Developer タブでは、OpenAI の API とまったく同じプロトコルを使う HTTP サーバーを公開できます。どの OpenAI クライアント(openai-python、LangChain、LlamaIndex、Continue.dev)でも、ベース URL を変更するだけで、それ以外の変更なしに接続できます。
- 01Developerモードに切り替えるSettings → UI Mode → Developer。Developer タブ(ターミナルのアイコン)がサイドバーに表示されます。
- 02モデルを選択Developer タブ上部のメニューです。モデルはダウンロード済みである必要があります。VRAM 容量が足りれば、複数のモデルを同時に読み込めます。
- 03Context LengthとGPU Offloadを設定してくださいVRAMが許す範囲内でGPUオフロードを最大限に設定してください。デフォルトのコンテキスト長4096はほとんどの用途に十分ですが、RAGや長文処理の場合は8192または16384に設定してください。
- 04Start Serverをクリックしてくださいサーバーはデフォルトで127.0.0.1:1234で接続を待ち受けます。1234がすでに使用中の場合は、すぐ隣にある設定項目でポートを変更できます。
Python側では、公式のopenaiクライアントだけで十分です。APIキーは任意の文字列で構いません。LM Studioはその値を検証しません。
LAN上でサーバーを公開し、チームの他の端末からアクセスできるようにするには、サーバー設定のHostを127.0.0.1から0.0.0.0に変更してください。注意:LM Studioには標準の認証機能がありません。共有ネットワークでは、Basic認証を設定したCaddyまたはNginxをサーバーの前段に置くか、ファイアウォールでアクセスを制限してください。
#5. LinuxにおけるGPUアクセラレーション
Linux上でLM Studioの最もトリッキーなポイントです。AppImageはCPU、CUDA、ROCm、Vulkanの複数のバックエンドを内包しており、起動時に自動的に選択しますが、インストールされたドライバーによっては自動検出が誤りを起こすことがあります。
- NVIDIA (CUDA)
- バージョン535以降のプロプライエタリドライバーがインストールされていること(nvidia-smiが動作する必要があります)。CUDA 12.xはAppImageに同梱されているため、別途インストールする必要はありません。Settings → Hardwareで、GPUが一覧に表示され、バックエンドがCUDAになっていることを確認してください。
- AMD (ROCm)
- ホストにROCm 6.xドライバーがインストールされていること(Radeon RX 6800 XTとそれより新しいモデルは公式にサポートされています。RX 6700 XTとRX 7600も、HSA_OVERRIDE_GFX_VERSIONを使うと動作することが多いです)。使用するユーザーアカウントは、renderグループとvideoグループに属している必要があります。
- Intel Arc / iGPU
- Vulkanバックエンド。Arc A770/A750ではまずまずの性能ですが、NVIDIA/AMDには劣ります。vulkan-toolsをインストールし、vulkaninfoでGPUが検出されていることを確認してください。
- GPU なし
- 自動的にCPUにフォールバックします。Ryzen 7でGranite 4.2 8B Q4を動かす場合、速度の目安は5〜8トークン/秒です。Qwen 3.5 2BやGranite 4.2 3Bのような3Bモデルなら、十分に実用的です。14Bを超えると、待ち時間に耐えられるかが問題になります。
ChatまたはDeveloperのGPU offloadスライダーは、モデルの何層をGPUに読み込むかを制御します。VRAMが許す範囲で最大に設定してください。実際のメモリ使用量をターミナルで確認してください:
- モデルサイズごとのVRAMの参考値(Q4)
- 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB。この数値は、コンテキスト長が4096を超える場合にやや上昇します。
- GPU選びの目安
- RTX 3060 12GBなら7B〜14Bを余裕を持って動かせます。RTX 4070 12GBも同様で、さらに余裕があります。RTX 4080 16GBなら14BをQ5で動かせ、24Bにも手が届き始めます。RTX 4090 24GBなら32BをQ4、70BをQ3で動かせます。24〜48GBのユニファイドメモリを搭載したMac M4 Proでも、Apple Siliconで同様のことができますが、LM StudioのmacOS版を使います。
#よくある落とし穴
- AppImageが起動しない
- ターミナルから起動して、エラーメッセージを確認してください。最もよくある原因は、Ubuntu 22.04以降でlibfuse2がインストールされていないことです(sudo apt install libfuse2で解決できます)。次に多いのは、glibcが古すぎることです(LM Studioには2.35以上が必要なため、CentOS 7やDebian 10では動作しません)。
- GPUが使用されていません
- nvidia-smi(またはrocm-smi)を確認してください。GPUが表示されない場合は、ドライバーがインストールされていないか、古すぎます。GPUが表示されているのにLM StudioがCPUを使い続ける場合は、Settings → Hardwareでバックエンド(CUDA/ROCm/Vulkan)を指定できます。AMDの場合、ユーザーはrenderとvideoの両グループに所属している必要があります。usermodの実行後にログアウトし、再ログインしてください。
- GPUを活用してもモデルが遅い
- VRAMがいっぱいになり、通知なしに一部がオフロードされています。コンテキスト長を短くするか、GPU offloadスライダーを下げてしきい値を測定するか、ビット数をさらに減らした量子化(Q5 → Q4 → Q3)を選んでください。
- ポート1234が既に使用中です
- 別の開発用サービスがそのポートを使用していることがよくあります。Developer → Settingsでポートを変更するか、プロセスを終了してください:ss -tulpn | grep 1234。localhostで使う場合、ファイアウォールを変更する必要はありません。
- 動作を壊す自動更新
- LM Studioはデフォルトで自動更新されます。管理された環境(企業やCI/CD統合環境)では、Settings → Updatesから自動更新を無効にしてください。必要に応じて以前のバージョンに戻せるように、正常に動作するバージョンの番号を記録してください。
- CLIでの自動補完がありません
- AppImage版は、高機能なCLIを提供していません。本格的にスクリプトを組むなら、サーバーのHTTP API(ポート1234)を使うのが適切な方法です。本格的なCLIが必要なら、llama.cppやOllamaのほうが適しています。
#さらに詳しく
LM Studioのインストールが済み、GGUFが読み込まれ、OpenAI互換サーバーが稼働しています。次に進むなら、以下の選択肢が自然です。
- APIサーバーをさらに使いこなす
- 「LM StudioをAPIサーバーにする」ガイドでは、ストリーミング、複数モデルの並列実行、安全なLANへの公開、パフォーマンス調整について詳しく説明しています。
- Linux上でOllamaと比較する
- 「LinuxにOllamaをインストールする」ガイドでは、デーモン/サーバーとしての利用を重視した、もう一つの人気のソフトウェア構成を解説しています。多くの方にとって、Ollama(デーモン)と、その上でクライアントインターフェースとして使うLM Studioの組み合わせが理想的です。
- 適切な量子化の選択
- 「量子化の選び方(Q4、Q5、Q8、FP16)」ガイドでは、実際の品質低下を視覚的に比較し、品質と VRAM 使用量のバランスを判断する手助けをします。特に、GGUF ファイルを自分でダウンロードする場合に役立ちます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。