中級 11 分その他のツール

テキスト生成WebUI (oobabooga)

端的な回答

oobaboogaは、現在TextGenという名称になっているText Generation WebUIの開発者のハンドルネームです。TextGenは、テレメトリなしで言語モデルをローカル実行するためのオープンソースのインターフェースです(AGPL-3.0、GitHubで約47,000スター)。GGUFモデル向けには、デスクトップアプリのように使えるポータブル版をダウンロードできます。完全版をインストールすると、ほかのエンジン、LoRAの学習、拡張機能が追加されます。公式情報源:GitHubリポジトリ oobabooga/textgen。

Text Generation WebUI に関する多くのチュートリアルは、2 年前のバージョンを説明しています。エンジンが削除され、拡張機能が置き換えられ、コマンドも変更されています。本ガイドは、現在のリポジトリに基づいて内容を再構成しています。新しい名称、3 つのインストール方法、実際にサポートされているエンジン、拡張機能、API、そしてインターフェースを他者に公開する前に知っておくべきセキュリティ設定について解説します。

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み

#oobabooga、Text Generation WebUI、TextGenとは?

oobaboogaは、このプロジェクトの開発者がGitHubで使っているハンドルネームです。このツールは長年Text Generation WebUIと呼ばれていましたが、現在はTextGenという名前で紹介されています。以前のリポジトリのアドレスは github.com/oobabooga/textgen にリダイレクトされます。AGPL-3.0ライセンスのオープンソースアプリケーションで、チャット、自由な生成、画像認識、ツール呼び出し、OpenAI互換API、LoRAの学習をまとめて提供します。リポジトリでは、完全にオフラインかつプライベートに利用でき、テレメトリも外部リソースもなく、リモートへの更新リクエストも送信しないと説明されています。

プロジェクトは活動中です。私たちが確認した最新バージョンは4.9で、2026年5月にリリースされました。私たちの知る限り、このGitHubリポジトリ以外の公式サイトは存在しません。第三者のダウンロードサイトや、このリポジトリを置き換えると主張するフォークサイトには注意してください。悪意のある実行ファイルが、あなたの権限で実行される可能性があります。

i
古いチュートリアルで迷ってしまう理由
現在のREADMEには、llama.cpp、ik_llama.cpp、Transformers、ExLlamaV3、TensorRT-LLMの5つのエンジンが記載されています。古いガイド(このガイドの初版を含む)でよく挙げられているExLlamaV2、AWQ形式とGPTQ形式、vLLMは、現在は記載されていません。チュートリアルの日付は必ず確認してください。

#1. インストール:ポータブル、ワンクリック、または手動

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

リポジトリには3つの方法が提案されています。ポータブル版が最もシンプルで、すべての依存関係が含まれており、ダブルクリックで起動でき、GGUFモデルのみを読み込みます(llama.cppエンジン)。Linux、Windows、macOS向けに提供されており、CUDA、Vulkan、ROCm、CPUのみのバリエーションがあります。他のエンジン、トレーニング、画像生成、拡張機能には完全なインストールが必要で、PyTorchをダウンロードし、約10 GBのディスク容量を必要とします。

インストールモードの選択
モード得られるもの知っておくべきこと
ポータブル版(デスクトップアプリ)GGUF を llama.cpp で利用可能、すべてが含まれています最もシンプル。拡張機能や他のエンジンは含まれません
ワンクリックインストーラー(start_スクリプト)完全インストール:ExLlamaV3、Transformers、トレーニング、拡張機能約10 GB。インストール時にGPUのメーカーを選択
venvまたはCondaを使った手動インストールPython環境の完全な制御開発者向け;特殊なケースに限定してご利用ください
  1. 01
    ポータブル版をダウンロード
    リポジトリのリリースページから、お使いのシステムと GPU に対応したアーカイブを選んでください。NVIDIA の場合、nvidia-smi が表示する CUDA のバージョンが 13.1 以上なら cuda13.1 ビルドを、それ以外なら cuda12.4 ビルドを選びます。AMD と Intel は Vulkan を使用し、AMD は ROCm も使用できます。CPU のみで動作するバージョンもあります。
  2. 02
    解凍して起動する
    アーカイブを解凍してから、textgenをダブルクリックしてください。ウィンドウが開きます。
  3. 03
    macOSでは隔離属性を解除
    リリースノートの指示に従い、初回起動前に、xattr -crの後ろに展開したフォルダのパスを指定して実行してください。
  4. 04
    モデルの追加
    GGUF ファイルを user_data/models フォルダに配置してください。インターフェースが自動的に検出します。
  5. 05
    読み込みとチャット
    モデルタブからモデルを選択し、チャットを開きます。

ポータブル版は、モデルや設定を失わずに更新できます。新しいアーカイブをダウンロードして展開し、その中のuser_dataフォルダを、以前のインストールにあるuser_dataフォルダで置き換えてください。バージョン4.0以降では、user_dataをインストールフォルダ群の一つ上の階層に置くこともでき、その場合は自動的に検出されます。

完全なインストールを行うには、リポジトリをクローンし、お使いのシステムに対応するスクリプトを実行してください。スクリプトは GPU のメーカーを尋ね、依存関係をローカルフォルダーにインストールします。その後、ブラウザで http://127.0.0.1:7860 を開いてください。

ワンクリックインストーラーによる完全インストール(Linux;macOSおよびWindows:start_macos.sh、start_windows.bat)
git clone https://github.com/oobabooga/textgen
cd textgen
./start_linux.sh

すべてがローカルの installer_files フォルダに格納されます。ゼロから再インストールするには、このフォルダを削除してスクリプトを再実行してください。オプションを恒久的に適用するには、user_data/CMD_FLAGS.txt に記述してください。たとえば、API を有効にするには --api を記述します。これらのスクリプトはいずれも管理者権限を必要としません。

#2. モデルをダウンロードして選択

リポジトリの使い方は、3つの文で説明できます。Hugging FaceからGGUFファイルをダウンロードし、user_data/modelsに置くと、インターフェースが検出します。複数のファイルで構成されるモデル(16ビットのTransformers、EXL3)は、同じディレクトリ内のサブフォルダに置きます。これらには、ポータブル版ではなくフルインストール版が必要です。

実用上の判断基準はメモリ容量だけです。当サイトの目安では、Q4量子化したモデルの重みだけで、3Bは約2 GB、7〜8Bは約5 GB、14Bは約9 GB、32Bは約19〜20 GB、70Bは約40 GBです。これにコンテキストキャッシュと、システム用の余裕を加えてください。当サイトのVRAM計算ツールで、使用するコンテキストに必要な合計容量を正確に算出できます。

#コンテキストとキャッシュ:メモリを節約する二つのオプション

2つの起動オプションがメモリ使用量に直接影響します。--ctx-sizeはコンテキストサイズをトークン単位で設定します。llama.cppでは、すべてのレイヤーをGPUに配置する場合(--gpu-layers=-1)、値0は自動設定を意味します。他のエンジンでは、デフォルト値は8,192です。--cache-typeはコンテキストキャッシュの形式を指定します。llama.cppで有効な値はfp16、q8_0、q4_0です。量子化キャッシュはfp16キャッシュより少ないメモリで済む一方、精度がわずかに低下します。メモリが足りない場合は、モデルサイズを小さくする前に、まずq8_0を試してください。

リポジトリには、この選択の参考になるコミュニティ製のツールが2つ紹介されています。GGUFモデル用のメモリ計算ツールと、推奨される量子化の一覧です。このサイトの計算ツールでそれらの結果を確認し、その後、長い会話中にGPUの実際のメモリ使用量を監視してください。

#3. エンジン(ローダー)を選ぶ

TextGen はモデルをローダーと呼ばれるエンジンで読み込みます。デフォルトでは自動検出を行いますが、--loader オプションで強制的に設定できます。現在サポートされている値は Transformers、llama.cpp、ExLlamav3_HF、ExLlamav3 および TensorRT-LLM です。エンジンやモデルの変更は再起動なしで行えます。

現在のREADMEに含まれるエンジン
エンジンモデルフォーマット用途
llama.cppGGUFデフォルトの選択:CPUおよびGPU、ポータブル版の唯一のエンジン
ik_llama.cppGGUFllama.cpp のバリエーションで、追加のバックエンドとしてリストされています
ExLlamaV3EXL3フルインストール構成でのGPU向け量子化
Transformers16ビットモデル、safetensors汎用性が高く、メモリ消費量が多い。学習にも使えます
TensorRT-LLMNVIDIA 用にコンパイルされたモデルNVIDIA GPU向けのフルインストール

初めて使う方は、llama.cppとGGUF形式を使い続けるのがよいでしょう。これが最も手早い方法で、ポータブル版でも、ほかのツール(Ollama、LM Studio)でも採用されています。ほかのエンジンを選ぶ理由になるのは、特定の形式への対応、ファインチューニング、NVIDIAカードの性能を最大限に引き出すことなど、明確な必要性がある場合です。

#4. Chat、instruct、notebook、vision

Instruct
ChatGPTのように指示に従うモードです。プロンプトはJinja2テンプレートを使って自動的に整形されます。
「Chat-instruct」と「chat」
カスタムキャラクターとの会話を行うために
Notebook
チャットのやり取りとは別に、自由に文章を生成できるタブです。文章を入力すると、モデルがその続きを生成します。
視覚処理とファイル処理
メッセージに画像やテキストファイル、PDF、.docxファイルを添付できます。これらのファイルの内容について議論できます。
編集とブランチ
メッセージを編集し、その各バージョンを切り替え、会話の任意の時点から分岐を作成する。

モデルは会話中に、ウェブ検索、ページの取得、計算といったツールを呼び出すこともできます。各ツールはシンプルなPythonファイルで、MCPサーバーにも対応しています。この機能はコンテキストの長さとも関係します。ツールを呼び出すエージェントは短いコンテキストウィンドウをすぐに使い切るため、--ctx-sizeオプションでコンテキストサイズを増やすことを検討してください。

#5. 拡張機能:実際に存在するもの

拡張機能は完全なインストールと併用する場合にのみ動作します。リポジトリの拡張機能フォルダには、coqui_tts、silero_tts(音声合成)、whisper_stt(音声入力)、sd_api_picturesおよびsend_pictures(画像)、google_translate、superboogaおよびsuperboogav2、ngrok、gallery、perplexity_colorsなどが含まれます。READMEでは、さらにコミュニティによる拡張機能も存在すると記載されています。

→
「openai」拡張機能はもう不要
OpenAIおよびAnthropicと互換性のあるAPIは、現在では組み込まれています。--apiを追加するだけで使えます。openai拡張機能を有効にするよう求めるチュートリアルは、以前の仕組みを説明しています。

#6. APIモード

オプションに --api を追加してAPIを起動してください。リポジトリのWikiによると、デフォルトのポートは5000で、--api-port で変更できます。外部に公開するよう明示的に指定しない限り、APIへのアクセスはローカルに限定されます。Wikiには、このAPIはオフラインで動作し、OpenAIに接続せず、ログも一切作成しないと記載されています。エンドポイントはチャット、テキスト補完、Anthropic形式のメッセージに対応し、ツール呼び出しも利用できます。

ローカルAPIへのリクエスト(公式Wikiの例)
curl http://127.0.0.1:5000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.6
  }'

接続先をこのアドレスに設定すれば、任意のOpenAIクライアント(チャットのフロントエンド、コードエージェント、LangChain)を接続できます。すべてのエンドポイントの対話式ドキュメントは、同じアドレスの/docsで提供されています。

#他の人にもインターフェースを公開する:知っておきたいオプション

デフォルトでは、インターフェースはローカルマシンからのみアクセス可能です。この設定を変更するオプションが三つあります。--listen はインターフェースをローカルネットワークからアクセス可能にします。--share はパブリックアドレスを作成しますが、一時的なテスト以外では避けるべきです。また、--multi-user はチャット履歴を保存しません。リポジトリでは、これを信頼できる小規模チーム向けとしており、エンタープライズソリューションとしては位置付けていません。

APIをネットワーク経由で受け付ける場合は、その時点で任意のキーを指定した--api-keyを追加してください。キーがなければ、そのポートに接続できるすべてのデバイスがモデルに問い合わせできます。アカウント、ロール、ログ記録を備えた本格的なチーム利用には、推論エンジンの手前に専用のフロントエンドを配置するほうが適しています。

#TextGenとOllama・LM Studioの比較

どのようなツールがどのようなニーズに適するか
ニーズTextGenOllama または LM Studio
GGUFですぐに始めるポータブル版も手軽ですOllama:コマンド1つ。LM Studio:操作を案内するインターフェース
複数のエンジンとフォーマットをテストするはい。この点が強みです。GGUFに重点を置く
インターフェース上でLoRAをファインチューニングするはい、完全インストールの場合ですいいえ
チームの利用をサポートあまり適していない(マルチユーザー制限あり)Open WebUIまたはLibreChatのバックエンドとして動作するOllama
日常的に快適に使えること設定も操作も多いより簡単なメンテナンスが可能

まとめると、TextGenはモデルを試したり細かく調整したりするためのツールで、初心者が日常的に使うためのものではありません。まずモデルと会話したいなら、OllamaまたはLM Studioから始めてください。他のツールにはないエンジン、形式、または学習機能が必要になったときに、TextGenに戻ってきてください。

よくある質問
oobabooga と Text Generation WebUI は同じものでしょうか?+
はい。oobabooga は開発者のペンネームであり、Text Generation WebUI はプロジェクトの過去の名前で、現在は TextGen と表現されています。以前の GitHub アドレスは github.com/oobabooga/textgen にリダイレクトしています。私たちが知っている唯一の公式ソースです:第三者のダウンロードサイトは避けてください。実行する前にURLを確認してください。
2026年にText Generation WebUIをインストールする方法は?+
最も簡単なのは、リポジトリのリリースからダウンロードできるポータブル版です。そのまま使えますが、対応するモデルはGGUF形式に限られます。他のエンジン、学習、拡張機能を使う場合は、約10 GBのディスク容量を確保したうえで、リポジトリをクローンし、start_windows.bat、start_linux.sh、またはstart_macos.shを実行してください。
どの推論エンジンと形式がサポートされていますか?+
現在のREADMEには、llama.cpp、ik_llama.cpp、Transformers、ExLlamaV3、TensorRT-LLMが記載されています。GGUF形式のモデルはllama.cppで処理され、ポータブル版のエンジンはこれだけです。古いチュートリアルで紹介されているExLlamaV2、AWQ、GPTQ、vLLMは、現在のREADMEには記載されていません。これらに言及するガイドに従う前に、ドキュメントを確認してください。
本当にオフラインで、テレメトリもありませんか?+
リポジトリでは、テレメトリ、外部リソース、更新リクエストなしで、100%オフラインかつプライベートに動作すると説明されています。Wikiでは、APIがOpenAIに接続せず、ログも作成しないと明記されています。一方、ウェブ検索機能はその性質上インターネットにアクセスします。完全にローカルで使用するには、これらの機能を無効にしてください。
他のツールと接続するためのAPIを有効にする方法は?+
コマンドラインに --api を追加するか、user_data/CMD_FLAGS.txt に記載してください。デフォルトのポートは 5000 で、--api-port で変更できます。アドレスは http://127.0.0.1:5000/v1 です。ネットワーク経由の接続を受け付ける場合は、--api-key を追加してキーを必須にしてください。そうしないと、そのポートにアクセスできるすべてのデバイスが利用できてしまいます。
TextGenをOllamaよりも優先すべきですか?+
使い始める段階では、その必要はありません。OllamaとLM Studioのほうが日常的に使いやすく、理解する必要のあるオプションも少ないからです。TextGenを選ぶ理由があるのは、複数のエンジンや形式を試したい場合、インターフェース上でLoRAを学習させたい場合、あるいは生成を細かく調整したい場合です。日常的な利用にはOllamaを使い、新しい設定や機能を試すときにはTextGenを使うという併用がよく見られます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。