テキスト生成WebUI (oobabooga)
oobaboogaは、現在TextGenという名称になっているText Generation WebUIの開発者のハンドルネームです。TextGenは、テレメトリなしで言語モデルをローカル実行するためのオープンソースのインターフェースです(AGPL-3.0、GitHubで約47,000スター)。GGUFモデル向けには、デスクトップアプリのように使えるポータブル版をダウンロードできます。完全版をインストールすると、ほかのエンジン、LoRAの学習、拡張機能が追加されます。公式情報源:GitHubリポジトリ oobabooga/textgen。
Text Generation WebUI に関する多くのチュートリアルは、2 年前のバージョンを説明しています。エンジンが削除され、拡張機能が置き換えられ、コマンドも変更されています。本ガイドは、現在のリポジトリに基づいて内容を再構成しています。新しい名称、3 つのインストール方法、実際にサポートされているエンジン、拡張機能、API、そしてインターフェースを他者に公開する前に知っておくべきセキュリティ設定について解説します。
#oobabooga、Text Generation WebUI、TextGenとは?
oobaboogaは、このプロジェクトの開発者がGitHubで使っているハンドルネームです。このツールは長年Text Generation WebUIと呼ばれていましたが、現在はTextGenという名前で紹介されています。以前のリポジトリのアドレスは github.com/oobabooga/textgen にリダイレクトされます。AGPL-3.0ライセンスのオープンソースアプリケーションで、チャット、自由な生成、画像認識、ツール呼び出し、OpenAI互換API、LoRAの学習をまとめて提供します。リポジトリでは、完全にオフラインかつプライベートに利用でき、テレメトリも外部リソースもなく、リモートへの更新リクエストも送信しないと説明されています。
プロジェクトは活動中です。私たちが確認した最新バージョンは4.9で、2026年5月にリリースされました。私たちの知る限り、このGitHubリポジトリ以外の公式サイトは存在しません。第三者のダウンロードサイトや、このリポジトリを置き換えると主張するフォークサイトには注意してください。悪意のある実行ファイルが、あなたの権限で実行される可能性があります。
#1. インストール:ポータブル、ワンクリック、または手動
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
リポジトリには3つの方法が提案されています。ポータブル版が最もシンプルで、すべての依存関係が含まれており、ダブルクリックで起動でき、GGUFモデルのみを読み込みます(llama.cppエンジン)。Linux、Windows、macOS向けに提供されており、CUDA、Vulkan、ROCm、CPUのみのバリエーションがあります。他のエンジン、トレーニング、画像生成、拡張機能には完全なインストールが必要で、PyTorchをダウンロードし、約10 GBのディスク容量を必要とします。
| モード | 得られるもの | 知っておくべきこと |
|---|---|---|
| ポータブル版(デスクトップアプリ) | GGUF を llama.cpp で利用可能、すべてが含まれています | 最もシンプル。拡張機能や他のエンジンは含まれません |
| ワンクリックインストーラー(start_スクリプト) | 完全インストール:ExLlamaV3、Transformers、トレーニング、拡張機能 | 約10 GB。インストール時にGPUのメーカーを選択 |
| venvまたはCondaを使った手動インストール | Python環境の完全な制御 | 開発者向け;特殊なケースに限定してご利用ください |
- 01ポータブル版をダウンロードリポジトリのリリースページから、お使いのシステムと GPU に対応したアーカイブを選んでください。NVIDIA の場合、nvidia-smi が表示する CUDA のバージョンが 13.1 以上なら cuda13.1 ビルドを、それ以外なら cuda12.4 ビルドを選びます。AMD と Intel は Vulkan を使用し、AMD は ROCm も使用できます。CPU のみで動作するバージョンもあります。
- 02解凍して起動するアーカイブを解凍してから、textgenをダブルクリックしてください。ウィンドウが開きます。
- 03macOSでは隔離属性を解除リリースノートの指示に従い、初回起動前に、xattr -crの後ろに展開したフォルダのパスを指定して実行してください。
- 04モデルの追加GGUF ファイルを user_data/models フォルダに配置してください。インターフェースが自動的に検出します。
- 05読み込みとチャットモデルタブからモデルを選択し、チャットを開きます。
ポータブル版は、モデルや設定を失わずに更新できます。新しいアーカイブをダウンロードして展開し、その中のuser_dataフォルダを、以前のインストールにあるuser_dataフォルダで置き換えてください。バージョン4.0以降では、user_dataをインストールフォルダ群の一つ上の階層に置くこともでき、その場合は自動的に検出されます。
完全なインストールを行うには、リポジトリをクローンし、お使いのシステムに対応するスクリプトを実行してください。スクリプトは GPU のメーカーを尋ね、依存関係をローカルフォルダーにインストールします。その後、ブラウザで http://127.0.0.1:7860 を開いてください。
すべてがローカルの installer_files フォルダに格納されます。ゼロから再インストールするには、このフォルダを削除してスクリプトを再実行してください。オプションを恒久的に適用するには、user_data/CMD_FLAGS.txt に記述してください。たとえば、API を有効にするには --api を記述します。これらのスクリプトはいずれも管理者権限を必要としません。
#2. モデルをダウンロードして選択
リポジトリの使い方は、3つの文で説明できます。Hugging FaceからGGUFファイルをダウンロードし、user_data/modelsに置くと、インターフェースが検出します。複数のファイルで構成されるモデル(16ビットのTransformers、EXL3)は、同じディレクトリ内のサブフォルダに置きます。これらには、ポータブル版ではなくフルインストール版が必要です。
実用上の判断基準はメモリ容量だけです。当サイトの目安では、Q4量子化したモデルの重みだけで、3Bは約2 GB、7〜8Bは約5 GB、14Bは約9 GB、32Bは約19〜20 GB、70Bは約40 GBです。これにコンテキストキャッシュと、システム用の余裕を加えてください。当サイトのVRAM計算ツールで、使用するコンテキストに必要な合計容量を正確に算出できます。
#コンテキストとキャッシュ:メモリを節約する二つのオプション
2つの起動オプションがメモリ使用量に直接影響します。--ctx-sizeはコンテキストサイズをトークン単位で設定します。llama.cppでは、すべてのレイヤーをGPUに配置する場合(--gpu-layers=-1)、値0は自動設定を意味します。他のエンジンでは、デフォルト値は8,192です。--cache-typeはコンテキストキャッシュの形式を指定します。llama.cppで有効な値はfp16、q8_0、q4_0です。量子化キャッシュはfp16キャッシュより少ないメモリで済む一方、精度がわずかに低下します。メモリが足りない場合は、モデルサイズを小さくする前に、まずq8_0を試してください。
リポジトリには、この選択の参考になるコミュニティ製のツールが2つ紹介されています。GGUFモデル用のメモリ計算ツールと、推奨される量子化の一覧です。このサイトの計算ツールでそれらの結果を確認し、その後、長い会話中にGPUの実際のメモリ使用量を監視してください。
#3. エンジン(ローダー)を選ぶ
TextGen はモデルをローダーと呼ばれるエンジンで読み込みます。デフォルトでは自動検出を行いますが、--loader オプションで強制的に設定できます。現在サポートされている値は Transformers、llama.cpp、ExLlamav3_HF、ExLlamav3 および TensorRT-LLM です。エンジンやモデルの変更は再起動なしで行えます。
| エンジン | モデルフォーマット | 用途 |
|---|---|---|
| llama.cpp | GGUF | デフォルトの選択:CPUおよびGPU、ポータブル版の唯一のエンジン |
| ik_llama.cpp | GGUF | llama.cpp のバリエーションで、追加のバックエンドとしてリストされています |
| ExLlamaV3 | EXL3 | フルインストール構成でのGPU向け量子化 |
| Transformers | 16ビットモデル、safetensors | 汎用性が高く、メモリ消費量が多い。学習にも使えます |
| TensorRT-LLM | NVIDIA 用にコンパイルされたモデル | NVIDIA GPU向けのフルインストール |
初めて使う方は、llama.cppとGGUF形式を使い続けるのがよいでしょう。これが最も手早い方法で、ポータブル版でも、ほかのツール(Ollama、LM Studio)でも採用されています。ほかのエンジンを選ぶ理由になるのは、特定の形式への対応、ファインチューニング、NVIDIAカードの性能を最大限に引き出すことなど、明確な必要性がある場合です。
#4. Chat、instruct、notebook、vision
- Instruct
- ChatGPTのように指示に従うモードです。プロンプトはJinja2テンプレートを使って自動的に整形されます。
- 「Chat-instruct」と「chat」
- カスタムキャラクターとの会話を行うために
- Notebook
- チャットのやり取りとは別に、自由に文章を生成できるタブです。文章を入力すると、モデルがその続きを生成します。
- 視覚処理とファイル処理
- メッセージに画像やテキストファイル、PDF、.docxファイルを添付できます。これらのファイルの内容について議論できます。
- 編集とブランチ
- メッセージを編集し、その各バージョンを切り替え、会話の任意の時点から分岐を作成する。
モデルは会話中に、ウェブ検索、ページの取得、計算といったツールを呼び出すこともできます。各ツールはシンプルなPythonファイルで、MCPサーバーにも対応しています。この機能はコンテキストの長さとも関係します。ツールを呼び出すエージェントは短いコンテキストウィンドウをすぐに使い切るため、--ctx-sizeオプションでコンテキストサイズを増やすことを検討してください。
#5. 拡張機能:実際に存在するもの
拡張機能は完全なインストールと併用する場合にのみ動作します。リポジトリの拡張機能フォルダには、coqui_tts、silero_tts(音声合成)、whisper_stt(音声入力)、sd_api_picturesおよびsend_pictures(画像)、google_translate、superboogaおよびsuperboogav2、ngrok、gallery、perplexity_colorsなどが含まれます。READMEでは、さらにコミュニティによる拡張機能も存在すると記載されています。
#6. APIモード
オプションに --api を追加してAPIを起動してください。リポジトリのWikiによると、デフォルトのポートは5000で、--api-port で変更できます。外部に公開するよう明示的に指定しない限り、APIへのアクセスはローカルに限定されます。Wikiには、このAPIはオフラインで動作し、OpenAIに接続せず、ログも一切作成しないと記載されています。エンドポイントはチャット、テキスト補完、Anthropic形式のメッセージに対応し、ツール呼び出しも利用できます。
接続先をこのアドレスに設定すれば、任意のOpenAIクライアント(チャットのフロントエンド、コードエージェント、LangChain)を接続できます。すべてのエンドポイントの対話式ドキュメントは、同じアドレスの/docsで提供されています。
#他の人にもインターフェースを公開する:知っておきたいオプション
デフォルトでは、インターフェースはローカルマシンからのみアクセス可能です。この設定を変更するオプションが三つあります。--listen はインターフェースをローカルネットワークからアクセス可能にします。--share はパブリックアドレスを作成しますが、一時的なテスト以外では避けるべきです。また、--multi-user はチャット履歴を保存しません。リポジトリでは、これを信頼できる小規模チーム向けとしており、エンタープライズソリューションとしては位置付けていません。
APIをネットワーク経由で受け付ける場合は、その時点で任意のキーを指定した--api-keyを追加してください。キーがなければ、そのポートに接続できるすべてのデバイスがモデルに問い合わせできます。アカウント、ロール、ログ記録を備えた本格的なチーム利用には、推論エンジンの手前に専用のフロントエンドを配置するほうが適しています。
#TextGenとOllama・LM Studioの比較
| ニーズ | TextGen | Ollama または LM Studio |
|---|---|---|
| GGUFですぐに始める | ポータブル版も手軽です | Ollama:コマンド1つ。LM Studio:操作を案内するインターフェース |
| 複数のエンジンとフォーマットをテストする | はい。この点が強みです。 | GGUFに重点を置く |
| インターフェース上でLoRAをファインチューニングする | はい、完全インストールの場合です | いいえ |
| チームの利用をサポート | あまり適していない(マルチユーザー制限あり) | Open WebUIまたはLibreChatのバックエンドとして動作するOllama |
| 日常的に快適に使えること | 設定も操作も多い | より簡単なメンテナンスが可能 |
まとめると、TextGenはモデルを試したり細かく調整したりするためのツールで、初心者が日常的に使うためのものではありません。まずモデルと会話したいなら、OllamaまたはLM Studioから始めてください。他のツールにはないエンジン、形式、または学習機能が必要になったときに、TextGenに戻ってきてください。
- Ollama vs LM Studio vs Jan vs GPT4All
- 出典:TextGen(oobabooga)のリポジトリ
- 出典:バージョン 4.9 のリリースノート
- 出典:Wiki、OpenAI互換API
oobabooga と Text Generation WebUI は同じものでしょうか?+
2026年にText Generation WebUIをインストールする方法は?+
どの推論エンジンと形式がサポートされていますか?+
本当にオフラインで、テレメトリもありませんか?+
他のツールと接続するためのAPIを有効にする方法は?+
TextGenをOllamaよりも優先すべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。