ESNのITテクニカルサポートに最適なLLM
ローカルで動作するITサポート用AIの導入は、ITサービス企業(ESN)が抱える具体的な制約に対応します。チケット、ログ、ランブックには、守秘義務条項の対象となる顧客データが含まれています。ローカルで動作するITサポート用AIなら、これらの情報はご自身で管理するマシン内にとどまり、各回答を情報源に紐づけることができます。
このページでは、社内ITサポートのみを扱います。具体的には、技術的な問い合わせチケットの分類・評価、機密情報などを除去したログの確認、ランブックの検索、追跡可能性の確保、エスカレーションです。商取引、返金、カスタマーサポートの翻訳については、次のガイドで扱っています: ローカルLLMを使った多言語カスタマーサポート.
構成:選定基準、モデルの選定、量子化形式ごとのメモリ使用量、スループットとベンチマーク、ライセンス、最後にデプロイの流れ。
ESNのITサポートがモデルに対して求める要件
社内サポートで求められる特性は、汎用アシスタントとは異なります。重要なのは次の4つの基準です。
- コンテキストウィンドウ : ログの抜粋、運用手順書(runbook)、チケットの履歴は30,000トークンをすぐに超えます。4,096トークンに制限されたモデル(Snowflake Arctic Instruct)または 8,192 tokens(Grok-1 (base))は、この用途では候補から除外されます。
- 構造化出力 :モデルは、チケット管理ツールが処理できる安定したJSON(カテゴリ、重大度、担当チーム)を生成する必要があります。
- ソースへの忠実度 :回答には、根拠として使用したランブックまたはログの行を明示する必要があります。そうしないと、トレーサビリティが失われます。
- ライセンス :モデルは料金を請求するサービスの一環として実行されることが多いため、商用利用に該当します。
選定:Q4 で 68 GB から 85 GB の 7 つのモデル
以下のモデルは、このページの参照カタログの中で最も軽量なモデルです。いずれも大容量メモリを備えたサーバーまたはワークステーションが必要で、技術者が使う通常のPCでは足りません。
- Mistral Small 4 :119B、Apache 2.0、Q4で約72 GB、コンテキストは256,000。制約の少ないライセンスと大きなコンテキストにより、標準の第一候補です。モデルの重みの掲載先: Mistral の Hugging Face ページ.
- Qwen 3.5 122B-A10B :122B、Apache 2.0、Q4で約73 GB、コンテキスト262,000。接尾辞A10Bは、トークンあたり約100億のパラメータが有効になることを示し、生成速度の向上に寄与します。参照先: Hugging Face 上の Alibaba.
- Nemotron 3 Super 120B :120B、NVIDIA Open Model License、Q4で約72 GB、コンテキストは128,000。すでにNVIDIA製品を備えたインフラに適しています(Hugging Face上のNVIDIA).
- Laguna S 2.1 :118B、OpenMDW 1.1、Q4で約68GB、コンテキスト長262,144。この選定の中で最も軽量で、コード向けのモデルです。スクリプトやパイプラインに関するチケット対応に役立ちます。
- Qwen3.8 Flash Next 125B-A6B :125B、ライセンス「その他(オープンウェイト)」、Q4で約72GB、コンテキスト256,000。顧客先で使用する前に、必ずライセンスを確認してください。
- Mistral Medium 3.5 128B : 128B、Modified MIT、Q4で約74GB、コンテキスト長256 000。
- Mixtral 8x22B Instruct :141B、Apache 2.0、Q4で約82GB、コンテキスト長64,000。コンテキストは短めですが、チケットとランブックには十分です。長いログの抜粋には余裕がありません。
次の2つのモデルは、コンテキスト長が32,768トークンに限られています: dots.llm1 Instruct (142B、MIT、~85GB) および DBRX Instruct (132B、Databricks Open Model License、約76 GB)。これらのモデルはチケットの分類に適していますが、ログの分析にはそれほど向いていません。
より多くのメモリを利用できるチームには、 Step 3.5 Flash (196B, Apache 2.0, ~118 GB) および MiniMax-M2.7 (229B、Apache 2.0、約138 GB)が次の段階となります。
量子化方式・ハードウェア別のメモリ
カタログに基づくのはQ4の値だけです。他の量子化レベルの値は、比例則で推定したおおよその目安であり、各モデルの詳細ページで確認する必要があります。
118B〜128Bクラスの場合:
- Q4 : 68から74GB(カタログ情報)
- Q5 : ~82 から 90 GB(推定値)
- Q8 : 約120〜135GB(推定)
- FP16 : 約236〜256GB(推定値)
Mixtral 8x22B Instruct(141B)の場合:
- Q4 : 約82GB(カタログ)
- Q5 : ~97 GB(推定値)
- Q8 : 約150GB(推定値)
- FP16 :約282GB(推定)
これらの数字にはコンテキストが含まれていません。ログの100,000トークンを読み込むことで、複数GBのキャッシュが追加されます。少なくとも15%〜20%の余裕を確保してください(推定値)
ハードウェア側では、72GBのQ4は96GBの統合メモリのマシンでわずかな余裕で動作し、128GBのマシンではより快適に利用できます。ページ Mac 96 GB et Mac 128 GB これらの設定については詳しく説明しています。PCでは複数のグラフィックスカードを組み合わせる必要があります:ガイドを参照ください LLMのローカルデプロイメントに適したGPUを選択する.
スループットとベンチマーク:まだ確認が必要な点
これらの7つのモデルについて、測定されたスループットはここでは公開されていません:tokens/secはご自身のハードウェアで確認してください。2つの定性的な目安:
- MoE アーキテクチャ :同じサイズであれば、アクティブなパラメータ数が少ないモデル(A6B、A10B)は、トークンあたりに読み込むデータ量が少なく、デンスモデルよりも高速に生成できます。
- 同時実行 : サポートチームが複数の同時リクエストを送信します。サーバーのように vLLM はリクエストをバッチ処理して全体のスループットを向上させます。一方、 llama.cpp は、GGUFで単一のリクエストストリームを扱う場合、依然として最もシンプルな選択肢です。
MMLUまたはHumanEvalスコアについては、以下のページをご覧くださいOpen LLM Leaderboard およびデータシートの カタログ。これらのスコアはモデルごとに確認する必要があり、サポート業務を十分には評価できません。
内部テストデータはより信頼性があります:50件の閉じられた匿名化されたチケットで、カテゴリ、深刻度、および実際の解決状況を含みます。正しいカテゴリ分類率、ランブック内の正確な引用率、誤ったエスケープの件数を測定してください。ページ ローカルベンチマーク では、スループットの測定方法を説明しています。
ライセンス:顧客の環境にインストールする前に確認する
- Apache 2.0 (Mistral Small 4, Qwen 3.5 122B-A10B, Mixtral 8x22B Instruct):商業利用が許可され、ライセンス記載の保存が求められます。
- MIT (dots.llm1 Instruct):商業利用が許可され、最小限の制約があります。
- Modified MIT (Mistral Medium 3.5 128B):追加条項を読み、条件を確認する必要があります。
- NVIDIA Open Model License, OpenMDW 1.1, Databricks Open Model License :各提供元独自のライセンスで、顧客向けサービスに導入する前にレビューを受ける必要があります。
- その他(オープンウェイト) (Qwen3.8 Flash Next 125B-A6B):条件はケースごとに確認が必要です。
ガイド 企業でのローカルLLM利用とGDPR は、チケットに含まれる個人情報について、この点を補足しています。
デプロイの流れ:チケット、機密情報を除去したログ、ランブック、エスカレーション
ローカルでのサポートの流れは、次の5つのステップで構成されます:
- 決定論的な秘匿化 :モデルに送信する前に、スクリプトがIPアドレス、ホスト名、トークン、メールアドレスを中立的な識別子に置き換えます。対応表はモデルの外部に保持します。
- ランブック内の検索 :手順書を分割してインデックス化し、その後、モデルには関連する箇所とその参照情報だけを渡します。
- 分類 :モデルは、カテゴリ、深刻度、原因の仮説、引用した情報源を含むJSONを返します。
- エスカレーションルール :出典のない回答、重大度が高いインシデント、および本番環境を変更するアクションはすべて技術者にエスカレーションされます。
- ログ : 各やり取りは、モデルのバージョン、量子化方法、プロンプト、使用されたテキストの部分とともに記録されます。
チームインターフェースに関しては、 Open WebUI ローカルサーバーに接続されます。ガイド イントラネットにチーム用チャットボットを導入する インストールの詳細を説明し、 ローカルエージェントのアーキテクチャ ツール呼び出しについて解説しています。
FAQ
Q:これらのモデルは技術者用のPCで動作しますか?
いいえ。今回の選定で最も軽量なLaguna S 2.1でも、コンテキスト用のメモリを除いてQ4で約68GBが必要です。現実的なのは、共有サーバー、または96〜128GBのメモリを搭載したワークステーションを用意し、チームが内部ネットワーク経由で利用する構成です。より小規模なマシンには、当サイトの構成ツールが利用可能なメモリに合ったモデルを提案します。
Q:自社のチケットデータに基づいてモデルをチューニングする必要があるでしょうか?
最初に取り組むことではありません。ランブックを検索し、出典を示すだけでも、再学習なしでESNの用語や手順を取り込めます。出力形式が不安定なままの場合や、お使いのテストデータで分類性能が頭打ちになった場合には、ファインチューニングが有用になります。そのためには、匿名化されたデータとモデルのライセンス確認が必要です。
Q:モデル自身でログから機密情報などを除去できますか?
推奨されません。長い抜粋では、モデルがIPアドレスやトークンを見落とす可能性があります。機密情報の除去は、モデルの前段に置いた、テスト済みでバージョン管理された決定論的なスクリプトで行う必要があります。モデルはその後、機密性のない識別子を使って処理し、実際の値との対応関係は別のシステムに保持します。
Q:このモデルは単独でチケットをクローズできますか?
導入当初は避けたほうがよいでしょう。モデルが分類・評価と解決の手がかりを提案し、その後、技術者が承認します。数週間にわたって測定した後は、文書の依頼など、一部の低リスクなカテゴリを自動化できる場合があります。本番環境のインシデントや特権を必要とする操作には、引き続き人間の承認が必要です。
Q:ログ分析では、最低どの程度のコンテキスト長を目指すべきですか?
少なくとも64,000トークンを目安にしてください。Mixtral 8x22B Instructはこの長さに対応しています。複数のファイルを関連付けて分析するなら、できれば128,000トークン以上が望ましいです。コンテキスト長が32,768トークンのモデルでは、抜粋を細かく分割する必要があります。コンテキストが大きいほどメモリ消費が増え、生成も遅くなるため、送信前にログをフィルタリングしてください。
Q:この選定には、カスタマーサービス向けのモデルも含まれていますか?
いいえ。これはESNの社内ITサポートを対象としており、インシデント、ログ、ランブック、エスカレーションを扱います。営業上のやり取り、返金、最終顧客との会話の翻訳には、多言語対応の品質など、別の評価基準が適用されます。これらは、ローカルLLMによる多言語顧客サポートに特化したガイドで扱っています。
結論
ESNにおけるローカルITアシスタントAIでは、Mistral Small 4 および Qwen 3.5 122B-A10B が最も安全な出発点となります。Apache 2.0ライセンス、約256,000トークンのコンテキスト、Q4_K_Mで72〜73GBです。デュアル速度およびスコアは、ご自身のハードウェアおよびチケットに応じて確認が必要です。ご使用のメモリ容量を記載してください。 構成ツール 互換性を確認するためには、またはを参照してください カタログ ライセンスやVRAM要件を比較するため。
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。