ESNのITテクニカルサポートに最適なLLM

ローカルで動作するITサポート用AIの導入は、ITサービス企業(ESN)が抱える具体的な制約に対応します。チケット、ログ、ランブックには、守秘義務条項の対象となる顧客データが含まれています。ローカルで動作するITサポート用AIなら、これらの情報はご自身で管理するマシン内にとどまり、各回答を情報源に紐づけることができます。

このページでは、社内ITサポートのみを扱います。具体的には、技術的な問い合わせチケットの分類・評価、機密情報などを除去したログの確認、ランブックの検索、追跡可能性の確保、エスカレーションです。商取引、返金、カスタマーサポートの翻訳については、次のガイドで扱っています: ローカルLLMを使った多言語カスタマーサポート.

構成:選定基準、モデルの選定、量子化形式ごとのメモリ使用量、スループットとベンチマーク、ライセンス、最後にデプロイの流れ。

ESNのITサポートがモデルに対して求める要件

社内サポートで求められる特性は、汎用アシスタントとは異なります。重要なのは次の4つの基準です。

選定:Q4 で 68 GB から 85 GB の 7 つのモデル

以下のモデルは、このページの参照カタログの中で最も軽量なモデルです。いずれも大容量メモリを備えたサーバーまたはワークステーションが必要で、技術者が使う通常のPCでは足りません。

次の2つのモデルは、コンテキスト長が32,768トークンに限られています: dots.llm1 Instruct (142B、MIT、~85GB) および DBRX Instruct (132B、Databricks Open Model License、約76 GB)。これらのモデルはチケットの分類に適していますが、ログの分析にはそれほど向いていません。

より多くのメモリを利用できるチームには、 Step 3.5 Flash (196B, Apache 2.0, ~118 GB) および MiniMax-M2.7 (229B、Apache 2.0、約138 GB)が次の段階となります。

量子化方式・ハードウェア別のメモリ

カタログに基づくのはQ4の値だけです。他の量子化レベルの値は、比例則で推定したおおよその目安であり、各モデルの詳細ページで確認する必要があります。

118B〜128Bクラスの場合:

Mixtral 8x22B Instruct(141B)の場合:

これらの数字にはコンテキストが含まれていません。ログの100,000トークンを読み込むことで、複数GBのキャッシュが追加されます。少なくとも15%〜20%の余裕を確保してください(推定値)

ハードウェア側では、72GBのQ4は96GBの統合メモリのマシンでわずかな余裕で動作し、128GBのマシンではより快適に利用できます。ページ Mac 96 GB et Mac 128 GB これらの設定については詳しく説明しています。PCでは複数のグラフィックスカードを組み合わせる必要があります:ガイドを参照ください LLMのローカルデプロイメントに適したGPUを選択する.

スループットとベンチマーク:まだ確認が必要な点

これらの7つのモデルについて、測定されたスループットはここでは公開されていません:tokens/secはご自身のハードウェアで確認してください。2つの定性的な目安:

MMLUまたはHumanEvalスコアについては、以下のページをご覧くださいOpen LLM Leaderboard およびデータシートの カタログ。これらのスコアはモデルごとに確認する必要があり、サポート業務を十分には評価できません。

内部テストデータはより信頼性があります:50件の閉じられた匿名化されたチケットで、カテゴリ、深刻度、および実際の解決状況を含みます。正しいカテゴリ分類率、ランブック内の正確な引用率、誤ったエスケープの件数を測定してください。ページ ローカルベンチマーク では、スループットの測定方法を説明しています。

ライセンス:顧客の環境にインストールする前に確認する

ガイド 企業でのローカルLLM利用とGDPR は、チケットに含まれる個人情報について、この点を補足しています。

デプロイの流れ:チケット、機密情報を除去したログ、ランブック、エスカレーション

ローカルでのサポートの流れは、次の5つのステップで構成されます:

  1. 決定論的な秘匿化 :モデルに送信する前に、スクリプトがIPアドレス、ホスト名、トークン、メールアドレスを中立的な識別子に置き換えます。対応表はモデルの外部に保持します。
  2. ランブック内の検索 :手順書を分割してインデックス化し、その後、モデルには関連する箇所とその参照情報だけを渡します。
  3. 分類 :モデルは、カテゴリ、深刻度、原因の仮説、引用した情報源を含むJSONを返します。
  4. エスカレーションルール :出典のない回答、重大度が高いインシデント、および本番環境を変更するアクションはすべて技術者にエスカレーションされます。
  5. ログ : 各やり取りは、モデルのバージョン、量子化方法、プロンプト、使用されたテキストの部分とともに記録されます。

チームインターフェースに関しては、 Open WebUI ローカルサーバーに接続されます。ガイド イントラネットにチーム用チャットボットを導入する インストールの詳細を説明し、 ローカルエージェントのアーキテクチャ ツール呼び出しについて解説しています。

FAQ

Q:これらのモデルは技術者用のPCで動作しますか?

いいえ。今回の選定で最も軽量なLaguna S 2.1でも、コンテキスト用のメモリを除いてQ4で約68GBが必要です。現実的なのは、共有サーバー、または96〜128GBのメモリを搭載したワークステーションを用意し、チームが内部ネットワーク経由で利用する構成です。より小規模なマシンには、当サイトの構成ツールが利用可能なメモリに合ったモデルを提案します。

Q:自社のチケットデータに基づいてモデルをチューニングする必要があるでしょうか?

最初に取り組むことではありません。ランブックを検索し、出典を示すだけでも、再学習なしでESNの用語や手順を取り込めます。出力形式が不安定なままの場合や、お使いのテストデータで分類性能が頭打ちになった場合には、ファインチューニングが有用になります。そのためには、匿名化されたデータとモデルのライセンス確認が必要です。

Q:モデル自身でログから機密情報などを除去できますか?

推奨されません。長い抜粋では、モデルがIPアドレスやトークンを見落とす可能性があります。機密情報の除去は、モデルの前段に置いた、テスト済みでバージョン管理された決定論的なスクリプトで行う必要があります。モデルはその後、機密性のない識別子を使って処理し、実際の値との対応関係は別のシステムに保持します。

Q:このモデルは単独でチケットをクローズできますか?

導入当初は避けたほうがよいでしょう。モデルが分類・評価と解決の手がかりを提案し、その後、技術者が承認します。数週間にわたって測定した後は、文書の依頼など、一部の低リスクなカテゴリを自動化できる場合があります。本番環境のインシデントや特権を必要とする操作には、引き続き人間の承認が必要です。

Q:ログ分析では、最低どの程度のコンテキスト長を目指すべきですか?

少なくとも64,000トークンを目安にしてください。Mixtral 8x22B Instructはこの長さに対応しています。複数のファイルを関連付けて分析するなら、できれば128,000トークン以上が望ましいです。コンテキスト長が32,768トークンのモデルでは、抜粋を細かく分割する必要があります。コンテキストが大きいほどメモリ消費が増え、生成も遅くなるため、送信前にログをフィルタリングしてください。

Q:この選定には、カスタマーサービス向けのモデルも含まれていますか?

いいえ。これはESNの社内ITサポートを対象としており、インシデント、ログ、ランブック、エスカレーションを扱います。営業上のやり取り、返金、最終顧客との会話の翻訳には、多言語対応の品質など、別の評価基準が適用されます。これらは、ローカルLLMによる多言語顧客サポートに特化したガイドで扱っています。

結論

ESNにおけるローカルITアシスタントAIでは、Mistral Small 4 および Qwen 3.5 122B-A10B が最も安全な出発点となります。Apache 2.0ライセンス、約256,000トークンのコンテキスト、Q4_K_Mで72〜73GBです。デュアル速度およびスコアは、ご自身のハードウェアおよびチケットに応じて確認が必要です。ご使用のメモリ容量を記載してください。 構成ツール 互換性を確認するためには、またはを参照してください カタログ ライセンスやVRAM要件を比較するため。

LLMをローカルで実行するためのハードウェア

これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.