小売・Eコマースのカスタマーサービスに最適なLLM
カスタマーサービス向けにローカルで動作する商取引用AIを導入するとは、カタログや注文、郵送先住所を外部サービスに送信せず、自社のマシンでLLMを実行してオンラインショップの顧客に対応することです。この商取引用ローカルAIに適したモデルは、最も大きいものでも、汎用ベンチマークで最も高く評価されたものでもありません。商品情報を正しく読み取り、正確な注文ステータスを示し、返品ポリシーを厳密に適用し、分からないときには人間に引き継ぐモデルです。この記事では、対応すべき4つのタスクを詳しく説明し、quelllm.frのカタログからハードウェアの性能段階別にモデルを提案します。続いて、回答がデータに根拠を置いているかを評価する手順を説明し、ライセンスと導入について検討した後、FAQを掲載します。
ECサイトのカスタマーサービスLLMの4つのタスク
範囲は意図的に狭く設定されています。マルチ言語対応については、 ローカル環境での多言語カスタマーサポート専用ガイド また、社内ITサポートはここでは対象外です。残るのは、要件を規定する次の4つの機能です:
- 製品カタログ検索 :モデルは検索システムを通じてカタログの抜粋(商品情報、在庫、バリエーション、価格)を受け取り、その抜粋だけに基づいて回答しなければなりません。衣服のサイズをでっち上げたり、アクセサリーの互換性を推測したりすると、商品の返品につながります。
- 注文状況 :モデルは、注文データベースを照会するツール(関数)を呼び出し、その結果を言い換えて伝えます。この呼び出しで得られたものではない追跡番号や配送日を、決して生成してはいけません。
- 返品および払い戻しポリシー :ポリシーのテキストはコンテキスト内で提供されています。モデルは、除外事項を含む正確な期限と条件を引用する必要があり、「14 日間」を「約 2 週間」と丸めてはいけません。
- 人間の担当者への引き継ぎ :依頼が対応範囲を外れた場合(紛争、顧客への特別な配慮、データの欠落)、モデルは直ちに、担当者への引き継ぎを案内する回答と、人間の担当者向けの構造化された要約を生成する必要があります。
したがって、モデル間の差を決める能力はancrage : 提供されたデータに基づいて回答し、情報が不足している場合は適切に拒否する。推奨されるアーキテクチャ(ドキュメント検索、ツール呼び出し、拒否ルール)は、 ローカルエージェントのアーキテクチャガイド.
Mac 128GBと双GPUステーション用(Q4は68GB〜75GB)
このクラスは、128 GBのユニファイドメモリを搭載したMac Studio、または96 GBのプロ向けグラフィックカードを搭載したワークステーションに相当します。以下のモデルはMixture-of-Experts(MoE)アーキテクチャを採用しています。トークンごとに有効になるパラメータが少ないため、重みのサイズが大きくても、リアルタイムのチャットに対応できるスループットが得られます。スループットの数値はすべて、有効なパラメータ数とメモリ帯域幅から算出した推定値であり、お使いのマシンで確認する必要があります。
Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - パラメータ :合計 122B、トークンあたり約 10B アクティブ - VRAM Q4 :約73 GB;Q5 約88 GB(推定);Q8 約130 GB(推定);FP16 約245 GB(推定) - コンテキスト : 262,000トークン。完全なフィードバックポリシー、会話履歴、十数件の製品情報の記録に十分です。 スループット :Mac Studio M4 Max 128GBでQ4を使用した場合、推定30~45トークン/秒;96GBのカードでvLLMを使用した場合、推定80トークン/秒以上 - Eコマースに適している理由 : Qwenシリーズはフォーマットやツール呼び出しの指示に従っているため、注文ステータスに貢献します。公開されたパラメータは Hugging Face 上の Alibaba.
Mistral Small 4 (Mistral, Apache 2.0) - パラメータ : 119B - VRAM Q4 : ~72 GB ; Q8 ~127 GB (推定) ; FP16 ~240 GB (推定) - コンテキスト : 256 000トークン - スループット :アーキテクチャの有効パラメータ数に応じて確認が必要です。MoEモデルの場合は、前述のモデルと同程度の値を目安にしてください。 - Eコマースに適している理由 :顧客向けの文章作成におけるフランス語の品質と、商用利用に関する制限条項のないApache 2.0ライセンス。重みの公開元: Hugging Face上のMistral.
Qwen3.8 Flash Next 125B-A6B (Qwen、オープンウェイトのライセンス、商用利用前に利用条件を確認すること) - パラメータ :合計125B、うち約6Bがアクティブ - VRAM Q4 : ~72 GB ; Q8 ~133 GB (推定) - コンテキスト : 256 000トークン - スループット :この区分で最も高速。Mac Studio 128 GBで推定50〜70トークン/秒 - Eコマースに適している理由 : 高トラフィックなチャットにおいても短い遅延を実現します。ただし、アクティブなパラメータが少ないため、曖昧な質問に対して慎重にテストする必要があります。
Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB;Q8 ~136 GB(推定)- コンテキスト : 256 000トークン - Eコマースに適している理由 :紛争事例で推論能力をもう一段高めたい場合のMistral Small 4の代替モデルですが、その分、生成速度は低くなります(要確認)。
マシンを選択する際には、 128 GBメモリ搭載Macの専用ページ コンテキスト分のメモリも含めて、実際に収まるモデルを一覧で紹介しています。
サーバー向けの構成:140 GB以上
複数のGPUを搭載したサーバーや192 GB以上のマシンをお持ちなら、複雑なケース(複数の段階を経る苦情対応、一部のみ発送された注文)で、3つのモデルが品質面での余裕をもたらします。
- Qwen 3 235B-A22B (Alibaba、Apache 2.0):Q4で約142 GB、Q8で約250 GB(推定)、コンテキストは131,072トークン、アクティブパラメータは約22B。ツールを順次呼び出す用途で頼りになる選択肢です。
- MiniMax-M2.7 (MiniMax、Apache 2.0):Q4で約138 GB、コンテキスト長は205,000トークン。エージェント向けで、カスタマーサービスでカタログ検索に続いてチケットを更新する場合に適しています。
- DeepSeek V4 Flash 284B (DeepSeek, MIT):Q4 でのサイズは約170 GB、コンテキスト長は1,000,000トークン。非常に長いコンテキストにより、事前に検索せずに数千件の参照データベース全体を読み込むことが可能ですが、プリフィルの遅延は比例して増加します。公開されたパラメータは Hugging FaceのDeepSeek. FlashとProの選択についての詳細は、 DeepSeek V4 ProとFlashの比較.
- GLM 5.3 Flash 320B-A18B (Zhipu、MIT):Q4で約186 GB、128,000トークン、有効パラメータ数18B。モデルの重みの公開元: Hugging Face上のZhipu.
カタログに掲載されている400 GBを超えるモデル(DeepSeek V4 Pro、Kimi K3、GLM 5.2)は、店舗での導入には手が届かず、これほど範囲の明確なタスクでは測定可能な改善をもたらしません。
グラウンディングと回答拒否の評価:重要な検証手順
公開ベンチマーク(MMLU、HumanEval、AIME)は一般知識、コーディング、数学の能力を測定します。どれも「モデルが返品期限をでっち上げたか」は測定しません。 Open LLM Leaderboard は性能の低いモデルを除外するためのものであり、この用途に適したモデルを選ぶためのものではありません。独自のテストセットを作成してください。半日あれば十分です:
- 3 つのカテゴリに分類された 50 問 : 20問は提供されたデータ内に回答が含まれ、20問は回答が欠落しており、10問は曖昧です(2つのバリエーションを持つ既存の製品、2つの荷物を含む注文)。
- すべてのモデルに共通するコンテキスト :同じ商品情報、同じ返品ポリシー、同じ注文ツールの模擬出力。
- 3つの指標 :情報が含まれている質問に対する正確性、情報が含まれていない質問に対して適切に回答を断る割合(「その情報はありませんので、担当者におつなぎします」)、そして捏造率、つまりコンテキストに根拠がないのに確信を持って回答する割合です。
- 合格基準 :存在しない質問に対する発明率が2%を超えると、他の部分の品質に関わらずモデルは失格となります。誤った納期を受け取った顧客は、チケット、クレーム、場合によってはネガティブなレビューを生成します。
- システムプロンプトのテスト :「情報がコンテキストに含まれていない場合は、わからないと答え、担当者への引き継ぎを提案してください」という明示的な指示を追加してください。追加前と追加後を比較してください。上記のモデルは一般にこの指示によく対応しますが、モデル間の差は特に曖昧な質問で表れます。
ドキュメント検索層に関しては、 FirecrawlおよびローカルRAGガイド はカタログのインデックスを作成する方法を説明しています。また、 GraphRAGガイド では、商品間の関連が多いカタログのケースを扱っています。
ライセンスと顧客データ
カスタマーサービスでは、氏名、住所、購入履歴などの個人データを扱います。ローカルに導入すると、処理の委託先へのデータ転送がなくなりますが、まだ2つの点について取り決める必要があります。
- モデルのライセンス : Apache 2.0 (Qwen 3.5, Mistral Small 4, Qwen 3 235B, MiniMax-M2.7) および MIT (DeepSeek V4 Flash, GLM 5.3 Flash) は、販売量に制限なく商業利用を許可しています。Mistral Medium 3.5 の Modified MIT ライセンスおよび Qwen3.8 Flash Next の「その他の」ライセンスは、実装前にテキストの読み取りが必要です。NVIDIA Open Model License は Nemotron 3 Super 120B には独自の条項があります。
- ログ記録 : 会話履歴は評価のため保存しますが、保存期間を設定し、注文識別子を偽名化して管理してください。 企業でのローカルLLM利用とGDPRに関するガイド 個人データの処理活動記録について詳しく解説しています。
展開:エンジン、インターフェース、遅延目標
- 推論エンジン : llama.cpp は、Mac Studioや単一ユーザー用のワークステーションでGGUFを使う場合に適しています。 vLLM は、複数のクライアントが同時に会話する場合に適しています。バッチ処理によって、同じグラフィックスカードでの全体のスループットが何倍にも高まるためです。
- インターフェースおよびツール : Open WebUI は、注文APIを接続するためのテスト用フロントエンドと、ツール(関数)の管理機能を提供します。本番環境では、エンジンが提供するOpenAI互換APIを介して、既存のチャットウィジェットに組み込むのが一般的です。
- 確保するコンテキスト容量 : 1回の会話あたり8,000〜16,000トークンを想定してください(返品ポリシー、5〜10件の商品情報、履歴など)。128 GBのMacで73 GBのQ4モデルを使用する場合、複数のセッションを同時に実行するための余裕があります。
- ターゲットレイテンシ :最初のトークンまで2秒未満、回答全体の生成まで10秒未満。72 GBクラスのMoEモデルはこの目標を達成しますが、同程度の規模の密なモデルは達成しません。
Le イントラネットでチーム用チャットボットを導入するためのガイド では、稼働開始までの手順を一つずつ解説しています。
FAQ
Q:Mac Studio 128 GB で始める場合、どのモデルを選べばよいですか?
Q4 の Qwen 3.5 122B-A10B(約73 GB)は、最もバランスのよい出発点です。Apache 2.0 ライセンスで、ツール呼び出しの性能も良好であり、推定処理速度は毎秒30〜45トークンです。応答の精緻さよりも低遅延を優先するなら、Qwen3.8 Flash Next 125B-A6B のほうが高速ですが、曖昧な質問については、さらにテストが必要です。どちらを選ぶか決める前に、両モデルで50問の評価プロトコルを実施してください。
Q:100Bより小さいモデルでも、この用途には十分ですか?
カタログ検索や注文ステータスにおいては、しばしばはいです。モデルは与えられたデータを再構成する場合が多いためです。このレベルのモデルの利点は、曖昧なケースや拒否の処理において顕著に現れます。 カタログ ではVRAM容量で絞り込み、より軽量なモデルと比較できます。評価プロトコルは同じです。
Q:モデルが配送までの日数をでっち上げないようにするには?
3つのレイヤー:ステータスは常にツール呼び出しから取得され、モデルのメモリからは取得されません。システムプロンプトは「ツール結果なしでは日付を出力しない」ことを強制します。アプリケーションレベルのルールは、呼び出しが行われていない場合に日付を含む応答をブロックします。その後、回答のない20の質問に対する幻覚率を測定してください。2%未満である必要があります。
Q:カタログ全体を読み込むには、1,000,000トークンのコンテキストが必要ですか?
まれです。メッセージごとにカタログ全体を読み込むと、プリフィルの遅延とキャッシュのメモリ消費が大幅に増えます。検索で関連する情報を5~10件取得し、8,000~16,000トークンのコンテキストに収めるほうが、結果の質が高く、応答も速くなります。DeepSeek V4 Flashの非常に長いコンテキストは、むしろ必要に応じて行う個別の分析に向いています。
Q:多言語サポートガイドとどのような違いがありますか?
この比較は、フランス語での取引関連タスクに限定しています。対象はカタログ、注文、返品、エスカレーションです。 多言語カスタマーサポートガイド では、言語検出、翻訳、言語ごとのテストセットを扱っています。両者は組み合わせて使えます。ここでモデルを選び、お店がフランス語圏外にも配送する場合は、その後で多言語対応の層を追加してください。
Q:私のマシンで実際の処理速度をどう測定すればよいですか?
llama.cpp または vLLM で Q4 のモデルを読み込み、8,000 トークンのコンテキストを持つ同じタイプの会話を 10 回送信し、生成時の tokens/s と初回トークンまでの時間を記録してください。本記事の数値は推定値であり、実際の数値はメモリ帯域幅、量子化、同時セッション数によって異なります。La ローカルベンチマークページ は再現可能な手法を説明しています。
結論
クライアントサービス向けのローカルAIは、アンカーと拒否の品質で評価され、MMLUスコアとは異なります。Mac 128GBまたはスターション96GBの場合、Qwen 3.5 122B-A10B および Mistral Small 4 はカタログ、注文、返品、および上昇処理をカバーし、Apache 2.0ライセンスで利用可能です。140GBを超える場合、Qwen 3 235B-A22B および MiniMax-M2.7 は複雑なケースに対する余裕を提供します。ハードウェアとの互換性については、以下のページを参照してください 構成ツール。その後、ご自身で用意した50問で、選んだモデルを検証してください。
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。