小売・Eコマースのカスタマーサービスに最適なLLM

カスタマーサービス向けにローカルで動作する商取引用AIを導入するとは、カタログや注文、郵送先住所を外部サービスに送信せず、自社のマシンでLLMを実行してオンラインショップの顧客に対応することです。この商取引用ローカルAIに適したモデルは、最も大きいものでも、汎用ベンチマークで最も高く評価されたものでもありません。商品情報を正しく読み取り、正確な注文ステータスを示し、返品ポリシーを厳密に適用し、分からないときには人間に引き継ぐモデルです。この記事では、対応すべき4つのタスクを詳しく説明し、quelllm.frのカタログからハードウェアの性能段階別にモデルを提案します。続いて、回答がデータに根拠を置いているかを評価する手順を説明し、ライセンスと導入について検討した後、FAQを掲載します。

ECサイトのカスタマーサービスLLMの4つのタスク

範囲は意図的に狭く設定されています。マルチ言語対応については、 ローカル環境での多言語カスタマーサポート専用ガイド また、社内ITサポートはここでは対象外です。残るのは、要件を規定する次の4つの機能です:

したがって、モデル間の差を決める能力はancrage : 提供されたデータに基づいて回答し、情報が不足している場合は適切に拒否する。推奨されるアーキテクチャ(ドキュメント検索、ツール呼び出し、拒否ルール)は、 ローカルエージェントのアーキテクチャガイド.

Mac 128GBと双GPUステーション用(Q4は68GB〜75GB)

このクラスは、128 GBのユニファイドメモリを搭載したMac Studio、または96 GBのプロ向けグラフィックカードを搭載したワークステーションに相当します。以下のモデルはMixture-of-Experts(MoE)アーキテクチャを採用しています。トークンごとに有効になるパラメータが少ないため、重みのサイズが大きくても、リアルタイムのチャットに対応できるスループットが得られます。スループットの数値はすべて、有効なパラメータ数とメモリ帯域幅から算出した推定値であり、お使いのマシンで確認する必要があります。

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - パラメータ :合計 122B、トークンあたり約 10B アクティブ - VRAM Q4 :約73 GB;Q5 約88 GB(推定);Q8 約130 GB(推定);FP16 約245 GB(推定) - コンテキスト : 262,000トークン。完全なフィードバックポリシー、会話履歴、十数件の製品情報の記録に十分です。 スループット :Mac Studio M4 Max 128GBでQ4を使用した場合、推定30~45トークン/秒;96GBのカードでvLLMを使用した場合、推定80トークン/秒以上 - Eコマースに適している理由 : Qwenシリーズはフォーマットやツール呼び出しの指示に従っているため、注文ステータスに貢献します。公開されたパラメータは Hugging Face 上の Alibaba.

Mistral Small 4 (Mistral, Apache 2.0) - パラメータ : 119B - VRAM Q4 : ~72 GB ; Q8 ~127 GB (推定) ; FP16 ~240 GB (推定) - コンテキスト : 256 000トークン - スループット :アーキテクチャの有効パラメータ数に応じて確認が必要です。MoEモデルの場合は、前述のモデルと同程度の値を目安にしてください。 - Eコマースに適している理由 :顧客向けの文章作成におけるフランス語の品質と、商用利用に関する制限条項のないApache 2.0ライセンス。重みの公開元: Hugging Face上のMistral.

Qwen3.8 Flash Next 125B-A6B (Qwen、オープンウェイトのライセンス、商用利用前に利用条件を確認すること) - パラメータ :合計125B、うち約6Bがアクティブ - VRAM Q4 : ~72 GB ; Q8 ~133 GB (推定) - コンテキスト : 256 000トークン - スループット :この区分で最も高速。Mac Studio 128 GBで推定50〜70トークン/秒 - Eコマースに適している理由 : 高トラフィックなチャットにおいても短い遅延を実現します。ただし、アクティブなパラメータが少ないため、曖昧な質問に対して慎重にテストする必要があります。

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB;Q8 ~136 GB(推定)- コンテキスト : 256 000トークン - Eコマースに適している理由 :紛争事例で推論能力をもう一段高めたい場合のMistral Small 4の代替モデルですが、その分、生成速度は低くなります(要確認)。

マシンを選択する際には、 128 GBメモリ搭載Macの専用ページ コンテキスト分のメモリも含めて、実際に収まるモデルを一覧で紹介しています。

サーバー向けの構成:140 GB以上

複数のGPUを搭載したサーバーや192 GB以上のマシンをお持ちなら、複雑なケース(複数の段階を経る苦情対応、一部のみ発送された注文)で、3つのモデルが品質面での余裕をもたらします。

カタログに掲載されている400 GBを超えるモデル(DeepSeek V4 Pro、Kimi K3、GLM 5.2)は、店舗での導入には手が届かず、これほど範囲の明確なタスクでは測定可能な改善をもたらしません。

グラウンディングと回答拒否の評価:重要な検証手順

公開ベンチマーク(MMLU、HumanEval、AIME)は一般知識、コーディング、数学の能力を測定します。どれも「モデルが返品期限をでっち上げたか」は測定しません。 Open LLM Leaderboard は性能の低いモデルを除外するためのものであり、この用途に適したモデルを選ぶためのものではありません。独自のテストセットを作成してください。半日あれば十分です:

ドキュメント検索層に関しては、 FirecrawlおよびローカルRAGガイド はカタログのインデックスを作成する方法を説明しています。また、 GraphRAGガイド では、商品間の関連が多いカタログのケースを扱っています。

ライセンスと顧客データ

カスタマーサービスでは、氏名、住所、購入履歴などの個人データを扱います。ローカルに導入すると、処理の委託先へのデータ転送がなくなりますが、まだ2つの点について取り決める必要があります。

展開:エンジン、インターフェース、遅延目標

Le イントラネットでチーム用チャットボットを導入するためのガイド では、稼働開始までの手順を一つずつ解説しています。

FAQ

Q:Mac Studio 128 GB で始める場合、どのモデルを選べばよいですか?

Q4 の Qwen 3.5 122B-A10B(約73 GB)は、最もバランスのよい出発点です。Apache 2.0 ライセンスで、ツール呼び出しの性能も良好であり、推定処理速度は毎秒30〜45トークンです。応答の精緻さよりも低遅延を優先するなら、Qwen3.8 Flash Next 125B-A6B のほうが高速ですが、曖昧な質問については、さらにテストが必要です。どちらを選ぶか決める前に、両モデルで50問の評価プロトコルを実施してください。

Q:100Bより小さいモデルでも、この用途には十分ですか?

カタログ検索や注文ステータスにおいては、しばしばはいです。モデルは与えられたデータを再構成する場合が多いためです。このレベルのモデルの利点は、曖昧なケースや拒否の処理において顕著に現れます。 カタログ ではVRAM容量で絞り込み、より軽量なモデルと比較できます。評価プロトコルは同じです。

Q:モデルが配送までの日数をでっち上げないようにするには?

3つのレイヤー:ステータスは常にツール呼び出しから取得され、モデルのメモリからは取得されません。システムプロンプトは「ツール結果なしでは日付を出力しない」ことを強制します。アプリケーションレベルのルールは、呼び出しが行われていない場合に日付を含む応答をブロックします。その後、回答のない20の質問に対する幻覚率を測定してください。2%未満である必要があります。

Q:カタログ全体を読み込むには、1,000,000トークンのコンテキストが必要ですか?

まれです。メッセージごとにカタログ全体を読み込むと、プリフィルの遅延とキャッシュのメモリ消費が大幅に増えます。検索で関連する情報を5~10件取得し、8,000~16,000トークンのコンテキストに収めるほうが、結果の質が高く、応答も速くなります。DeepSeek V4 Flashの非常に長いコンテキストは、むしろ必要に応じて行う個別の分析に向いています。

Q:多言語サポートガイドとどのような違いがありますか?

この比較は、フランス語での取引関連タスクに限定しています。対象はカタログ、注文、返品、エスカレーションです。 多言語カスタマーサポートガイド では、言語検出、翻訳、言語ごとのテストセットを扱っています。両者は組み合わせて使えます。ここでモデルを選び、お店がフランス語圏外にも配送する場合は、その後で多言語対応の層を追加してください。

Q:私のマシンで実際の処理速度をどう測定すればよいですか?

llama.cpp または vLLM で Q4 のモデルを読み込み、8,000 トークンのコンテキストを持つ同じタイプの会話を 10 回送信し、生成時の tokens/s と初回トークンまでの時間を記録してください。本記事の数値は推定値であり、実際の数値はメモリ帯域幅、量子化、同時セッション数によって異なります。La ローカルベンチマークページ は再現可能な手法を説明しています。

結論

クライアントサービス向けのローカルAIは、アンカーと拒否の品質で評価され、MMLUスコアとは異なります。Mac 128GBまたはスターション96GBの場合、Qwen 3.5 122B-A10B および Mistral Small 4 はカタログ、注文、返品、および上昇処理をカバーし、Apache 2.0ライセンスで利用可能です。140GBを超える場合、Qwen 3 235B-A22B および MiniMax-M2.7 は複雑なケースに対する余裕を提供します。ハードウェアとの互換性については、以下のページを参照してください 構成ツール。その後、ご自身で用意した50問で、選んだモデルを検証してください。

LLMをローカルで実行するためのハードウェア

これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.