KTransformersのインストール:コンシューマーGPUで70B以上のLLMを実行

フレームワーク KTransformersのインストール 非アクティブなエキスパートをCPU RAMにオフロードすることで、単一の RTX 4090 または3090カード上で6000億パラメータを超えるMoE(Mixture of Experts)モデルをローカルで実行できます。この KTransformersのインストール MoEのエキスパートを選択的にオフロードする仕組みに基づき、CPUのAVX-512/AMX命令を活用してGPUの負荷を軽減します。本ガイドでは、ハードウェア要件、段階的なインストール手順、対応モデル(特に 一般消費者向けGPUで動かすDeepSeek V3)における測定されたパフォーマンスおよびデプロイ時のよくある誤り 671BのローカルLLM.

KTransformersがMoE型LLMの常識を変える理由

KTransformersは、清華大学のKVCache.AIラボが開発したPythonフレームワークで、Apache 2.0ライセンスのもとで公開されています GitHub. 特徴は、推論時にMoEのアクティブなエキスパートのみをVRAMにロードし、他のエキスパートはシステムRAMに保持することです。モデル例として DeepSeek V3 671B 総パラメータ671Bのうち、トークンごとに約37Bのパラメータのみをアクティブにするため、VRAMの節約は非常に大きくなります。

具体的には、従来の推論(vLLM、transformers)でDeepSeek V3をQ4で実行するには約400GBのVRAMが必要になるのに対し、KTransformersでは同じモデルを次の構成で実行できます:

このアプローチは直接的に競合しています llama.cpp およびその仕組み --n-gpu-layersですが、KTransformersはMoEアーキテクチャではさらに踏み込み、層全体をオフロードする代わりに、各エキスパートを適切なデバイスに振り分けます。

規模の目安として、このアプローチで利用可能になるMoEモデルをいくつか紹介します:

ハードウェアおよびソフトウェアの前提条件

起動前に KTransformersのインストール、お使いの構成を確認してください。このフレームワークは特にMoEアーキテクチャを対象としており、RAMとVRAMの間に特定のバランスが必要です。

DeepSeek V3 Q4_K_M の最低ハードウェア要件 :

ソフトウェアスタック :

このアプローチを従来のすべてGPU方式と比較するには、私たちの vLLMガイド H100クラスタにおけるテンソル並列化を詳細に説明しています。

ステップバイステップのインストール手順

La KTransformersのインストール 厳密な手順に従います。CUDA/PyTorchのバージョンが指定から少しでも外れると、CPUカーネルのコンパイルが失敗します。

ステップ1 — Pythonの隔離環境 :

conda create -n ktrans python=3.11
conda activate ktrans
conda install -c conda-forge libstdcxx-ng

ステップ2 — CUDA対応のPyTorch :

pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu124
pip install packaging ninja cpufeature numpy

ステップ3 — クローンとコンパイル :

git clone https://github.com/kvcache-ai/ktransformers.git
cd ktransformers
git submodule update --init --recursive
bash install.sh

スクリプト install.sh CPUカーネル(llamafile、および検出された場合はAMX)をコンパイルし、ローカルのwheelをインストールします。コンパイルには、CPUによって10〜20分かかります。

ステップ4 — モデルの重みのダウンロード :

KTransformers は GGUF ファイル(量子化)を消費します llama.cpp。たとえば、 DeepSeek-V3-Q4_K_M.gguf depuis Hugging Face :

huggingface-cli download unsloth/DeepSeek-V3-GGUF \
  --include "DeepSeek-V3-Q4_K_M*" \
  --local-dir ./models/deepseek-v3-q4

ステップ5 — 推論の実行 :

python -m ktransformers.local_chat \
  --model_path deepseek-ai/DeepSeek-V3 \
  --gguf_path ./models/deepseek-v3-q4 \
  --cpu_infer 48 \
  --max_new_tokens 1024

パラメータ --cpu_infer CPUの専用スレッド数に該当します。これを (cores physiques - 2).

一般消費者向けGPUで測定した性能

以下の数字は、 公式ベンチマーク KTransformers v0.2 およびコミュニティからのフィードバック。 671BのローカルLLM Q4_K_Mで量子化:

比較のため、 DeepSeek R1 Distill Llama 70B 2× RTX 4090でフルGPU動作時、25〜30 tok/sに達します。絶対速度は速いものの、蒸留モデルは推論ベンチマークにおいて671Bフルモデルに劣ります。

品質ベンチマーク(DeepSeekの公式レポート) :

品質と速度のバランスを検証するには、 DeepSeek R1 vs Llama 3.3 70B.

対応モデルおよび制限

すべてのMoE型LLMがネイティブにサポートされているわけではありません。KTransformersは、アーキテクチャごとにYAML形式の最適化リストを管理しています。現在のカタログでは:

ネイティブサポートが確認済み :

対応作業中または実験的なサポート :

サポートされていません (密なアーキテクチャで、オフロードするメリットがない):

実用上の最大コンテキスト長は、KVキャッシュに使えるRAM容量によって制限されます。DeepSeek V3で32Kトークンを扱う場合は、追加で約30 GBを見込んでください。64Kトークンを超えると、スループットが大幅に低下します。

FAQ

Q:KTransformersはApple Silicon搭載のMacで動作しますか?

いいえ。フレームワークは GPU カーネルに CUDA、CPU x86 カーネルに AVX-512/AMX を依存しています。Mac Mシリーズでは代わりに llama.cpp MetalまたはMLXで使用可能です。当社の Mac用LLMガイド では代替案を詳しく説明しています。512GBのM3 Ultraでは、DeepSeek V3 Q4をオフロードせずにネイティブで実行でき、速度は推定18〜20トークン/秒です。

Q:llama.cppのオフロードモードとどのような違いがありますか?

llama.cpp はレイヤー単位でオフロードします(--n-gpu-layers N), デンシモデルにも適用可能です Llama 3.3 70B Instruct. KTransformersはオフロードを実行します 個々のエキスパート MoE の場合、これは DeepSeek V3 において、トークンごとに 256 個のエクスパートのうち 8 個のみがアクティブになるため、はるかに効率的です。典型的な利点: 同等のハードウェア上で DeepSeek V3 において llama.cpp より 3〜5 倍高速です。

Q:KTransformersを使ってファインチューニングは可能ですか?

いいえ、このフレームワークは推論専用です。MoEをファインチューニングするには、DeepSpeed-MoEまたはUnsloth(70B未満のデンスモデルに限定)をご検討ください。KTransformersは動的LoRAにもQLoRAにも対応していません。70Bモデルを調整したい場合は、代わりに次を利用してください: Llama 3.1 Nemotron 70B RTX 4090でUnslothをQLoRA 4ビットで使用

Q:一般向けGPUを使ったDeepSeek V3の構成には、いくらかかりますか?

推定予算(2026 年):RTX 4090 中古 1500 ユーロ、サーバー用マザーボード W790 または EPYC SP5 800 ユーロ、CPU Xeon w7-2495X 2200 ユーロ、DDR5 ECC 384 GB 3000 ユーロ、NVMe 2 TB 200 ユーロ、電源 + ケース 400 ユーロ。合計:約 8000 ユーロで 1 つの 671BのローカルLLM。フル精度では不十分な単体のH100 80 GBの約30,000€と比較できます。

Q:OpenAI互換のサーバーモードは利用できますか?

はい、v0.2以降から対応しています。実行してください。 ktransformers --server_port 10002 --model_path ... --gguf_path ... および、OpenAI クライアントを指すように設定してください http://localhost:10002/v1。Open WebUI、Continue.dev、LiteLLMと互換性があります。SSEストリーミングは動作しますが、関数呼び出しの対応はまだ部分的です(バージョンに応じて確認が必要)。

Q : KTransformers と SGLang どちらが DeepSeek V3 に適していますか?

SGLang 高性能マルチGPUデプロイメント(H100/H200)を対象にし、DeepSeek V3 8×H100で60以上tok/sを達成。KTransformersは単一GPUコンシューマ向けにRAMオフロードを実現し、10〜15tok/sを達成。選択肢はシンプルです:クラスタがある場合はSGLang、スタンドアロンPCがある場合はKTransformers。

結論

La KTransformersのインストール 8000€のスタンドアロンワークステーションで、MoEモデルのフロントエンド(DeepSeek V3, R1, Kimi K2.5)にアクセスできるようになります。対象となるH100クラスタ20万€の代わりです。妥協点は、60以上から10〜15トークン/秒に落ちるものの、フル精度モデルと同等の応答品質が得られます。あなたのVRAMおよびRAMに適したMoEモデルを特定するには、 quelllm.frのモデル選定ツール、または直接ご覧ください: 登録済みの249種類のLLMのカタログ ライセンスとサイズを比較するため

記事公開日: 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.