KTransformersのインストール:コンシューマーGPUで70B以上のLLMを実行
フレームワーク KTransformersのインストール 非アクティブなエキスパートをCPU RAMにオフロードすることで、単一の RTX 4090 または3090カード上で6000億パラメータを超えるMoE(Mixture of Experts)モデルをローカルで実行できます。この KTransformersのインストール MoEのエキスパートを選択的にオフロードする仕組みに基づき、CPUのAVX-512/AMX命令を活用してGPUの負荷を軽減します。本ガイドでは、ハードウェア要件、段階的なインストール手順、対応モデル(特に 一般消費者向けGPUで動かすDeepSeek V3)における測定されたパフォーマンスおよびデプロイ時のよくある誤り 671BのローカルLLM.
KTransformersがMoE型LLMの常識を変える理由
KTransformersは、清華大学のKVCache.AIラボが開発したPythonフレームワークで、Apache 2.0ライセンスのもとで公開されています GitHub. 特徴は、推論時にMoEのアクティブなエキスパートのみをVRAMにロードし、他のエキスパートはシステムRAMに保持することです。モデル例として DeepSeek V3 671B 総パラメータ671Bのうち、トークンごとに約37Bのパラメータのみをアクティブにするため、VRAMの節約は非常に大きくなります。
具体的には、従来の推論(vLLM、transformers)でDeepSeek V3をQ4で実行するには約400GBのVRAMが必要になるのに対し、KTransformersでは同じモデルを次の構成で実行できます:
- GPU : 24 GB VRAM (RTX 4090 または 3090)
- CPU RAM : 380から512GBのDDR5
- CPU :AMX対応のIntel Xeon、またはAMD EPYC Genoa(最適と推定)
このアプローチは直接的に競合しています llama.cpp およびその仕組み --n-gpu-layersですが、KTransformersはMoEアーキテクチャではさらに踏み込み、層全体をオフロードする代わりに、各エキスパートを適切なデバイスに振り分けます。
規模の目安として、このアプローチで利用可能になるMoEモデルをいくつか紹介します:
- DeepSeek V3 671B : VRAM Q4 ~400GB → 24GB GPU + 384GB RAMで実行可能
- DeepSeek R1 671B :構成は同じで、推論機能も備えています
- Kimi K2.5 : 1000Bパラメータ、約32Bがアクティブ
- Qwen 3 235B-A22B : 235Bで22Bがアクティブ
ハードウェアおよびソフトウェアの前提条件
起動前に KTransformersのインストール、お使いの構成を確認してください。このフレームワークは特にMoEアーキテクチャを対象としており、RAMとVRAMの間に特定のバランスが必要です。
DeepSeek V3 Q4_K_M の最低ハードウェア要件 :
- NVIDIA GPU :RTX 3090 / 4090 / 5090(24 GB)またはA6000(48 GB)。Compute Capability ≥ 8.0
- DDR5 RAM : 384 GB 以上、長文コンテキストには 512 GB が推奨されます
- CPU :Intel Xeon Sapphire Rapids(AMX)、Xeon Emerald Rapids、またはAMD EPYC 9004(推定)。Core i9-14900KなどのデスクトップCPUでも動作しますが、AMXはありません
- ストレージ : GGUFのウェイトを保存するためのNVMe Gen4で450GBの空き容量
- OS : Ubuntu 22.04 LTS または Debian 12(Windows WSL2 はサポートされていますが、20〜30%遅くなる可能性があります。確認が必要です)
ソフトウェアスタック :
- Python 3.11
- CUDA 12.4 または 12.6
- CUDA対応でコンパイルされたPyTorch 2.4以降
- gcc-11以上(AMX用はgcc-13)
- CMake 3.25以上
このアプローチを従来のすべてGPU方式と比較するには、私たちの vLLMガイド H100クラスタにおけるテンソル並列化を詳細に説明しています。
ステップバイステップのインストール手順
La KTransformersのインストール 厳密な手順に従います。CUDA/PyTorchのバージョンが指定から少しでも外れると、CPUカーネルのコンパイルが失敗します。
ステップ1 — Pythonの隔離環境 :
conda create -n ktrans python=3.11
conda activate ktrans
conda install -c conda-forge libstdcxx-ng
ステップ2 — CUDA対応のPyTorch :
pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu124
pip install packaging ninja cpufeature numpy
ステップ3 — クローンとコンパイル :
git clone https://github.com/kvcache-ai/ktransformers.git
cd ktransformers
git submodule update --init --recursive
bash install.sh
スクリプト install.sh CPUカーネル(llamafile、および検出された場合はAMX)をコンパイルし、ローカルのwheelをインストールします。コンパイルには、CPUによって10〜20分かかります。
ステップ4 — モデルの重みのダウンロード :
KTransformers は GGUF ファイル(量子化)を消費します llama.cpp。たとえば、 DeepSeek-V3-Q4_K_M.gguf depuis Hugging Face :
huggingface-cli download unsloth/DeepSeek-V3-GGUF \
--include "DeepSeek-V3-Q4_K_M*" \
--local-dir ./models/deepseek-v3-q4
ステップ5 — 推論の実行 :
python -m ktransformers.local_chat \
--model_path deepseek-ai/DeepSeek-V3 \
--gguf_path ./models/deepseek-v3-q4 \
--cpu_infer 48 \
--max_new_tokens 1024
パラメータ --cpu_infer CPUの専用スレッド数に該当します。これを (cores physiques - 2).
一般消費者向けGPUで測定した性能
以下の数字は、 公式ベンチマーク KTransformers v0.2 およびコミュニティからのフィードバック。 671BのローカルLLM Q4_K_Mで量子化:
- RTX 4090 + Xeon Gold 6454S (AMX) : 13.6 tok/s のプリフィル、14 tok/s のデコード (DeepSeek V3)
- RTX 4090 + i9-14900K (AMXなし) :推定デコード速度8 tok/s
- RTX 3090 + EPYC 9354 :デコード速度は推定10トークン/秒(RAMの帯域幅に応じて確認が必要)
比較のため、 DeepSeek R1 Distill Llama 70B 2× RTX 4090でフルGPU動作時、25〜30 tok/sに達します。絶対速度は速いものの、蒸留モデルは推論ベンチマークにおいて671Bフルモデルに劣ります。
品質ベンチマーク(DeepSeekの公式レポート) :
- DeepSeek V3 671B : MMLU 88.5、HumanEval 82.6、MATH-500 90.2
- DeepSeek R1 671B : AIME 2024 79.8、MATH-500 97.3、Codeforces 96.3 パーセンタイル
- Qwen 3 235B-A22B :MMLU-Proは推定73、HumanEvalは88で要確認
品質と速度のバランスを検証するには、 DeepSeek R1 vs Llama 3.3 70B.
対応モデルおよび制限
すべてのMoE型LLMがネイティブにサポートされているわけではありません。KTransformersは、アーキテクチャごとにYAML形式の最適化リストを管理しています。現在のカタログでは:
ネイティブサポートが確認済み :
- DeepSeek V3 671B (MoE、有効パラメータ数37B)
- DeepSeek R1 671B (MoE、有効パラメータ数37B)
- DeepSeek V3.2 (685B, MoE)
- Mixtral 8x22B Instruct (141B、8エキスパート × 22B)
- Qwen 3 235B-A22B
対応作業中または実験的なサポート :
- Kimi K2.5 et Kimi K2.6 (DeepSeekに似たアーキテクチャのため、動作すると考えられます)
- GLM-5.1 (744B MoE、要確認)
- ERNIE 4.5 300B-A47B
サポートされていません (密なアーキテクチャで、オフロードするメリットがない):
- Llama 3.1 405B Instruct — 代わりに、マルチGPU構成のvLLMを使用してください
- Qwen 2.5 72B Instruct — 2台のRTX 4090でフルGPU利用
実用上の最大コンテキスト長は、KVキャッシュに使えるRAM容量によって制限されます。DeepSeek V3で32Kトークンを扱う場合は、追加で約30 GBを見込んでください。64Kトークンを超えると、スループットが大幅に低下します。
FAQ
Q:KTransformersはApple Silicon搭載のMacで動作しますか?
いいえ。フレームワークは GPU カーネルに CUDA、CPU x86 カーネルに AVX-512/AMX を依存しています。Mac Mシリーズでは代わりに llama.cpp MetalまたはMLXで使用可能です。当社の Mac用LLMガイド では代替案を詳しく説明しています。512GBのM3 Ultraでは、DeepSeek V3 Q4をオフロードせずにネイティブで実行でき、速度は推定18〜20トークン/秒です。
Q:llama.cppのオフロードモードとどのような違いがありますか?
llama.cpp はレイヤー単位でオフロードします(--n-gpu-layers N), デンシモデルにも適用可能です Llama 3.3 70B Instruct. KTransformersはオフロードを実行します 個々のエキスパート MoE の場合、これは DeepSeek V3 において、トークンごとに 256 個のエクスパートのうち 8 個のみがアクティブになるため、はるかに効率的です。典型的な利点: 同等のハードウェア上で DeepSeek V3 において llama.cpp より 3〜5 倍高速です。
Q:KTransformersを使ってファインチューニングは可能ですか?
いいえ、このフレームワークは推論専用です。MoEをファインチューニングするには、DeepSpeed-MoEまたはUnsloth(70B未満のデンスモデルに限定)をご検討ください。KTransformersは動的LoRAにもQLoRAにも対応していません。70Bモデルを調整したい場合は、代わりに次を利用してください: Llama 3.1 Nemotron 70B RTX 4090でUnslothをQLoRA 4ビットで使用
Q:一般向けGPUを使ったDeepSeek V3の構成には、いくらかかりますか?
推定予算(2026 年):RTX 4090 中古 1500 ユーロ、サーバー用マザーボード W790 または EPYC SP5 800 ユーロ、CPU Xeon w7-2495X 2200 ユーロ、DDR5 ECC 384 GB 3000 ユーロ、NVMe 2 TB 200 ユーロ、電源 + ケース 400 ユーロ。合計:約 8000 ユーロで 1 つの 671BのローカルLLM。フル精度では不十分な単体のH100 80 GBの約30,000€と比較できます。
Q:OpenAI互換のサーバーモードは利用できますか?
はい、v0.2以降から対応しています。実行してください。 ktransformers --server_port 10002 --model_path ... --gguf_path ... および、OpenAI クライアントを指すように設定してください http://localhost:10002/v1。Open WebUI、Continue.dev、LiteLLMと互換性があります。SSEストリーミングは動作しますが、関数呼び出しの対応はまだ部分的です(バージョンに応じて確認が必要)。
Q : KTransformers と SGLang どちらが DeepSeek V3 に適していますか?
SGLang 高性能マルチGPUデプロイメント(H100/H200)を対象にし、DeepSeek V3 8×H100で60以上tok/sを達成。KTransformersは単一GPUコンシューマ向けにRAMオフロードを実現し、10〜15tok/sを達成。選択肢はシンプルです:クラスタがある場合はSGLang、スタンドアロンPCがある場合はKTransformers。
結論
La KTransformersのインストール 8000€のスタンドアロンワークステーションで、MoEモデルのフロントエンド(DeepSeek V3, R1, Kimi K2.5)にアクセスできるようになります。対象となるH100クラスタ20万€の代わりです。妥協点は、60以上から10〜15トークン/秒に落ちるものの、フル精度モデルと同等の応答品質が得られます。あなたのVRAMおよびRAMに適したMoEモデルを特定するには、 quelllm.frのモデル選定ツール、または直接ご覧ください: 登録済みの249種類のLLMのカタログ ライセンスとサイズを比較するため