RTX 4070 Ti Super (16 GB)で利用可能なLLMは? ?
RTX 4070 Ti Superは、帯域幅672 GB/sの16 GB GDDR6Xを搭載したカードです。Gemma 4 12B(7.7〜8 GB)、gpt-oss 20BとMistral Small 24B(各14 GB)、およびサイズが約14 GBまでのすべてのモデルをVRAMに読み込めます。4070シリーズで12 GBを超える唯一のカードで、帯域幅はRTX 4060 Ti 16 GBの2倍を超えます。5.3 GBのモデルでは、理論上の上限は約127トークン/秒に達します。
RTX 4070で動かすローカルLLMを探していると、よく似た4種類のカードが見つかります。4070、4070 Super、4070 Ti、4070 Ti Superです。16GBを搭載しているのは、そのうち一つだけです。このガイドでは、このメモリ容量と256ビットのバスで何が可能になるのか、何が依然としてできないのか、そしてRTX 4080 SuperやRTX 5070 Tiと比べてこのカードがどのような位置づけになるのかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5070 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 4070 Ti SuperでローカルLLMを実行:16 GBでできること
RTX 4070 Ti Superは、Q4形式の4Bから24Bまでのモデルを難なく動作させます。256ビットバスに16 GBのGDDR6Xを備え、帯域幅は672 GB/s、NVIDIAによるとCUDAコアは8,448個です。この構成により、8 GBや12 GBのすべてのGPUを上回ります。Gemma 4 12Bはコンテキストに十分な余裕を持って収まり、gpt-oss 20BとMistral Small 24B(それぞれ14 GB)はVRAMに約2 GBの余裕を持って収まります。また、5 GBから8 GBのモデルは、帯域幅の上限に近い状態で動作します。収まらないのは次の段階です。Qwen 3.5 27Bは17 GBで、このGPUの容量を超えます。したがって、4070 Ti Superは30Bモデル向けではなく、それ以下のモデルにおいて最もバランスの取れたGPUの一つです。
- アーキテクチャ
- Ada LovelaceアーキテクチャのAD103チップ。RTX 4080と同じチップですが、有効なユニット数は少なくなっています。
- メモリ
- 16 GBのGDDR6X、256ビットバス、Wikipediaによると672 GB/sの帯域幅です
- 計算
- NVIDIA の製品ページによると、CUDA コアは 8,448 基、Tensor Core は第4世代です。
- 消費電力
- 総グラフィックス電力は285 Wです。NVIDIAは、PC全体に必要な電源ユニットの最低容量を700 Wとしています。
#4070、4070 Super、4070 Ti、4070 Ti Super:どのモデルがLLMに適していますか?
4枚のカードは同じシリーズ名を冠していますが、LLM 用途では同等ではありません。そのうち3枚は VRAM が 12 GB に限られ、16 GB の VRAM と 256 ビットのバスを備えるのは Ti Super だけです。ローカル AI では、この違いが純粋な演算能力よりも重要です。カードで実行できるモデルが、この違いによって決まるためです。
| カード | メモリ | バス | CUDAコア | 消費電力 |
|---|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 256ビット | 8 448 | 285 W |
| RTX 4070 Ti | 12GB GDDR6X | 192 ビット | 7 680 | 285 W |
| RTX 4070 Super | 12GB GDDR6X | 192 ビット | 7 168 | 220 W |
| RTX 4070 | 12 GB GDDR6 または GDDR6X | 192 ビット | 5 888 | 200 W |
Wikipediaによると、RTX 4070 Tiの帯域幅は504 GB/sで、Ti Superは672 GB/sです。通常のRTX 4070について調べていた場合は、専用ページで12 GB版を扱っています。いずれにも共通する点として、12Bモデルはメモリに収まりますが、14 GB以上のモデルには16 GBが必要です。
#16 GB に収まるモデル
| モデル | サイズ | 16 GBでの余裕 | 判定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 10.7GB | 非常に大きな余裕:長いコンテキストに対応 |
| Gemma 4 12B | 7.7~8.0 GB | 8 GB | 快適 |
| gpt-oss 20B | 14 GB | 2 GB | メモリに収まるが、コンテキスト長には注意 |
| Mistral Small 24B | 14 GB | 2 GB | メモリに収まるが、コンテキスト長には注意 |
| Devstral Small 2 24B | 15 GB | 1 GB | かろうじて収まるが、コンテキストは非常に短くする必要がある |
| Qwen 3.5 27B | 17 GB | 否定 | 収まりません |
14 GB と 15 GB のモデルは、コンテキストキャッシュにほとんど余裕を残していません。Ollama はデフォルトで 4 096 トークンを使用しますが、これは問題ありません。しかし、16 000 トークンには K/V キャッシュの量子化が必要です。コードモデルである Devstral Small 2 は限界に近く、15 GB ではコンテキストにほとんど何も残りません。コード処理には、16 GB 環境では Mistral Small 24B またはより小さいモデルでより長いコンテキストを使用する方が、より良い選択です。
#16 GBでは対応できないこと
このカードの容量を超えるモデルには、3つの系統があります。まず、Q4の27B〜35Bモデルです。OllamaによるとQwen 3.5 27Bは17 GB、Qwen 3.5 35Bは24 GBで、Gemma 4 26Bは16〜19 GBです。次に70Bモデルで、このサイトの目安では重みだけで約40 GBになります。そして、コンテキスト長を最大まで使う長コンテキストモデルです。公称コンテキスト長が256,000トークンの8 GBのモデルは、キャッシュをすべて保持すると決して収まりません。こうした場合は、VRAM 24 GBのカード、ユニファイドメモリ搭載のMac、または専用マシンに移行してください。ハードウェアのページでこれらの選択肢を比較しています。
#インストールとVRAMへの配置の確認
- 01ドライバー最近の GeForce カードで Ollama を使うには、NVIDIA ドライバー 550 以降が必要です。nvidia-smi でバージョンを確認してください。
- 02インストールOllamaをシステムにインストールしてください。CUDAの別途インストールは不要です。
- 03最初のテストまず ollama run mistral-small を実行して、16 GBを活用するモデルを試し、その後 ollama ps を実行してください。
- 04制御PROCESSOR列が100%GPUを表示している必要があります。そうでない場合はコンテキストを縮小してください。
q8_0形式のK/Vキャッシュは、デフォルトのf16形式と比べてメモリ使用量が約半分になり、Flash Attentionが必要です。この設定により、14 GBのモデルで、16 GBのメモリ上に16,000トークンのコンテキストを確保できます。
#期待できる速度:上限と第三者の測定値
ここでは、どの生成速度も独自の測定値としては示していません。生成速度の上限は、帯域幅を重みのサイズで割った値です。第三者の公開測定(llama.cpp上のLLaMA 3 8B、Q4_K_M、2024年5月)では、帯域幅716.8 GB/sのRTX 4080で106トークン/秒、上限の約68%を記録し、RTX 4070 Tiでは75%でした。4070 Ti Superの帯域幅は4080に近いため、速度の目安も近くなります。表では上限の70%を適用しています。
| モデル | モデル容量 | 上限 | 70 % での推定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 127トークン/秒 | 約89トークン/秒 |
| Qwen 3.5 9B | 6.6 GB | 102トークン/秒 | 約71トークン/秒 |
| Gemma 4 12B | 7.7 GB | 87トークン/秒 | 約61トークン/秒 |
| Mistral Small 24B | 14 GB | 48トークン/秒 | 約34トークン/秒 |
gpt-oss 20Bはエキスパートを使うモデルです。トークンごとに重みの一部だけを読み込むため、14 GBのデンスモデルよりも生成速度が高くなります。ここでは、出典のある数値は掲載していません。特に覚えておきたいのは、このGPUは8Bモデルでは高速ですが、24Bモデルではまずまずの速度になるという点です。
#4070 Ti Super と 4080 Super および 5070 Ti との比較
| カード | VRAM | 帯域幅 | 注記 |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | AD103チップは4080と同じです |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | 約 10 % の帯域幅の増加 |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 帯域幅の 33 % 増加 |
3つのカードはすべて16 GBを提供します。容量が同じであるため、対応するモデルのリストも同じです。変わるのは生成速度であり、これは帯域幅に比例します。4080 Superは約10%、5070 Tiは約3分の1速くなります。中古市場では、これらのスループットの差よりも価格差の方が重要であるため、比較するには価格追跡を確認してください。手頃な価格の中古4070 Ti Superは依然として優れた選択肢であり、新品の5070 Tiは保証と速度によって正当化されます。
#16GBを活用する用途
16 GBという容量で特に変わるのは、同時に何を動かせるかです。ローカルRAGでは、生成モデル、埋め込みモデル、検索で得られた抜粋を収められる十分な長さのコンテキストを組み合わせます。Gemma 4 12B(7.7〜8 GB)と小型の埋め込みモデルなら、全体を収めても数GBの余裕があります。コードアシスタントなら、8B〜12Bのモデルと16,000トークンのコンテキストで十分で、制約は一切ありません。Mistral Small 24Bのような14 GBのモデルは、カードのメモリをほぼ使い切ります。そのため、ほかのモデルと併用する選択肢ではなく、そのモデルだけを使う選択になります。
| 用途 | 構成 | 残りのメモリ |
|---|---|---|
| パーソナルRAG | Gemma 4 12B および軽量エンベディングモデル | コンテキスト用に約7GB |
| コードアシスタント | 8Bモデル、16,000トークンのコンテキスト、q8_0キャッシュ | 約9GB |
| 最高品質のチャット | Mistral Small 24Bのみ | 約2GB、短いコンテキスト |
複数人で利用する場合の落とし穴があります。Ollamaでは、同じモデルへの並列リクエスト数に応じて、確保されるコンテキストのサイズも増えます。そのため、14 GBのモデルを同僚3人で使うと、1人なら問題なく動作する場合でも、GPUのメモリ容量を超える可能性があります。16 GBのGPUを複数人で使う場合は、並列リクエスト数を制限するか、より軽量なモデルを選んでください。
#中古の4070 Ti Superを購入する際には、何を確認すべきか
このカードは2024年1月に発売されたため、中古品の多くは使用開始から3年未満ですが、過去の使用状況は何も保証されません。価格は毎週変動するため、このガイドに固定された金額ではなく、価格の推移を確認してください。購入前に、nvidia-smi でメモリが16 GBと表示されることを確認し、14 GBのモデルを実行して長時間の生成中に温度を監視し、ファンの音も聞いてください。請求書と、まだ有効なメーカー保証の提示を求めてください。これらはカードとともに引き継がれることがよくあります。
#2026年の結論
- 使い続けるのがおすすめの場合
- お使いのモデルは16 GBに収まります。24 GBが必要になるまでは、このカードを買い替える理由はありません。
- 次の場合は中古で購入してください
- 価格が新品の 5070 Ti より大幅に安い場合です。残りの保証期間、温度、ファンの騒音を確認してください。
- 24 GB を目指す場合に
- Qwen 3.5 27B 以上を望む場合:コンテキストを含む場合、いかなる設定でも 17 GB を 16 GB に収めることはできません。24 GB のカードなら、買い直す必要を避けることができます。
- 出典:NVIDIA公式仕様(RTX 4070ファミリー)
- 出典:Ollama公式FAQ(Flash Attention、K/Vキャッシュ)
- 出典:Ollama ライブラリ内の Mistral Small のサイズ
#よくある質問
RTX 4070 Ti SuperでMistral Small 24Bを実行できますか?+
RTX 4070 Ti と 4070 Ti Super では、LLMにおいてどのような違いがありますか?+
RTX 4070 Ti Super か RTX 5070 Ti か?+
LLM用にはRTX 4070 Ti Superと4080のどちらを選ぶべきですか?+
RTX 4070 Ti Super にはどのような電源が必要ですか?+
RTX 4070 Ti Super で Qwen 3.5 27B を実行可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。