中級 11 分RTX 40

RTX 4070 Ti Super (16 GB)で利用可能なLLMは? ?

端的な回答

RTX 4070 Ti Superは、帯域幅672 GB/sの16 GB GDDR6Xを搭載したカードです。Gemma 4 12B(7.7〜8 GB)、gpt-oss 20BとMistral Small 24B(各14 GB)、およびサイズが約14 GBまでのすべてのモデルをVRAMに読み込めます。4070シリーズで12 GBを超える唯一のカードで、帯域幅はRTX 4060 Ti 16 GBの2倍を超えます。5.3 GBのモデルでは、理論上の上限は約127トークン/秒に達します。

RTX 4070で動かすローカルLLMを探していると、よく似た4種類のカードが見つかります。4070、4070 Super、4070 Ti、4070 Ti Superです。16GBを搭載しているのは、そのうち一つだけです。このガイドでは、このメモリ容量と256ビットのバスで何が可能になるのか、何が依然としてできないのか、そしてRTX 4080 SuperやRTX 5070 Tiと比べてこのカードがどのような位置づけになるのかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5070 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 4070 Ti SuperでローカルLLMを実行:16 GBでできること

RTX 4070 Ti Superは、Q4形式の4Bから24Bまでのモデルを難なく動作させます。256ビットバスに16 GBのGDDR6Xを備え、帯域幅は672 GB/s、NVIDIAによるとCUDAコアは8,448個です。この構成により、8 GBや12 GBのすべてのGPUを上回ります。Gemma 4 12Bはコンテキストに十分な余裕を持って収まり、gpt-oss 20BとMistral Small 24B(それぞれ14 GB)はVRAMに約2 GBの余裕を持って収まります。また、5 GBから8 GBのモデルは、帯域幅の上限に近い状態で動作します。収まらないのは次の段階です。Qwen 3.5 27Bは17 GBで、このGPUの容量を超えます。したがって、4070 Ti Superは30Bモデル向けではなく、それ以下のモデルにおいて最もバランスの取れたGPUの一つです。

アーキテクチャ
Ada LovelaceアーキテクチャのAD103チップ。RTX 4080と同じチップですが、有効なユニット数は少なくなっています。
メモリ
16 GBのGDDR6X、256ビットバス、Wikipediaによると672 GB/sの帯域幅です
計算
NVIDIA の製品ページによると、CUDA コアは 8,448 基、Tensor Core は第4世代です。
消費電力
総グラフィックス電力は285 Wです。NVIDIAは、PC全体に必要な電源ユニットの最低容量を700 Wとしています。

#4070、4070 Super、4070 Ti、4070 Ti Super:どのモデルがLLMに適していますか?

4枚のカードは同じシリーズ名を冠していますが、LLM 用途では同等ではありません。そのうち3枚は VRAM が 12 GB に限られ、16 GB の VRAM と 256 ビットのバスを備えるのは Ti Super だけです。ローカル AI では、この違いが純粋な演算能力よりも重要です。カードで実行できるモデルが、この違いによって決まるためです。

RTX 4070 ファミリー:LLM で重要な点(出典:NVIDIA)
カードメモリバスCUDAコア消費電力
RTX 4070 Ti Super16 GB GDDR6X256ビット8 448285 W
RTX 4070 Ti12GB GDDR6X192 ビット7 680285 W
RTX 4070 Super12GB GDDR6X192 ビット7 168220 W
RTX 407012 GB GDDR6 または GDDR6X192 ビット5 888200 W

Wikipediaによると、RTX 4070 Tiの帯域幅は504 GB/sで、Ti Superは672 GB/sです。通常のRTX 4070について調べていた場合は、専用ページで12 GB版を扱っています。いずれにも共通する点として、12Bモデルはメモリに収まりますが、14 GB以上のモデルには16 GBが必要です。

#16 GB に収まるモデル

RTX 4070 Ti Super向けモデル(Ollamaでのサイズ、モデルの重みのみ)
モデルサイズ16 GBでの余裕判定
Granite 4.2 8B5.3 GB10.7GB非常に大きな余裕:長いコンテキストに対応
Gemma 4 12B7.7~8.0 GB8 GB快適
gpt-oss 20B14 GB2 GBメモリに収まるが、コンテキスト長には注意
Mistral Small 24B14 GB2 GBメモリに収まるが、コンテキスト長には注意
Devstral Small 2 24B15 GB1 GBかろうじて収まるが、コンテキストは非常に短くする必要がある
Qwen 3.5 27B17 GB否定収まりません

14 GB と 15 GB のモデルは、コンテキストキャッシュにほとんど余裕を残していません。Ollama はデフォルトで 4 096 トークンを使用しますが、これは問題ありません。しかし、16 000 トークンには K/V キャッシュの量子化が必要です。コードモデルである Devstral Small 2 は限界に近く、15 GB ではコンテキストにほとんど何も残りません。コード処理には、16 GB 環境では Mistral Small 24B またはより小さいモデルでより長いコンテキストを使用する方が、より良い選択です。

#16 GBでは対応できないこと

このカードの容量を超えるモデルには、3つの系統があります。まず、Q4の27B〜35Bモデルです。OllamaによるとQwen 3.5 27Bは17 GB、Qwen 3.5 35Bは24 GBで、Gemma 4 26Bは16〜19 GBです。次に70Bモデルで、このサイトの目安では重みだけで約40 GBになります。そして、コンテキスト長を最大まで使う長コンテキストモデルです。公称コンテキスト長が256,000トークンの8 GBのモデルは、キャッシュをすべて保持すると決して収まりません。こうした場合は、VRAM 24 GBのカード、ユニファイドメモリ搭載のMac、または専用マシンに移行してください。ハードウェアのページでこれらの選択肢を比較しています。

#インストールとVRAMへの配置の確認

  1. 01
    ドライバー
    最近の GeForce カードで Ollama を使うには、NVIDIA ドライバー 550 以降が必要です。nvidia-smi でバージョンを確認してください。
  2. 02
    インストール
    Ollamaをシステムにインストールしてください。CUDAの別途インストールは不要です。
  3. 03
    最初のテスト
    まず ollama run mistral-small を実行して、16 GBを活用するモデルを試し、その後 ollama ps を実行してください。
  4. 04
    制御
    PROCESSOR列が100%GPUを表示している必要があります。そうでない場合はコンテキストを縮小してください。
16 GB 環境での長いコンテキスト(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

q8_0形式のK/Vキャッシュは、デフォルトのf16形式と比べてメモリ使用量が約半分になり、Flash Attentionが必要です。この設定により、14 GBのモデルで、16 GBのメモリ上に16,000トークンのコンテキストを確保できます。

#期待できる速度:上限と第三者の測定値

ここでは、どの生成速度も独自の測定値としては示していません。生成速度の上限は、帯域幅を重みのサイズで割った値です。第三者の公開測定(llama.cpp上のLLaMA 3 8B、Q4_K_M、2024年5月)では、帯域幅716.8 GB/sのRTX 4080で106トークン/秒、上限の約68%を記録し、RTX 4070 Tiでは75%でした。4070 Ti Superの帯域幅は4080に近いため、速度の目安も近くなります。表では上限の70%を適用しています。

RTX 4070 Ti Super(672GB/s)における理論的な上限
モデルモデル容量上限70 % での推定
Granite 4.2 8B5.3 GB127トークン/秒約89トークン/秒
Qwen 3.5 9B6.6 GB102トークン/秒約71トークン/秒
Gemma 4 12B7.7 GB87トークン/秒約61トークン/秒
Mistral Small 24B14 GB48トークン/秒約34トークン/秒

gpt-oss 20Bはエキスパートを使うモデルです。トークンごとに重みの一部だけを読み込むため、14 GBのデンスモデルよりも生成速度が高くなります。ここでは、出典のある数値は掲載していません。特に覚えておきたいのは、このGPUは8Bモデルでは高速ですが、24Bモデルではまずまずの速度になるという点です。

#4070 Ti Super と 4080 Super および 5070 Ti との比較

16GBのGPUを比較
カードVRAM帯域幅注記
RTX 4070 Ti Super16 GB GDDR6X672 GB/sAD103チップは4080と同じです
RTX 4080 Super16 GB GDDR6X736 GB/s約 10 % の帯域幅の増加
RTX 5070 Ti16 GB GDDR7896 GB/s帯域幅の 33 % 増加

3つのカードはすべて16 GBを提供します。容量が同じであるため、対応するモデルのリストも同じです。変わるのは生成速度であり、これは帯域幅に比例します。4080 Superは約10%、5070 Tiは約3分の1速くなります。中古市場では、これらのスループットの差よりも価格差の方が重要であるため、比較するには価格追跡を確認してください。手頃な価格の中古4070 Ti Superは依然として優れた選択肢であり、新品の5070 Tiは保証と速度によって正当化されます。

#16GBを活用する用途

16 GBという容量で特に変わるのは、同時に何を動かせるかです。ローカルRAGでは、生成モデル、埋め込みモデル、検索で得られた抜粋を収められる十分な長さのコンテキストを組み合わせます。Gemma 4 12B(7.7〜8 GB)と小型の埋め込みモデルなら、全体を収めても数GBの余裕があります。コードアシスタントなら、8B〜12Bのモデルと16,000トークンのコンテキストで十分で、制約は一切ありません。Mistral Small 24Bのような14 GBのモデルは、カードのメモリをほぼ使い切ります。そのため、ほかのモデルと併用する選択肢ではなく、そのモデルだけを使う選択になります。

16 GBでの3つの典型的な構成
用途構成残りのメモリ
パーソナルRAGGemma 4 12B および軽量エンベディングモデルコンテキスト用に約7GB
コードアシスタント8Bモデル、16,000トークンのコンテキスト、q8_0キャッシュ約9GB
最高品質のチャットMistral Small 24Bのみ約2GB、短いコンテキスト

複数人で利用する場合の落とし穴があります。Ollamaでは、同じモデルへの並列リクエスト数に応じて、確保されるコンテキストのサイズも増えます。そのため、14 GBのモデルを同僚3人で使うと、1人なら問題なく動作する場合でも、GPUのメモリ容量を超える可能性があります。16 GBのGPUを複数人で使う場合は、並列リクエスト数を制限するか、より軽量なモデルを選んでください。

#中古の4070 Ti Superを購入する際には、何を確認すべきか

このカードは2024年1月に発売されたため、中古品の多くは使用開始から3年未満ですが、過去の使用状況は何も保証されません。価格は毎週変動するため、このガイドに固定された金額ではなく、価格の推移を確認してください。購入前に、nvidia-smi でメモリが16 GBと表示されることを確認し、14 GBのモデルを実行して長時間の生成中に温度を監視し、ファンの音も聞いてください。請求書と、まだ有効なメーカー保証の提示を求めてください。これらはカードとともに引き継がれることがよくあります。

#2026年の結論

使い続けるのがおすすめの場合
お使いのモデルは16 GBに収まります。24 GBが必要になるまでは、このカードを買い替える理由はありません。
次の場合は中古で購入してください
価格が新品の 5070 Ti より大幅に安い場合です。残りの保証期間、温度、ファンの騒音を確認してください。
24 GB を目指す場合に
Qwen 3.5 27B 以上を望む場合:コンテキストを含む場合、いかなる設定でも 17 GB を 16 GB に収めることはできません。24 GB のカードなら、買い直す必要を避けることができます。

#よくある質問

FAQ
RTX 4070 Ti SuperでMistral Small 24Bを実行できますか?+
はい。Ollamaによるとモデルのサイズは14 GBで、カードのメモリ容量は16 GBです。コンテキストとシステム用に約2 GBが残ります。デフォルトの4,096トークンのコンテキストなら収まります。16,000トークンの場合は、Flash Attentionを有効にし、K/Vキャッシュをq8_0に設定して、キャッシュのメモリ使用量を約半分に減らしてください。
RTX 4070 Ti と 4070 Ti Super では、LLMにおいてどのような違いがありますか?+
Ti Superは256ビットのバスで16GBのメモリを備えていますが、Tiは192ビットのバスで12GBしかありません。Wikipediaによると、メモリ帯域幅は504GB/sから672GB/sに増加します。LLMではメモリ容量が最も重要です。Ti Superは、Tiのメモリには収まらない14GBのモデルを読み込めます。
RTX 4070 Ti Super か RTX 5070 Ti か?+
両方とも 16 GB なので、対応するモデルは同じです。5070 Ti のメモリ帯域幅は 896 GB/s で、4070 Ti Super の 672 GB/s に対して約 3 分の 1 高速です。5070 Ti は速く、新品で保証付きです。4070 Ti Super が合理的なのは、中古価格が明らかに安い場合に限られます。
LLM用にはRTX 4070 Ti Superと4080のどちらを選ぶべきですか?+
どちらもVRAMは16 GBです。4080 Superの帯域幅は、672 GB/sに対して736 GB/sで約10%多く、通常の4080は716.8 GB/sです。LLMでは差は小さいため、仕様表ではなく中古価格の差で選んでください。
RTX 4070 Ti Super にはどのような電源が必要ですか?+
NVIDIAは、グラフィックカードの総消費電力を285W、PC全体に必要な電源の最低容量を700Wとしています。品質の高い750Wの電源なら十分な余裕があります。コネクタも確認してください。カードにはPCIe 8ピンケーブル2本、または300W以上に対応したPCIe Gen 5ケーブル1本が必要です。
RTX 4070 Ti Super で Qwen 3.5 27B を実行可能ですか?+
VRAMだけには収まりません。Ollamaによるとモデルのサイズは17 GBで、カードのVRAMは16 GBです。一部をシステムRAMから読み込むことになり、その場合は生成速度が大幅に低下します。このモデルでは24 GBのVRAMを目安にしてください。16 GBのVRAMでは、14 GB以下のモデルを選んでください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。