熱管理の最適化を行うためには 推論
継続的に推論を実行する場合、最も費用対効果の高い熱対策は、GPUの消費電力に上限を設けることです。RTX 3090について公表された測定結果によると、350 Wから250 Wに下げても生成速度の低下は3%未満ですが、この閾値を下回ると速度が大幅に低下します。ファン、電圧、サーマルグリスに手を加える前に、まずnvidia-smiで、実際にカードの性能を制限している要因が温度なのか電力なのかを確認してください。
一日中リクエストに応答し続けるマシンは、ゲームを動かす場合とは異なる形で発熱します。負荷が継続し、メモリが酷使され、ケースも閉じた状態だからです。このページでは、GPUの速度が低下しているかを確認する方法、最初に試すべき設定、電力制限によって実際に毎秒のトークン数がどれだけ減るか、そしてメンテナンス(ほこりの除去、サーマルグリス、ケースの見直し)が本当の解決策となる場合について説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#推論サーバーで熱管理が重要な理由
GPUはチップを保護します。温度または電力がファームウェアが許可する範囲を超えると、クロック周波数を低下させます。このメカニズムはスロットリングと呼ばれます。nvidia-smiのドキュメントでは、その原因を区別しています。温度に関連するソフトウェアによるスローダウン(「sw thermal slowdown」)、周波数を2分の1以下にまで大幅に低下させるより激しいハードウェアによるスローダウン(「hw thermal slowdown」)、そして電力上限(「sw power cap」)です。これらの理由がすべて無効と表示されている場合、周波数は可能な限り高い値で動作します。
しきい値はカードごとに異なります。NVIDIAはこれを「GPU Slowdown Temp」、つまり冷却のためにハードウェアが動作周波数の最適化を始める温度と定義し、nvidia-smiで確認できるようにしています。そのため、「83 °C」のような一般的な数値を鵜呑みにせず、お使いのカードの値を確認してください。スロットリングが起きると速度が低下し、ファンが冷却を補う場合は騒音も増えます。長期的には、常に高温で動作するカードは劣化が早まりますが、この点について引用できる信頼性の高い数値は私たちにはありません。
#調整の前に測定する:グラフィックカードが実際に示すもの
出発点は、カードがスロットリング(性能低下)しているかどうか、そしてその理由を知ることです。NVIDIA カードでは、2つのコマンドで十分です。1つ目は、温度、電力、コア周波数、使用率を継続的に表示します。2つ目は、スロットリングの理由とモデルの温度閾値を詳細に表示します。
これらのコマンドは、アイドル時ではなく、数分間にわたる生成中に実行してください。重要な見方は2つあります。温度が上がる一方でコア周波数が下がり、熱による制限が有効になっている場合は、冷却の問題です。コア周波数が高いまま電力上限による制限が有効になっている場合は、カードが消費電力によって制限されています。さらに電力上限を下げても、生成速度に目立った変化はありませんが、発熱は減ります。
| 時間のかかる生成処理中に観察されること | 解釈 | 最初のアクション |
|---|---|---|
| 温度はサーマルスロットリングのしきい値未満で安定し、動作周波数も安定しています | 熱に関する問題なし | 何も変更しない。必要に応じて、騒音を抑えるために電力の上限を設定する。 |
| 温度がしきい値に達し、動作周波数が低下し、熱が制限の原因として表示されている | 冷却が不十分 | ケース内のエアフロー、ほこり、ファンカーブ |
| 動作周波数が低く、制限理由として「power cap」が有効になっている一方、温度は正常 | 電力上限に到達 | 正常。生成速度が不十分な場合にのみ上限を引き上げる |
| 最初のやり取りと10回目のやり取りの間の速度差 | 段階的な温度上昇 | 起動時ではなく、長時間負荷をかけて測定する |
#パワーリミット:最も効果的な設定
消費電力に上限を設ける方法は、電圧カーブを調整するより簡単で、元に戻すこともできます。メモリがボトルネックとなる推論では、あるしきい値までは性能低下が小さく、それを超えると急激に低下します。RTX 3090で270億パラメータの密なモデルを測定したrunaihomeのブログによると、消費電力を350 Wから250 Wへと100 W減らしても、カードの速度低下は3 %未満ですが、200 Wではコア周波数が急落し、速度が35 %低下します。
| 制限 | 生成への影響(実測) |
|---|---|
| 350W(デフォルト) | 参考 |
| 300 W | 基準値との差は3%未満 |
| 250 W | 31.7 t/s、基準値より低いものの、低下幅は3%未満 |
| 200 W | 20.6トークン/秒、つまり35%低下:越えてはいけない境界 |
RTX 4090について、同じブログはTom's Hardwareを引用しています。それによると、電力制限を70%(約315 W)に設定しても、約94%の性能が維持されます。これらの数値は二次情報源と特定のカードに基づくものなので、ご自身のカードにそのまま当てはめないでください。信頼できる方法は、長い生成でご自身の生成速度を測りながら、電力制限を25〜50 Wずつ下げ、速度が落ち込む前に下げるのをやめることです。
nvidia-smiのドキュメントによると、値はカードが報告する最小値と最大値の範囲内である必要があります。また、このコマンドはroot権限を必要とします。再起動後に、制限が依然として適用されているかを確認してください。もしその値がデフォルトに戻った場合は、起動時に再度適用するsystemdユニットを作成してください。
sudo systemctl enable --now nvidia-power-limit.service で有効にします。
#ファンカーブ:温度が上がりきってから急激に回転数を上げるより、早めに積極的に上げる
工場出荷時のファンカーブは静音性を優先しており、高温になるまではファンを低速で回し、その後、回転数を上げます。負荷が継続する場合は、より早い段階で回転数を上げ始めるカーブにすると、回転数の急上昇を避けられるため、同程度の騒音でカードの温度をより低く保てます。Windows では MSI Afterburner でカーブを調整できます。Linux では、AMD、NVIDIA、Intel の GPU を制御する GUI アプリケーションである LACT に、ファン制御機能も含まれています。
| 温度 | ファンの回転速度 |
|---|---|
| 50 °C | 40 % |
| 60 °C | 55 % |
| 70 °C | 75 % |
| 78 °C | 90 % |
| スロットリングが始まる温度より5 °C低い温度 | 100 % |
これらの値は調整の出発点であり、メーカーの推奨値ではありません。最後の段階は、お使いのグラフィックカードの「GPU Slowdown Temp」の値を基準に調整し、室内で許容できる騒音かどうかで結果を判断してください。macOSではAppleがファンを制御するため、ファンカーブの設定はありません。
#アンダーボルティング:より精密ではありますが、検証に時間がかかります
アンダーボルティングとは、より低い電圧で同じ動作周波数を実現し、発熱を減らすことです。WindowsではMSI Afterburnerの周波数・電圧カーブで設定します。Linuxでは、コアの周波数範囲を指定するnvidia-smiのオプションで周波数を固定する方法が一般的です。効果はカードによって異なります。チップごとに調整の余地があり、極端すぎる設定では、すぐには問題が出ず、後になってエラーやクラッシュが発生します。
- 01適切に動作する電力制限値から始めるまずは消費電力の上限設定から始めてください。これが最も安全に効果を得られる方法です。それでもカードが熱すぎる、または動作音が大きすぎる場合に限り、低電圧化を追加してください。
- 02最大クロック周波数を設定するコアの周波数を最大ブースト値未満に固定するため、たとえばnvidia-smi -lgcに続いてMHz単位の周波数範囲を指定します。
- 03長時間テストする少なくとも30分間、連続して生成を実行してください。不安定な場合は、CUDAエラー、ドライバーのクラッシュ、または一貫性のない出力として現れます。
- 04比較する同じモデルと同じプロンプトを使い、設定変更の前後で速度と温度を測定してください。その設定を維持するのは、速度の低下が無視できる場合だけにしてください。
- 05必要に応じて元に戻すクロック周波数をリセットする(nvidia-smi -rgc)か、再起動して工場出荷時の設定に戻してください。
#ケースとエアフロー:改善効果は温度差で測る
- 空気の通り道
- 前面から背面へ空気が滞りなく流れ、涼しい空気がグラフィックカードのファンに届くようにします。配線が空気の流れを妨げると、温度が上がります。
- フィルターとほこり
- 目詰まりしたフィルターは風量を低下させます。定期的に清掃し、グラフィックカードのヒートシンクのほこりも圧縮空気で取り除いてください。その際は、ファンが過剰な速度で回らないように、動かないよう固定してください。
- カード周辺のスペース
- マルチGPU構成で2枚のカードを密着させると、1枚目の温度が上がります。間隔を空けるか、側面にファンを追加してください。
- 環境
- 室温が20 °Cではなく30 °Cなら、その10 °Cの差がカードの温度にも上乗せされます。閉め切った収納内に置いたサーバーでは、カード自体の問題を考える前に、熱の問題があります。
設定を誤りなく評価するには、プロトコルを一定に保ちましょう。同じモデル、同じ長いプロンプト、同じ生成時間を使用し、一度に一つのパラメータのみを変更します。最大温度、コア周波数、平均スループットは、生成の開始時ではなく終了時に記録してください。冷たい状態のカードは、20分後の同じカードよりも常に良い数値を示すためです。比較が設定ではなく環境によって歪められないよう、同じ室温で測定を繰り返してください。
#サーマルグリスの塗り直し:リスクを伴う最終手段
数年が経過すると、中古のグラフィックスカードのサーマルグリスやサーマルパッドが乾燥していることがあります。その兆候は、ケースが清潔でも、同じ負荷で購入時より温度が高くなることです。グラフィックスカードを分解すると保証が失われ、パッドやチップを損傷するおそれがあり、適切な手順で作業する必要があります。分解は、ほこり、エアフロー、電力制限、周囲の温度といった、より単純な原因を除外してからにしてください。自信がなければ専門業者に任せ、その費用を交換用カードの費用と比較してください。
#ノートパソコンとMac:調整のポイントが変わります
ノートパソコンでは、電圧や熱伝導グリスを調整することはありません。有効なのは電源モードの変更です。Appleは2つのモードを説明しています。低電力モードは、macOS Sequoia 15.1以降では、ファンによる冷却を行うモデルでファンの騒音も抑えます。高出力モードは、非常に負荷の高い処理でも性能を維持できるよう、ファンをより高速に回転させるモードですが、その分騒音が増えます。ファンのないMacBook Airで使える手段は、熱を逃がすスタンド、AC電源の使用、より小さいモデルの選択だけです。
- ローカルAI向けGPUの選び方
- AI用PCの構成(32 GB)
- llama.cppによるマルチGPUセットアップ
- ソース:nvidia-smi ドキュメント
- 出典:電力制限の測定結果(runaihome)
- ソース:Apple、Macの電源モード
#よくある質問
グラフィックスカードは何度になると動作速度が低下し始めますか?+
消費電力に上限を設けると、推論速度は大きく低下しますか?+
GPUでスロットリングが発生しているかどうかは、どう確認できますか?+
グラフィックカードのサーマルグリスを交換する必要はありますか?+
低電圧化と電力制限:どちらを選べばよいですか?+
MacBook にはローカルAI用の熱管理設定がありますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。