NVIDIA DGX Spark:128GBのAIミニPCが、 GPU
DGX Spark は、デスクトップでのローカル AI に向けた NVIDIA の挑戦です。Grace Blackwell チップ、128 GB のユニファイドメモリ、そしてテーブルの片隅に収まるサイズを備えています。仕様上は、どの一般向け GPU でも単体では読み込めないモデルを動かせます。このガイドでは、DGX Spark で LLM を実際に使う場合について、メモリに収まるモデル、実際の推論速度、RTX 5090 や Mac Studio との比較を整理し、このミニ PC を手元に置く価値があるかを判断する材料を示します。
マシンを選んでいるところですか? 予算別のおすすめ → · 当社の製品ページ NVIDIA DGX Spark →
このセットアップの場合: NVIDIA DGX Spark.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#DGX Sparkとは何か
DGX Spark は、NVIDIA GB10 Grace Blackwell スーパーチップを中心に構成されたコンパクトなコンピューターです。同じチップ上に Blackwell GPU と ARM ベースの Grace CPU(20 コア)を組み合わせ、両者は共有の 128 GB LPDDR5X メモリプールに接続されています。このユニファイドメモリアーキテクチャは Apple Silicon と同じ設計思想であり、ローカル AI 用途でこのマシンが魅力的な理由です。
従来のグラフィックカードではVRAMが独立しているのに対し(一般消費者向けでは最大24GBまたは32GB)、DGX SparkではGPUが128GBのメモリに直接アクセスできます。つまり、GPUを使う誰もが直面する「モデルがVRAMに収まるか?」という制約がほぼなくなります。制約となるのは容量ではなく、メモリ帯域幅です。
- チップ
- NVIDIA GB10 Grace Blackwell(GPU Blackwell + CPU ARM 20コア)
- メモリ
- 128GBの統合LPDDR5Xメモリ、CPUおよびGPUで共有
- 帯域幅
- ~273 GB/s (LPDDR5X)、実際のボトルネック
- ネットワーク
- 2台のSparkを連結し、非常に大規模なモデルの実行を目指すためのConnectX(200 GbE)
- フォーマット
- デスクトップミニPC、約150W、マルチGPU搭載のタワーと比べて静音です
#128 GBのユニファイドメモリで可能になること
目安として、ローカル推論で最も一般的なQ4_K_M量子化のモデルに必要なVRAMの概算を示します。7Bは約5GB、14Bは約9GB、32Bは約19GB、70Bは約40GBに収まります。VRAMが32GBのRTX 5090には、70BのQ4モデル全体は収まりません。そのため、一部をCPU側にオフロードする必要があり、速度が大幅に低下します。
128GBのユニファイドメモリを搭載したDGX Sparkは、Q4、Q5、さらにはQ8の70Bモデルも余裕を持って読み込めます。長いコンテキスト(32kトークン以上)にも余裕があり、強い量子化を適用すれば、パラメータ数が100B以上のモデルも選択肢に入ります。この規模のモデルには、これまでハイエンドのMac Studioか、高価で電力消費の大きいマルチGPU構成が必要でした。
- 70B Q4(~40 GB)
- 快適で、コンテキストに大きな余裕があります
- 70B Q8(約75GB)
- 可能 — 大規模モデルにおいてほぼFP16の品質を実現
- 120BクラスのMoE(Q4)
- メモリに収まります。速度は帯域幅で決まります。
- 複数のモデルがロードされています
- 32Bと14Bを並列に使用してルーティングやマルチエージェントを実行
#動かせるモデル
DGX Spark の強みは 30B~120B の範囲にあります。これは、一般の GPU が VRAM の不足で制限される領域です。以下はモデルのファミリーごとの典型的な用途です。
- Qwen 3.8 27B
- 2026年を代表する汎用モデル(画像認識対応、コンテキスト長262k)。このマシンではQ8のフル品質で動作し、コンテキストにも十分な余裕があります。
- Qwen 3.6 35B-A3B / Qwen3-Coder 30B
- 推論とコーディングが高速な MoE モデルで、Q8 でも全体がメモリに収まります
- GLM 4.7 Flash (MoE 30B-A3B, MIT)
- エージェント用途に優れ、煩雑な調整なしで品質を落とさずにロード可能
- 100B以上の大きなMoEモデル(量子化済み)
- Mixture-of-Expertsアーキテクチャは、統合メモリの豊富さを最大限に活かします
- マルチモーダルモデル
- メモリ消費の大きいGemma 4とQwen 3.8(視覚+テキスト)も、妥協せずにメモリに収まります。
小型モデル(7B~14B)はもちろんDGX Sparkでも動かせますが、その用途にはもったいない選択です。RTX 4070やMac mini M4なら、はるかに安い費用で、より速く動かせます。このマシンを選ぶ理由があるのは、大型モデルを日常的に使う場合だけです。
#推論時の実際のパフォーマンス
ローカル推論において重要なのは二つの数値です。生成速度(トークン/秒、画面に表示される速度)と、プリフィル時間(最初のトークンまでの遅延、プロンプトの長さに依存します)。メモリ帯域幅は主に生成速度を左右します。
DGX Sparkでは、Q4の70Bモデルは通常、10トークン/秒程度の速度で生成されます。これは、流れに沿って読みながら快適にアシスタントとして利用するには十分ですが、高スループットのバッチワークロードには不十分です。より小さいモデル(14B〜32B)は、はるかに高い速度に達します。このプロファイルは、約273 GB/sの帯域幅と整合しており、これはDGX Sparkと、この点ではるかに速いGDDR7搭載カードを分ける壁です。
#DGX Spark と RTX 5090 の比較
これは最も違いが分かりやすい比較で、2つの設計思想が対照的に表れます。RTX 5090 は32 GB の GDDR7 VRAM を搭載し、メモリ帯域幅は約1,792 GB/s です。これは DGX Spark の約6〜7倍に相当します。32 GB に収まるものなら、トークン/秒では5090が Spark を圧倒します。
しかし、5090には明確な限界があります。約32 GBを超えるとCPUへオフロードする必要があり、性能が急落します。70B Q4(約40 GB)は、そのメモリに全体を収めることができません。一方、DGX Sparkは同じ70Bモデルを難なく処理できます。速度は遅いものの、モデル全体をメモリに収めたまま実行できます。選択の決め手は、作業に必要なメモリが32 GB未満に収まるかどうかです。
- 必要なメモリが32GB以下に収まる場合(Q4で約32Bまで)
- RTX 5090:はるかに高速で、幅広い用途に対応(ゲーム、レンダリング、CUDA)
- 70B以上を目指している
- DGX Spark:5090には収まらないモデルもメモリに収まります
- 消費電力/騒音
- DGX Spark:約150 Wで静音。一方、5090搭載のタワー型PCは発熱が大きく、騒音も大きい
- CUDAエコシステム全体
- どちらも対応しています。Sparkにはさらに、全体を通してDGX/NVIDIAのスタックが備わっています。
#DGX Spark と Mac Studio の比較
DGX Sparkの真のライバルはグラフィックスカードではなく、Mac Studioです。両者は、コンパクトで控えめな筐体に大容量のユニファイドメモリを搭載するという同じ発想に基づいています。対象とするユーザーも同じで、専用のマシンを組まずに大規模なモデルをローカルで動かしたい開発者です。
Mac Studio(M-Ultra)は最大512 GBのユニファイドメモリを搭載でき、上位構成ではメモリ帯域幅もより広いことが多いため、非常に大きなモデルで力を発揮します。強みはmacOS、Metal、そして成熟したエコシステム(Ollama、LM Studio、MLX)です。DGX Sparkの強みは、CUDAへのネイティブ対応です。パイプラインがCUDAライブラリ、TensorRT、NVIDIAのツールに依存しているなら、Sparkは本番サーバーと同じ技術に標準で対応しています。
- 最大メモリ容量
- Mac Studio 512 GBまで、DGX Spark 128 GB(2ユニットを連結することで拡張可能)
- ソフトウェアエコシステム
- Mac:Metal/MLXが成熟。Spark:CUDAにネイティブ対応し、NVIDIA製サーバーと共通の環境を利用できます。
- AIコードの移植性
- Sparkなら、クラウドやデータセンターのNVIDIA GPU向けに書かれたコードをスムーズに再実行できます
- オフィス用途
- Mac Studioは一通りの作業をこなせるワークステーションで、SparkはAI専用のステーションです
#このマシンにOllamaをインストールする
DGX SparkはLinuxベースのOS(Ubuntuから派生したDGX OS)で動作し、CUDAスタックがプリインストールされています。Ollamaは、NVIDIA GPUを搭載したほかのLinuxマシンと同様に動作します。デーモンがGPUを検出し、通常のポートでモデルを提供します。
- 01Ollama のインストール公式スクリプトを1つのコマンドで実行します。このスクリプトはsystemdサービスを設定し、CUDA経由でBlackwell GPUを自動検出します。
- 02GPUの検出を確認大きなモデルを起動する前に、GPUが正しく認識されていることを確認してください。そうでなければ、推論はCPU上で行われます。
- 03大規模モデルをダウンロードするメモリを活用するために、2026 年の大型 MoE モデルを品質を落とさずにダウンロードしてください(Q8 の Qwen3-Coder 30B、または 262k のコンテキストを備えたフラッグシップモデル Qwen 3.8 27B)。まさにこれが、このマシンの用途です。
- 04起動してインターフェースを接続するデーモンはデフォルトでhttp://localhost:11434で接続を待ち受けます。Open WebUIまたはLM Studioの接続先をこのアドレスに設定してください。
Ollamaのデーモンは、ポート11434で互換性のあるAPIを公開しています。メモリを活用するには、一般的なGPUでは単独で読み込めないモデルを優先し、メモリに余裕があるのでコンテキストウィンドウも広げてください。なお、Qwen 3.8 27Bは、デフォルトの推論設定では考えすぎる傾向があります。より直接的な回答を得るには、推論設定をlowモードに切り替えてください。
#1つのチップ、8台のマシン:認証済みクローン
NVIDIAはGB10をプラットフォーム化しました。自社のDGX Spark Founders Editionに加え、7社のメーカーが同じ認証済みの基盤を自社ブランドで販売しています。チップも128 GBのメモリも同じで、違いはストレージ、筐体、価格、販売チャネルにあります。
| マシン | メーカー | 要点 |
|---|---|---|
| DGX Spark Founders Edition | NVIDIA | 基準となる機種、約3,999ドル |
| Ascent GX10 | Asus | 価格面で最も優れた選択肢(約2,999ドル) |
| Veriton GN100 | Acer | ストレージ4 TBの単一SKU |
| AI TOP ATOM | Gigabyte | AI TOPソフトウェアパッケージと共に提供 |
| EdgeXpert MS-C931 | MSI | 産業・エッジ向けチャネル |
| Pro Max GB10 | Dell | 企業向けチャネル |
| ThinkStation PGX | Lenovo | ワークステーションチャネル |
| ZGX Nano | HP | ワークステーションチャネル |
大型モデルの利用を大きく変えるのが、内蔵のConnectXポートです。2台を接続することで、400Bクラスのモデルをローカルで動かせます。ほかの一般消費者向けマシンには、この機能はありません。
#よくある質問
DGX SparkのGB10とは、具体的にどのようなものですか?+
DGX Spark とそのAsus、Acer、Gigabyte版の間にはどのような違いがありますか?+
400B のモデルを本当に 2 台のマシンで動作させることができるのでしょうか?+
DGX SparkとStrix Halo搭載マシン、どちらを選ぶべきですか?+
GB10マシンはどのような人向けですか?+
#この形態はどのような人に向いているか
DGX Sparkは一般消費者向けのマシンではありません。その価値が特に大きいのは、VRAMの制約が日々の大きな問題となっている特定のユーザー層です。
- CUDAを使うAI開発者
- 本番環境の NVIDIA GPU 向けコードをローカルで試作し、移植時の想定外の問題を避ける
- 研究者およびR&Dチーム
- クラウドGPUの利用時間を予約せずに、軽量なファインチューニングと大規模モデルの推論を実行
- 70B+のパワーユーザー向け
- 一般向けGPUの24〜32 GBというメモリ容量の限界に、いつも突き当たっているユーザー
- 騒音や消費電力が気になるオフィス
- マルチGPU構成のマシンよりも、静かで消費電力の少ないワークステーション
逆に、ゲームをする場合、主に32B以下のモデルを動かす場合、または予算が限られている場合は、RTX 5090(あるいは4070/4080でも)やMac mini M4のほうが、はるかに優れた価格性能比を提供します。DGX Sparkを選ぶ理由があるのは、単純な処理速度よりも大容量メモリの必要性が優先される場合です。
#さらに詳しく
DGX Sparkは、このサイトですでに取り上げている代替製品と比較すると、より適切に評価できます。さらに検討を深めるには、次のガイドが役立ちます。
- RTX 5090 (32 GB)で使えるLLMは?
- 一般向けで最も高速なカードの詳しい比較で、処理速度と容量のどちらを重視するか判断するために役立ちます。
- Mac Studioで使えるLLMは?
- 最大512 GBのユニファイドメモリを搭載する、もう一つの大容量マシン。DGX Sparkの真のライバルです。
- ローカルAI向けGPUの選び方
- 購入前に必要なVRAM容量を把握し、各選択肢の位置づけを確認するために。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。