中級 14 分Mini-PC

NVIDIA DGX Spark:128GBのAIミニPCが、 GPU

DGX Spark は、デスクトップでのローカル AI に向けた NVIDIA の挑戦です。Grace Blackwell チップ、128 GB のユニファイドメモリ、そしてテーブルの片隅に収まるサイズを備えています。仕様上は、どの一般向け GPU でも単体では読み込めないモデルを動かせます。このガイドでは、DGX Spark で LLM を実際に使う場合について、メモリに収まるモデル、実際の推論速度、RTX 5090 や Mac Studio との比較を整理し、このミニ PC を手元に置く価値があるかを判断する材料を示します。

マシンを選んでいるところですか? 予算別のおすすめ → · 当社の製品ページ NVIDIA DGX Spark →

著者 Samir K.·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: NVIDIA DGX Spark.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#DGX Sparkとは何か

DGX Spark は、NVIDIA GB10 Grace Blackwell スーパーチップを中心に構成されたコンパクトなコンピューターです。同じチップ上に Blackwell GPU と ARM ベースの Grace CPU(20 コア)を組み合わせ、両者は共有の 128 GB LPDDR5X メモリプールに接続されています。このユニファイドメモリアーキテクチャは Apple Silicon と同じ設計思想であり、ローカル AI 用途でこのマシンが魅力的な理由です。

従来のグラフィックカードではVRAMが独立しているのに対し(一般消費者向けでは最大24GBまたは32GB)、DGX SparkではGPUが128GBのメモリに直接アクセスできます。つまり、GPUを使う誰もが直面する「モデルがVRAMに収まるか?」という制約がほぼなくなります。制約となるのは容量ではなく、メモリ帯域幅です。

チップ
NVIDIA GB10 Grace Blackwell(GPU Blackwell + CPU ARM 20コア)
メモリ
128GBの統合LPDDR5Xメモリ、CPUおよびGPUで共有
帯域幅
~273 GB/s (LPDDR5X)、実際のボトルネック
ネットワーク
2台のSparkを連結し、非常に大規模なモデルの実行を目指すためのConnectX(200 GbE)
フォーマット
デスクトップミニPC、約150W、マルチGPU搭載のタワーと比べて静音です
i
データセンターの代替ではありません
DGX Spark は、プロトタイピング、軽めのファインチューニング、大規模モデルのローカル推論を想定しており、大規模な学習や高負荷でのサービス提供を目的としたものではありません。NVIDIA はこれを個人向けの AI 開発ワークステーションと位置づけています。

#128 GBのユニファイドメモリで可能になること

目安として、ローカル推論で最も一般的なQ4_K_M量子化のモデルに必要なVRAMの概算を示します。7Bは約5GB、14Bは約9GB、32Bは約19GB、70Bは約40GBに収まります。VRAMが32GBのRTX 5090には、70BのQ4モデル全体は収まりません。そのため、一部をCPU側にオフロードする必要があり、速度が大幅に低下します。

128GBのユニファイドメモリを搭載したDGX Sparkは、Q4、Q5、さらにはQ8の70Bモデルも余裕を持って読み込めます。長いコンテキスト(32kトークン以上)にも余裕があり、強い量子化を適用すれば、パラメータ数が100B以上のモデルも選択肢に入ります。この規模のモデルには、これまでハイエンドのMac Studioか、高価で電力消費の大きいマルチGPU構成が必要でした。

70B Q4(~40 GB)
快適で、コンテキストに大きな余裕があります
70B Q8(約75GB)
可能 — 大規模モデルにおいてほぼFP16の品質を実現
120BクラスのMoE(Q4)
メモリに収まります。速度は帯域幅で決まります。
複数のモデルがロードされています
32Bと14Bを並列に使用してルーティングやマルチエージェントを実行
→
メモリ容量と速度は別物
モデルを読み込むことと、高速に動かすことは別です。128 GBのメモリはモデルが収まることを保証しますが、トークン/秒を決めるのは約273 GB/sのメモリ帯域幅です。非常に大きなモデルでは、回答を読み進めるには十分な滑らかさで推論できますが、一気に大量のテキストが生成される速度は期待しないでください。

#動かせるモデル

DGX Spark の強みは 30B~120B の範囲にあります。これは、一般の GPU が VRAM の不足で制限される領域です。以下はモデルのファミリーごとの典型的な用途です。

Qwen 3.8 27B
2026年を代表する汎用モデル(画像認識対応、コンテキスト長262k)。このマシンではQ8のフル品質で動作し、コンテキストにも十分な余裕があります。
Qwen 3.6 35B-A3B / Qwen3-Coder 30B
推論とコーディングが高速な MoE モデルで、Q8 でも全体がメモリに収まります
GLM 4.7 Flash (MoE 30B-A3B, MIT)
エージェント用途に優れ、煩雑な調整なしで品質を落とさずにロード可能
100B以上の大きなMoEモデル(量子化済み)
Mixture-of-Expertsアーキテクチャは、統合メモリの豊富さを最大限に活かします
マルチモーダルモデル
メモリ消費の大きいGemma 4とQwen 3.8(視覚+テキスト)も、妥協せずにメモリに収まります。

小型モデル(7B~14B)はもちろんDGX Sparkでも動かせますが、その用途にはもったいない選択です。RTX 4070やMac mini M4なら、はるかに安い費用で、より速く動かせます。このマシンを選ぶ理由があるのは、大型モデルを日常的に使う場合だけです。

i
GB10:データセンター級のスーパーチップを自宅に
Spark の中核は GB10 Grace Blackwell です。20基の ARM コア(Cortex-X925 が10基、A725 が10基)が NVLink-C2C 接続で Blackwell GPU と一体化され、FP4 で約1ペタFLOP の演算性能と 128 GB のユニファイドメモリを備えています。これは文字どおり、GB200 サーバーのアーキテクチャを文庫本サイズに縮小したものです。完全な CUDA エコシステムを備えているため、「自宅で実験する」ことと「本番環境と同じようにデプロイする」ことを直接つなぐ唯一の橋渡しとなります。

#推論時の実際のパフォーマンス

ローカル推論において重要なのは二つの数値です。生成速度(トークン/秒、画面に表示される速度)と、プリフィル時間(最初のトークンまでの遅延、プロンプトの長さに依存します)。メモリ帯域幅は主に生成速度を左右します。

DGX Sparkでは、Q4の70Bモデルは通常、10トークン/秒程度の速度で生成されます。これは、流れに沿って読みながら快適にアシスタントとして利用するには十分ですが、高スループットのバッチワークロードには不十分です。より小さいモデル(14B〜32B)は、はるかに高い速度に達します。このプロファイルは、約273 GB/sの帯域幅と整合しており、これはDGX Sparkと、この点ではるかに速いGDDR7搭載カードを分ける壁です。

!
測定条件を考慮せずにトークン/秒の数値を比較しないでください
トークン/秒の数値は、モデルの正確な種類、量子化方式、コンテキスト長、推論エンジンと併せて初めて意味を持ちます。上記の値は判断の目安となる概算であり、保証ではありません。購入を決める前に、ご自身のワークロードで測定してください。

#DGX Spark と RTX 5090 の比較

これは最も違いが分かりやすい比較で、2つの設計思想が対照的に表れます。RTX 5090 は32 GB の GDDR7 VRAM を搭載し、メモリ帯域幅は約1,792 GB/s です。これは DGX Spark の約6〜7倍に相当します。32 GB に収まるものなら、トークン/秒では5090が Spark を圧倒します。

しかし、5090には明確な限界があります。約32 GBを超えるとCPUへオフロードする必要があり、性能が急落します。70B Q4(約40 GB)は、そのメモリに全体を収めることができません。一方、DGX Sparkは同じ70Bモデルを難なく処理できます。速度は遅いものの、モデル全体をメモリに収めたまま実行できます。選択の決め手は、作業に必要なメモリが32 GB未満に収まるかどうかです。

必要なメモリが32GB以下に収まる場合(Q4で約32Bまで)
RTX 5090:はるかに高速で、幅広い用途に対応(ゲーム、レンダリング、CUDA)
70B以上を目指している
DGX Spark:5090には収まらないモデルもメモリに収まります
消費電力/騒音
DGX Spark:約150 Wで静音。一方、5090搭載のタワー型PCは発熱が大きく、騒音も大きい
CUDAエコシステム全体
どちらも対応しています。Sparkにはさらに、全体を通してDGX/NVIDIAのスタックが備わっています。

#DGX Spark と Mac Studio の比較

DGX Sparkの真のライバルはグラフィックスカードではなく、Mac Studioです。両者は、コンパクトで控えめな筐体に大容量のユニファイドメモリを搭載するという同じ発想に基づいています。対象とするユーザーも同じで、専用のマシンを組まずに大規模なモデルをローカルで動かしたい開発者です。

Mac Studio(M-Ultra)は最大512 GBのユニファイドメモリを搭載でき、上位構成ではメモリ帯域幅もより広いことが多いため、非常に大きなモデルで力を発揮します。強みはmacOS、Metal、そして成熟したエコシステム(Ollama、LM Studio、MLX)です。DGX Sparkの強みは、CUDAへのネイティブ対応です。パイプラインがCUDAライブラリ、TensorRT、NVIDIAのツールに依存しているなら、Sparkは本番サーバーと同じ技術に標準で対応しています。

最大メモリ容量
Mac Studio 512 GBまで、DGX Spark 128 GB(2ユニットを連結することで拡張可能)
ソフトウェアエコシステム
Mac:Metal/MLXが成熟。Spark:CUDAにネイティブ対応し、NVIDIA製サーバーと共通の環境を利用できます。
AIコードの移植性
Sparkなら、クラウドやデータセンターのNVIDIA GPU向けに書かれたコードをスムーズに再実行できます
オフィス用途
Mac Studioは一通りの作業をこなせるワークステーションで、SparkはAI専用のステーションです
i
決め手になることが多い基準
本番環境のNVIDIA GPUで動かす予定のコードを試作する場合、DGX Sparkなら移植時の予想外の問題をなくせます。主に快適なローカル推論と汎用性の高いマシンを求めるなら、Mac Studioのほうが柔軟です。あとは帯域幅と予算の問題です。

#このマシンにOllamaをインストールする

DGX SparkはLinuxベースのOS(Ubuntuから派生したDGX OS)で動作し、CUDAスタックがプリインストールされています。Ollamaは、NVIDIA GPUを搭載したほかのLinuxマシンと同様に動作します。デーモンがGPUを検出し、通常のポートでモデルを提供します。

  1. 01
    Ollama のインストール
    公式スクリプトを1つのコマンドで実行します。このスクリプトはsystemdサービスを設定し、CUDA経由でBlackwell GPUを自動検出します。
  2. 02
    GPUの検出を確認
    大きなモデルを起動する前に、GPUが正しく認識されていることを確認してください。そうでなければ、推論はCPU上で行われます。
  3. 03
    大規模モデルをダウンロードする
    メモリを活用するために、2026 年の大型 MoE モデルを品質を落とさずにダウンロードしてください(Q8 の Qwen3-Coder 30B、または 262k のコンテキストを備えたフラッグシップモデル Qwen 3.8 27B)。まさにこれが、このマシンの用途です。
  4. 04
    起動してインターフェースを接続する
    デーモンはデフォルトでhttp://localhost:11434で接続を待ち受けます。Open WebUIまたはLM Studioの接続先をこのアドレスに設定してください。
Terminal — インストール
# Installer Ollama (Linux / DGX OS)
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier que le GPU Blackwell est détecté
nvidia-smi

# Tirer et lancer un gros MoE 2026 en pleine qualité (exploite la mémoire unifiée)
ollama run qwen3-coder:30b-a3b-q8_0

Ollamaのデーモンは、ポート11434で互換性のあるAPIを公開しています。メモリを活用するには、一般的なGPUでは単独で読み込めないモデルを優先し、メモリに余裕があるのでコンテキストウィンドウも広げてください。なお、Qwen 3.8 27Bは、デフォルトの推論設定では考えすぎる傾向があります。より直接的な回答を得るには、推論設定をlowモードに切り替えてください。

ターミナル — 長いコンテキスト
# Servir Qwen 3.8 27B avec un grand contexte depuis un Modelfile
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 131072
EOF

ollama create qwen38-128k -f Modelfile
ollama run qwen38-128k
→
2台のSparkを接続する
ConnectX 200 GbEネットワークポートを使うと、2台のDGX Sparkを接続してメモリ容量を合算し、128 GBを超えるモデルの利用を目指せます。これは、1台では足りなくなった場合にNVIDIAが想定しているアップグレード方法です。

#1つのチップ、8台のマシン:認証済みクローン

NVIDIAはGB10をプラットフォーム化しました。自社のDGX Spark Founders Editionに加え、7社のメーカーが同じ認証済みの基盤を自社ブランドで販売しています。チップも128 GBのメモリも同じで、違いはストレージ、筐体、価格、販売チャネルにあります。

8つのGB10認定システム(2026年8月)
マシンメーカー要点
DGX Spark Founders EditionNVIDIA基準となる機種、約3,999ドル
Ascent GX10Asus価格面で最も優れた選択肢(約2,999ドル)
Veriton GN100Acerストレージ4 TBの単一SKU
AI TOP ATOMGigabyteAI TOPソフトウェアパッケージと共に提供
EdgeXpert MS-C931MSI産業・エッジ向けチャネル
Pro Max GB10Dell企業向けチャネル
ThinkStation PGXLenovoワークステーションチャネル
ZGX NanoHPワークステーションチャネル

大型モデルの利用を大きく変えるのが、内蔵のConnectXポートです。2台を接続することで、400Bクラスのモデルをローカルで動かせます。ほかの一般消費者向けマシンには、この機能はありません。

#よくある質問

DGX SparkのGB10とは、具体的にどのようなものですか?+
「スーパーチップ」です。20コアのARM GraceプロセッサとBlackwell GPUは、連携して動作するように製造され、PCIeバスよりもはるかに高速なNVLink-C2Cで接続されており、128 GBのLPDDR5Xユニファイドメモリを共有します。FP4で約1ペタFLOPの性能を発揮し、NVIDIAのAIサーバーのアーキテクチャをミニPC規模で実現しています。
DGX Spark とそのAsus、Acer、Gigabyte版の間にはどのような違いがありますか?+
チップに違いはありません。8つのシステムはすべて、同じGB10と同じ128GBのメモリを搭載しています。違うのはストレージ(Acerでは最大4TB)、筐体、付属ソフトウェア、サポート、そして何より価格です。Asus Ascent GX10はFounders Editionより約1,000ドル安くなっています。
400B のモデルを本当に 2 台のマシンで動作させることができるのでしょうか?+
はい。これは公式に示されている用途です。ConnectX 200 Gb/sポートで接続した2台のユニットは、メモリを共有して400Bクラスのモデル(量子化された400B+クラスの非常に大規模なMoE)の推論を提供できます。一般消費者向けの製品ではこれが唯一の選択肢で、その上のクラスになると数万ユーロのサーバーになります。
DGX SparkとStrix Halo搭載マシン、どちらを選ぶべきですか?+
どちらも128GBのユニファイドメモリを備え、テキスト生成性能は同程度です(メモリ帯域幅が近いためです)。GB10はプロンプト処理、ファインチューニング、CUDAエコシステムで優位に立ち、Strix Haloは価格(半額程度になることが多い)、Windows、汎用性で優位に立ちます。当サイトの専用比較では、利用者のタイプごとにどちらが適しているかを判断しています。総合的な結論は引き分けです。
GB10マシンはどのような人向けですか?+
本番環境ではNVIDIA上にデプロイするものをローカルで試作したいAI開発者、ファインチューニングを行うチーム、そしてクラスタリングで非常に大きなモデルを動かしたい方に向いています。日常的なチャットやコーディング支援であれば、Strix Halo搭載マシンで、半分の価格で同程度の使い勝手が得られます。

#この形態はどのような人に向いているか

DGX Sparkは一般消費者向けのマシンではありません。その価値が特に大きいのは、VRAMの制約が日々の大きな問題となっている特定のユーザー層です。

CUDAを使うAI開発者
本番環境の NVIDIA GPU 向けコードをローカルで試作し、移植時の想定外の問題を避ける
研究者およびR&Dチーム
クラウドGPUの利用時間を予約せずに、軽量なファインチューニングと大規模モデルの推論を実行
70B+のパワーユーザー向け
一般向けGPUの24〜32 GBというメモリ容量の限界に、いつも突き当たっているユーザー
騒音や消費電力が気になるオフィス
マルチGPU構成のマシンよりも、静かで消費電力の少ないワークステーション

逆に、ゲームをする場合、主に32B以下のモデルを動かす場合、または予算が限られている場合は、RTX 5090(あるいは4070/4080でも)やMac mini M4のほうが、はるかに優れた価格性能比を提供します。DGX Sparkを選ぶ理由があるのは、単純な処理速度よりも大容量メモリの必要性が優先される場合です。

!
「魔法の数字」の落とし穴
「128 GB」という数字は魅力的ですが、8Bモデルを動かすためだけに借りないでください。このマシンを購入するなら、実際に可能になる用途、つまり70B〜120Bクラスのモデルをローカルで動かすために選んでください。そうでなければ、結局使わない容量に高額な費用を払うことになります。

#さらに詳しく

DGX Sparkは、このサイトですでに取り上げている代替製品と比較すると、より適切に評価できます。さらに検討を深めるには、次のガイドが役立ちます。

RTX 5090 (32 GB)で使えるLLMは?
一般向けで最も高速なカードの詳しい比較で、処理速度と容量のどちらを重視するか判断するために役立ちます。
Mac Studioで使えるLLMは?
最大512 GBのユニファイドメモリを搭載する、もう一つの大容量マシン。DGX Sparkの真のライバルです。
ローカルAI向けGPUの選び方
購入前に必要なVRAM容量を把握し、各選択肢の位置づけを確認するために。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。