01できること
- 2025年IMO金賞および2025年IOI金賞
- 高速な推論(本番環境で有効になるパラメータは30億個)
- Q4ならVRAM 24 GBのGPUに収まる
- NVIDIA Open Model License(商用利用可)
- —NVIDIA Open Modelライセンス(Apache/MITではありません)
- —Q4 で 32 GB 以上(モデル全体で 30B)
- —思考モードは生成時に遅くなる可能性があります
05インストール
インストール Ollama お使いのOS向け。ダウンロード前にモデルと量子化を確認してください。まずはコンテキストを4096トークンに設定し、その後、ollama ps でモデルの配置先を確認してください。以下にコマンドが記載されていることは、お使いのマシンでテストが実行された証拠にはなりません。
02必要なメモリ
このモデルを動作させるためのGPU VRAMの概算値(4kトークンのコンテキストオーバーヘッドを含む)。より長いコンテキストが必要な場合は、8kトークンごとに約1 GBを追加してください。
Nemotron Cascade 2 30B-A3Bに必要なハードウェアは?
Nemotron Cascade 2 30B-A3BをQ4量子化でローカル実行するには、VRAM 17 GB程度が必要です。比較候補:GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — システムとコンテキスト用のメモリに余裕を持たせ、推論エンジンがGPUに対応していることを確認してください。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
アフィリエイトリンク — 当サイトが報酬を受け取る場合がありますが、お客様に追加費用はかかりません。おすすめは独立した判断に基づいています。Amazonアソシエイトとして、QuelLLMは条件を満たす購入によって収益を得ます。
外出先では: Nemotron Cascade 2 30B-A3B 〜でも動作します RTX搭載ノートPC (24 GBのVRAM) →
03予想速度
Q4_K_M、コンテキスト 4k での毎秒生成トークン数。 20 t/sを超えると快適に読めます。 10 t/s未満では、試用にとどまります。
04パブリックベンチマーク
スコアはモデルカード、またはMMLU-Pro/コミュニティの資料から転載したものです。単位:正答率(%)。