Phi-4 14B対Qwen 3 14B:推論能力の比較

比較 Phi-4 と Qwen 3 14B の比較 は、MacやPCでセルフホストできる140億パラメータのモデルの中でも、特に意義のある比較の一つとして定着しています。この2つのモデルは、一方がMicrosoft、もう一方がAlibabaによるもので、数学的推論、コード、高度な理解という近い目標を掲げていますが、アーキテクチャと学習戦略は大きく異なります。本記事では、技術仕様、量子化方式ごとのVRAM要件、標準ベンチマーク(MMLU、AIME、HumanEval)のスコア、それぞれのライセンス、各モデルが優位に立つ用途を検討し、利用者が迷わず選べるようにします。


2つのアーキテクチャの紹介

Phi-4 は140億パラメータの密なモデルで、Microsoftが2024年12月に公開しました。その独自性は、アルゴリズムによって生成・フィルタリング・検証された合成データを大きく重視し、トークンあたりの有用な情報の密度を最大化する学習戦略にあります。 arXiv 2412.08905の技術報告書 このアプローチを詳しく説明し、適切に構築された合成コーパスによって、コンパクトなモデルが推論タスクで、はるかに大規模なアーキテクチャに匹敵できることを示しています。Phi-4には拡張推論モードが標準では備わっていません(自動的なchain-of-thoughtを有効にする機能はありません)が、学習データによって数学の問題やコードで優れた精度を発揮します。

Qwen 3 14B は140億パラメータの密なモデルで、Alibabaが2025年4月に公開しました。最大の特徴は、 ハイブリッド思考モード :専用パラメータを有効にすると、モデルは最終回答を生成する前に内部で推論の連鎖を組み立てるため、複数段階の問題や複雑な数学的証明で性能が向上します。このモードを使わない場合は、標準的な会話型LLMとして動作し、より高速でトークン消費も少なくなります。モデルの紹介ページはこちら: HuggingFace Qwen/Qwen3-14B.

両モデルは完全にオープンウェイトであり、ローカルでダウンロード可能で、これはまさに該当する内容です。 ローカルLLMナビ カタログでは、249モデルをVRAM仕様とライセンス情報とともに掲載しています。


量子化ごとのVRAMスペック

メモリフットプリントは、ローカル使用における選定の最初の基準です。以下の数字は、GGUF形式の14BクラスのDenseモデルに対する標準的な推定値であり、実装に応じて±5%の変動が可能です。詳細な計算については、 GGUFの量子化ガイド.

Phi-4 14B : - Q4_K_M :約9 GB — RTX 3090、RTX 4090、16 GBのユニファイドメモリを搭載したM2/M3 Proに対応 - Q5_K_M : 約11 GB — RTX 4090またはM3 Maxで快適に動作 - Q8_0 : ~15GB — 16GBのVRAMが必要 (RTX 4090、A4000) - FP16 :約28 GB — 16 GBのGPU 2基またはA100/H100が必要

Qwen 3 14B : - Q4_K_M :約9 GB — 必要なハードウェアの最低条件はPhi-4と同じ - Q5_K_M : ~11 GB - Q8_0 : 約15GB - FP16 : ~28 GB

インプリントはパラメータレベルで同一です。差異は コンテキストウィンドウ :Phi-4は16,384トークン、Qwen 3 14Bは128,000トークンに対応しています。長い会話や長大な文書では、Qwen 3 14BはKVキャッシュを保存するために、その長さに比例してより多くのVRAMを消費します。

推論速度について(推定値。実際に使用するハードウェアで要確認): - RTX 4090 で Q4_K_M : Phi-4 ~70トークン/秒、Qwen 3 14B ~65トークン/秒 - Apple M2 Pro 16GBでQ4_K_Mを使用 : Phi-4は約30トークン/秒、Qwen 3 14Bは約28トークン/秒

短いクエリでは差はわずかですが、Qwen 3 14Bのthinkingモードが有効になると、差が少し広がります。この場合、モデルが表示されない中間的な推論を生成するため、全体の生成時間が長くなるからです。


ベンチマーク:論理的推論、数学、コード

MMLU(多分野の一般知識): - Phi-4 14B : 84.8 % — ソース: arXivに掲載されたMicrosoftの技術報告 - Qwen 3 14B : ~85 % (推定値、思考モードなし)

MATH-500 (数学的推論) : - Phi-4 14B :80.4% — 技術報告書に基づく数値 - Qwen 3 14B thinking :要確認ですが、傾向としては標準モードに比べて顕著な向上が示されています

AIME 2025(数学コンテスト): - Phi-4 14B :予備段階のレベルの問題で堅実な性能を発揮(正確なスコアは要確認)- Qwen 3 14B thinking : ~65 %(推定)— thinkingモードによりパラメータの不足が一部補填されます

HumanEval(Pythonコード生成): - Phi-4 14B : 82,6 % - Qwen 3 14B : ~82 % (推定値)

GPQA Diamond(専門的な科学的推論): - Phi-4 14B : 56,1 % - Qwen 3 14B :要確認 — thinkingモードによってこのスコアの向上が期待されます

要点:Phi-4はHumanEvalとMATHで優位に立ち、追加の遅延もありません。Qwen 3 14Bはthinkingモードで多段階の推論タスクにおいて追いつくか上回りますが、その分、生成するトークン数が増えます。さらに深い推論が必要なタスクでは、 DeepSeek R1 671B オープンウェイトの参考モデル(Q4で約400GB)は、ハードウェア要件のためサーバー環境に限定されています。ローカルで利用可能な推論指向モデルの概要は、 quelllm.fr/meilleur-llm/raisonnement.


商業利用に関するライセンスおよび利用条件

Phi-4 14B は以下に従って配布されています MITライセンス。これは以下を意味します: - 商用利用は自由で、ロイヤリティは不要 - 改変の有無にかかわらず再配布が可能 - 派生物を公開する義務はない - 利用分野の制限はない

これは、オープンウェイトのエコシステムで最も制約の少ないライセンスの一つです。モデルの公式ページはこちらからご覧いただけます: HuggingFace microsoft/phi-4.

Qwen 3 14B は以下に従って配布されています Apache 2.0 ライセンス。これにより、以下の条件が適用されます:商用利用は自由、派生物では変更内容を明示する義務あり、すべての再配布でライセンスの明記が必要、Qwenの商標を使用する権利は付与されません。

実際には、業務用途の圧倒的多数において、Apache 2.0はMITと同程度に制約の少ないライセンスです。どちらのモデルも、特別な条件なしで商用アプリケーションに組み込めます。

比較の参考として: Qwen 2.5 72Bは、Alibabaのモデル系列における直接の前身で、より制約の多いQwen Licenseの対象でした。Qwen 3世代でApache 2.0に移行したことは、開発チームにとって具体的な改善です。


具体的なユースケース

次の条件に当てはまる場合は、Phi-4 14Bを選ぶ: - 主な用途は コード生成 または解説 高校からグランゼコール準備課程までのレベルの数学 — Phi-4は推論のオーバーヘッドなしに、迅速かつ正確に回答します。- La 遅延が低い は強い制約です:搭載型チャットボット、リアルタイムアシスタント、バッチ処理パイプライン。- プロジェクトは以下のものに基づいています 短いチャンクを用いたRAGパイプライン : 16,384トークンのウィンドウは、多数のドキュメントをパラグラフに分割した場合に十分です。チームはこれを評価しています 統合の容易さ : MIT ライセンス、デンスアーキテクチャ、モードパラメータの管理は不要です。

次の条件に当てはまる場合は、Qwen 3 14Bを選ぶ: - 作業には 多段階推論 : 数学的証明、法的分析、複雑な論理のデバッグ、計画作成。- プロジェクトでは、 長いコンテキストウィンドウ : 128,000トークンに対しPhi-4は16,384トークン — 長いドキュメント、トランスクリプト、全体のコードベースに適しています。 - アプリケーションはこれにより ハイブリッドモード :同じデプロイ済みモデルで、複雑なリクエストには深い推論を、簡単なリクエストには素早い応答を提供できます。 - 利用環境は 多言語 — Alibabaは幅広い多言語サポートに投資しており、英語以外の言語での性能は一般にPhi-4を上回ります。

よりコンパクトなモデルとの比較を理解するために、ページ Qwen 3 14B と Llama 3.1 8B の比較 は、メモリ容量が限られた構成について、別の視点から補足します。


FAQ

Q:2つのモデルは、RAM 16 GBのMacで動作しますか?

はい。Q4_K_M(約9GB)での量子化において、Phi-4 14B および Qwen 3 14B は16GBの統合メモリを備えたMacで両方実行可能です。Phi-4は、より狭いコンテキストウィンドウを持つため、短い会話においてはやや反応が速くなります。Qwen 3 14B は、コンテキストが20,000トークンを超える場合により多くのメモリを消費し、16GBでは遅延を引き起こす可能性があります。

Q:Qwen 3 14B の「thinkingモード」はデフォルトで有効ですか?

いいえ。ほとんどのローカルインターフェース(llama.cpp、LM Studio)では、thinkingモードがデフォルトで無効になっています。モードを有効にするには、 /think システムプロンプト内で、または使用するインターフェースの専用設定を通じて。明示的に有効化しなければ、Qwen 3 14Bは通常のデンスLLMとして動作し、標準ベンチマークではPhi-4と同程度の性能を示しますが、より長いコンテキストウィンドウという利点があります。

Q:本番環境のRAGパイプラインには、どちらを選ぶべきですか?

Qwen 3 14Bは、長いコンテキストを使うRAG(128,000トークン)により適しています。Phi-4は、短いチャンク(8,000トークン未満)を使うRAGパイプラインに非常によく適しており、より速い推論速度が小さなコンテキストウィンドウを補います。したがって、決め手となるのは、インデックス化するテキストの各部分の長さと、各リクエストに再投入するチャンクの数です。

Q:これらのモデルを商用アプリケーションで使用できますか?

はい、大きな制限はありません。Phi-4はMITライセンス、Qwen 3 14BはApache 2.0ライセンスで、どちらもロイヤリティの支払いなしに商用利用、再配布、ファインチューニングが認められています。ただし、モデルを別の名称で再配布する場合や、パッケージ製品に組み込む場合は、Apache 2.0の条件を注意深く読むことをおすすめします。

Q:14Bモデルの限界に達した場合、オープンウェイトの代替モデルには何がありますか?

ローカルで利用できる次の上位モデルは、 Qwen 2.5 72B (Q4で約42 GB、Qwenライセンス)。大規模モデルによる純粋な推論では、 DeepSeek R1 671B (Q4で約400 GB、MITライセンス)は、引き続きオープンウェイトモデルの指標となる存在ですが、サーバーインフラが必要です。 ローカルLLMナビ カタログ は、より上位のモデルへの移行を容易にするため、249モデルとそれぞれの正確なVRAM要件を掲載しています。


結論

対決 Phi-4 と Qwen 3 14B の比較 普遍的な優勝者を示さないもので、Phi-4 14B は高速なコード生成、数学処理、および短いコンテキストにおける用途において合理的な選択です。MIT ライセンスで制限がありません。Qwen 3 14B は深層推論や長文の処理が必要な場合に選ばれ、Thinking モードと 128,000 テキストトークンのコンテキストを活用しています。両モデルは VRAM 使用量が同様(Q4 で約 9 GB)であり、許容的なライセンスを備えています。正確にご使用のハードウェアおよびメモリ制限に合ったモデルを特定するには、以下の情報を参照してください。 quelllm.frのモデル選定ツール またはローカルで探索してください 全モデルのカタログ.

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.