ローカルでFalcon H1:Mambaのハイブリッドモデルが導入された アラブ首長国連邦
Falcon H1 は、アブーダビの Technology Innovation Institute(TII)が提供するオープンウェイトのモデルファミリーで、各ブロックで従来のアテンションと Mamba 層を組み合わせた TII 初のモデルファミリーです。このガイドでは、このハイブリッドアーキテクチャが何を変えるのか、VRAM 容量に応じてどのサイズの Falcon H1 をローカルにインストールすべきか、長いコンテキストでのメモリ削減効果をどう測定するか、そして Ollama 環境の Mistral Small や Qwen3 を Falcon H1 に置き換える価値があるかを説明します。
#なぜFalcon H1に注目するのか
2023年に登場した初期のFalconは、オープンウェイトモデルの分野で存在感を示しましたが、その後Llama、Mistral、そしてQwenに引き離されました。アブダビのTechnology Innovation Institute(TII)が2025年5月に公開したFalcon H1は、方針を転換しています。従来型のTransformerを追いかけるのではなく、TIIは異なるアーキテクチャを出発点に、アテンションと状態空間モデル(Mamba-2)を組み合わせ、2倍の大きさの競合モデルにも引けを取らないコンパクトなモデルを実現しました。
ローカル利用での利点は三つあります。ラインナップは、Raspberry Pi や古いノートPC向けの5億パラメータから、RTX 4090 やユニファイドメモリ搭載の Mac 向けの340億パラメータまで、あらゆる構成をカバーしています。公表されているコンテキスト長は256,000トークンに達し、ハイブリッドアーキテクチャにより、従来のトランスフォーマーでは VRAM を使い切ってしまう条件でも、ローカルで実際に活用できます。さらに、Falcon H1 はフランス語やアラビア語を含む18言語で直接学習されているため、英語や中国語を中心としたモデルに頼らずにフランス語のテキストを扱うための有力な候補です。
#AttentionとMambaのハイブリッドを簡潔に解説
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
従来のTransformerは、全面的にアテンション機構に依存しています。新しいトークンを生成するたびに、モデルはコンテキスト全体を読み直し、過去の各トークンについて一対のベクトルを保持します。これが、よく知られているKVキャッシュです。このメモリ使用量は、会話や文書の長さに比例して増えます。長いレポートを読み込んだときにグラフィックカードのメモリ容量を超えてしまう原因は、モデルの重みではなく、このキャッシュです。
Mambaは、状態空間モデル(state space models)という別の系統に属します。Mambaの層は過去の情報を読み直しません。代わりに、それまでの情報を要約した固定サイズのリカレント状態を維持します。従来のリカレントネットワークを現代化したような仕組みです。トークンあたりのメモリ使用量は一定で、コンテキストの長さにかかわらず処理速度も安定しています。よく知られている代償は、遠く離れた箇所の細部を思い出す精度が低いことです。純粋なMambaモデルは、40ページ目に埋もれた特定の数値を正確に取り出すのが苦手です。
ハイブリッドモデルは、両者の長所を兼ね備えることを目指しています。IBM Granite 4やJambaがMamba層とアテンション層を交互に配置するのに対し、Falcon H1は並列方式を採用しています。各ブロック内で、アテンションヘッドとMamba-2ヘッドが同じ入力を並行して処理し、その出力を連結してから次の層に渡します。TIIは両者の比率をMambaチャネルが多くなるように調整しています。これにより、同等の規模のトランスフォーマーよりもアテンションに必要なメモリを大幅に抑えつつ、細かな情報を正確に取り出すために十分なアテンションを維持しています。
- 従来型のTransformer(Mistral、Qwen、Llama)
- 100%の注意を払い、リカルド品質を最大限に保ちますが、KVキャッシュはコンテキストに比例して増加し、数十万トークンを超えるとVRAMが不足します。
- 純粋なMamba(Falcon Mamba 7B)
- トークンあたりのメモリ使用量が一定で、長いストリームの処理が非常に高速です。離れた位置にある細部を思い出す能力は低めで、ソフトウェアの対応状況にもまだばらつきがあります。
- シーケンシャルハイブリッド(Granite 4, Jamba)
- Mamba 層が大半を占め、その間にアテンション層が挟まれています。メモリ使用量を大きく削減でき、ランタイムに実装しやすいアーキテクチャです。
- 並列ハイブリッド(Falcon H1)
- 各ブロックにAttentionとMamba-2を備え、それぞれの出力を連結します。モデルは各層で、どの情報を正確なメモリに委ね、どの情報を圧縮メモリに委ねるかを決めます。
#利用可能なサイズは、0.5B から 34B までです
TII は Falcon H1 を6つのサイズで公開しており、それぞれに Base(事前学習済み)版と Instruct(チャット)版があります。Ollama や LM Studio で使う場合、選ぶ対象は Instruct 版だけです。すべて同じアーキテクチャと多言語トークナイザーを共有しています。
- Falcon H1 0.5B
- 最小のモデルです。組み込み用途、パイプラインのテスト、Raspberry Pi向けです。本格的な文章作成には期待しないでください。
- Falcon H1 1.5B
- 分類、簡単な抽出、自動補完。比較的新しいCPUならどれでも、2 GB未満のメモリ使用量で動作します。
- Falcon H1 1.5B-Deep
- パラメータ数は1.5Bと同じですが、層の数がはるかに多く、各層の幅は狭くなっています。TIIはこれを、70億~100億パラメータのモデルと同水準と位置づけています。GPUのないノートパソコンで試すのに適したバリエーションです。
- Falcon H1 3B
- 4〜6GBのGPUまたは16GBのMac向けの妥協案。要約、フランス語チャット、軽量RAG。
- Falcon H1 7B
- ラインアップの主力モデルです。Qwen3 8B に匹敵し、前世代の 7B モデルを上回ります。RTX 3060 12GB なら、コンテキスト長に十分な余裕を持たせて実行できます。
- Falcon H1 34B
- 最上位モデルです。TII は Qwen3 32B、Gemma 3 27B、Llama 4 Scout と比較しています。Q4 では最低24 GBの VRAM が必要で、あるいは48 GBのユニファイドメモリを搭載した Mac なら余裕を持って使えます。
1.5B-Deepバリアントについて一言述べておきます。TIIは、狭いが非常に深いモデルという賭けに出ました。標準の1.5Bと比較して、レイヤー数が約3倍です。各レイヤーが直列に実行されるため、トークンあたりの速度は遅くなりますが、能力は明らかに向上しています。メモリ帯域幅がすべてを制限するCPU上では、これはしばしば同シリーズ全体で最高のコストパフォーマンス(ギガバイトあたり)を実現します。
#前提条件と VRAM
ソフトウェアについては、比較的新しいバージョンの Ollama が必要です。falcon-h1 アーキテクチャのサポートは2025年夏に llama.cpp に追加され、Ollama にもその後に公開されたバージョンで引き継がれました。それ以前の Ollama では、未知のアーキテクチャというエラーが出て、モデルを読み込めません。デーモンはデフォルトで http://localhost:11434 で待ち受けます。Open WebUI や LM Studio は、特別な設定なしでそこに接続できます。
- 0.5Bおよび1.5B(Q4_K_M)
- 1.5GB未満。CPUのみで4GBのRAMが空いている必要があります。GPUは不要です。
- Q4_K_Mの3Bモデル
- VRAMは約2 GB。VRAMが4 GB以上のグラフィックカードならどれでも使用でき、CPUモードではRAMが8 GBあれば使用できます。
- 7B Q4_K_M
- 重みには約5 GBのVRAMが必要です。RTX 3060 12GBまたはRTX 4070 12GBなら余裕を持って使え、32Kトークン以上のコンテキストにも対応する余地があります。
- 7B(Q8_0)
- 約8 GB。抽出で最高の精度を求める場合に、RTX 4080 16GBまたはメモリ24 GBのMac向けです。
- 34B(Q4_K_M)
- 約20 GB。RTX 4090 24 GB では余裕が少なく、コンテキストに注意が必要です。M4 Pro 48 GB や Mac Studio なら、はるかに余裕があります。
- 34Bモデル(Q8_0)
- 約36 GB。64 GB以上のMac、またはデュアルGPU環境に限定されます。
#VRAM 容量に応じて Falcon H1 をローカルにインストールする
TIIはHugging Faceで各サイズの公式GGUFを公開しており、リポジトリ名はtiiuae/Falcon-H1-<taille>-Instruct-GGUFです。Ollamaはhf.coというプレフィックスを使い、コロンの後に希望する量子化を指定することで、Hugging FaceからGGUFを直接取得できます。このガイドの執筆後に公式のfalcon-h1タグが追加されていないか、ollama.com/libraryも確認してください。追加されている場合は、検証済みのチャットテンプレートが含まれる公式タグを優先してください。
- 01Ollamaをアップデートする公式インストーラーまたはパッケージマネージャーを再実行し、その後でバージョンを確認してください。これは誰もが飛ばしてしまう手順であり、この手順を省くことが読み込み失敗の大半の原因です。
- 02VRAMに応じてサイズを選択12 GB以下:Q4_K_Mの7B。4〜6 GB:3B。GPUなし:1.5B-Deep。24 GB、または48 GBのMac:34B。一度に複数のサイズをダウンロードしないでください。各GGUFファイルのサイズは1〜20 GBです。
- 03Hugging FaceからGGUFをダウンロードollama pullで、リポジトリのhf.coパスと量子化タグを指定してください。Ollamaはファイルをダウンロードし、そのメタデータを読み込んで、それに基づいてチャットテンプレートを生成します。
- 04セッションを開始してフランス語でテストするollama runは対話型チャットを開始します。なぞなぞではなく、実際のタスク、たとえばテキストの要約や項目の抽出を指示してください。モデルが英語に切り替わらず、フランス語で応答することを確認します。
- 05GPU/CPUの割当を確認するollama psは、GPUに読み込まれたモデルの割合を示します。一部がCPUで実行されている場合は、サイズまたは量子化を下げてください。そうしないとスループットが急落します。
hf.coという接頭辞を含む完全な名前は、入力するには長く、Open WebUIでも読みにくいです。Modelfileでローカルエイリアスを作成してください。その際にコンテキストとフランス語のシステムプロンプトも設定でき、すべてのインターフェースでモデルが短い名前で表示されます。
アプリケーション用途では、Ollama は同じポートで HTTP API を公開し、OpenAI と互換性のあるエンドポイントを提供します。既存のクライアントはベースURLとモデル名を変更するだけで動作します。
#測定で示された、長いコンテキストでのメモリ面の優位性
これがローカルで使うFalcon H1の主な売りであり、10分で検証できます。検証手順は簡単です。同じモデルを2種類のコンテキストサイズで読み込み、ollama psが報告するメモリ使用量を比較します。従来型のトランスフォーマーでは、コンテキストを8Kトークンから64Kトークンに増やすと、メモリ使用量が数GB増加します。Falcon H1でも、アテンション部分がKVキャッシュを保持するため使用量は増えますが、その増加幅はかなり小さくなります。
数値を読むにあたって、2点補足します。まず、Ollamaは要求されたコンテキスト全体に対してKVキャッシュを事前に確保します。そのため、表示されるメモリは確保された容量を反映しており、プロンプトが実際に使用している量ではありません。次に、Ollamaの設定でKVキャッシュの量子化を有効にしている場合、Falcon H1のアテンション部分にも適用され、測定された差はさらに縮小しますが、結論は変わりません。VRAMが同じ場合、Falcon H1は同サイズのトランスフォーマーよりもはるかに長いコンテキストを受け入れることができます。
実際には、12 GBのGPUでFalcon H1 7BをQ4_K_Mで使うと、CPU側にオフロードせずに64Kトークンのコンテキストを確保できます。一方、Qwen3 8BやMistral 7Bでは、KVキャッシュを量子化するか、コンテキストを32K程度に制限する必要があります。また、コンテキストが埋まるにつれて生じる生成速度の低下も、はるかに小さくなります。Mamba部分が新しいトークンをそれぞれ一定時間で処理するためです。
#Mistral SmallとQwen3との比較:結論
誰もが気になるのは、普段使っているモデルを置き換えるべきかという点です。答えはサイズによって変わります。Falcon H1は、バリエーションによって属するクラスが異なるためです。
- Falcon H1 7B と Qwen3 8B の比較
- 全体的な品質はほぼ同等です。Qwen3 はコーディングと構造化された推論で優位性を保っていますが、Falcon H1 はフランス語がより自然で、何よりコンテキストが長くなるほどリソース消費が大幅に少なくなります。12 GB の環境で文書の要約やフランス語でのチャットを行うなら、Falcon H1 が有利です。コーディングには引き続き Qwen3 を使ってください。
- Falcon H1 7B と Mistral Small 3.2 の比較
- 同じクラスのモデルではありません。Mistral Smallは240億パラメータを持ち、Q4では14〜15 GBのVRAMを必要とします。十分なVRAMがあれば、ほとんどのタスクではMistral Smallのほうが優れています。カードのメモリが12 GBの場合や、32Kを超えるコンテキストが必要な場合は、Falcon H1 7Bを選びます。
- Falcon H1 34BとMistral Small 3.2の比較
- 興味深い対決です。Falcon H1 34Bは知識と推論のベンチマークで優れており、非常に長いコンテキストもよりうまく扱えますが、Q4ではメモリを5 GB多く必要とし、画像認識機能はありません。Mistral Smallは16 GBのグラフィックカードに収まり、画像を読み取れ、Apache 2.0ライセンスで提供されています。さらに、特にファンクションコーリングについて、より成熟したエコシステムの恩恵を受けられます。
- Falcon H1 34B と Qwen3 32B
- VRAM容量が同程度なら、Qwen3 32Bはコードとエージェントの用途で引き続き基準となるモデルです。フランス語やアラビア語の長い文書を扱う場合や、ユニファイドメモリで必要な20 GBを無理なく確保できるMacでは、Falcon H1 34Bのほうが適しています。
結論は一文で言えます。長いコンテキストでのメモリ使用が課題となる場合、またはフランス語とアラビア語が仕事で使う言語である場合、Falcon H1 はインストールするモデルとして最適です。あらゆる用途に対応する汎用モデルとして最も優れているわけではなく、エコシステムも Mistral や Qwen ほど成熟していません。24GB のメモリを搭載したワークステーションでは、日常のアシスタントとして Mistral Small が引き続き堅実な選択です。大きな文書を扱うために併用するのが Falcon H1 34B です。
#Falcon-LLMライセンス:デプロイ前に読む
Falcon H1は、TIIのFalcon-LLMライセンスで公開されています。このライセンスはApache 2.0を基にしており、商用利用、改変、再配布を認めていますが、許容される利用に関するポリシーと、いくつかの帰属表示義務を追加しています。Mistral SmallやGraniteが採用するApache 2.0のような全面的な自由を認めるものではありませんが、ユーザー数のしきい値を設けるLlamaのような制限的なライセンスでもありません。
個人利用や社内利用であれば、この点を気にする必要はありません。再配布する商用製品の場合は、10分ほど時間を取ってTIIのサイトでライセンス文を読み、自分の用途が除外対象に該当しないか確認してください。当サイトのカタログでは、Falconの各モデル紹介ページにライセンスを記載しています。ライセンスのバージョンは、モデルの世代によって変わる可能性があります。
#トラブルシューティング
- 「unknown model architecture falcon-h1」エラー
- お使いのOllama、LM Studio、またはllama.cppのバージョンが古すぎるため、ハイブリッドアーキテクチャを認識できません。更新し、デーモンを再起動して、pullを再実行してください。他の回避策はありません。エンジンが対応していなければ、Mamba-2のレイヤーは読み込めません。
- hf.co からの pull が失敗する、またはタグが見つからない
- Hugging Faceのページで、リポジトリ名と量子化の表記が正確か確認してください。特にQ4_K_Mの大文字・小文字に注意してください。リポジトリに指定したタグがない場合は、Filesタブを開いて、利用可能なGGUFファイルの一覧を確認してください。
- フランス語で入力しても英語で応答
- 上記のModelfileと同様に、使用言語を指定するシステムプロンプトを追加してください。Falcon H1の多言語トークナイザーはフランス語を非常にうまく扱えますが、Instructモデルは指示がないと、学習データで最も多く使われている言語に従うことがあります。
- 34Bで生成速度が非常に低い
- ollama psで、CPUへの部分的な割り当てが表示される可能性があります。24 Goの場合は、コンテキストを16Kに減らすか、Q4_K_Sに切り替えてください。Macでは、システムがメモリを過剰に確保している場合、割り当て可能なGPUメモリの上限を引き上げます。
- 長いコンテキストでメモリ使用量が予想以上に多い
- これは正常です。Ollama は、コンテキストが空でも、設定されたコンテキスト長全体に必要なアテンションの KV キャッシュを確保します。他のモデルと比較するときは、必ずコンテキスト長をそろえてください。メモリ使用量をもう少し減らしたい場合は、KV キャッシュの量子化を有効にしてください。
- チャットテンプレートが不正、応答にタグが表示されている
- Ollama は GGUF のメタデータからテンプレートを生成します。タグが表示される場合は、サードパーティーによる変換版ではなく TII 公式の GGUF をダウンロードするか、Modelfile 内で TEMPLATE を明示的に設定してください。
#さらに詳しく
Falcon H1の良さを十分に理解するには、このモデルが活用するコンテキストとメモリの概念をしっかり把握することが大切です。当サイトの以下のガイドは、このガイドを補完するものです。
- コンテキストウィンドウを理解する
- 8K、32K、256K トークンがそれぞれ何を意味するのか、どれだけの VRAM を消費するのか、そして従来の Transformer で KV キャッシュが真のボトルネックになる理由。
- KVキャッシュを量子化してVRAMを節約する
- Falcon H1のハイブリッドアーキテクチャと組み合わせて、コンテキストの長さを延ばす別の手段です。
- IBMのGranite 4をローカルで実行
- 今注目されている、もう一つのMambaハイブリッドモデル。シーケンシャルなアーキテクチャを採用し、Apache 2.0ライセンスで提供されています。Falcon H1と比較すると、TIIがどのような選択をしたのかを理解する助けになります。
- 量子化の選択(Q4、Q5、Q8、FP16)
- VRAM容量に応じて、Falcon H1の各モデルサイズでQ4_K_MとQ8_0のどちらを選ぶか判断するために。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。