ローカルで使うabliteratedモデル(検閲なし):ガイド pratique
Qwen、Gemma、Mistralなどのオープンウェイトモデルは、特定のリクエストを拒否するように調整されています。abliteratedモデルとは、この拒否動作を重みのレベルでピンポイントに取り除いた派生モデルです。プロンプトによるジェイルブレイクではなく、ニューラルネットワークを編集することで実現します。このガイドでは、この技術が実際に何をするのか、こうしたモデルをどこで入手できるのか、Ollamaを使うかGGUF形式でローカル実行する方法、そして実際の限界について説明します。
#「abliteratedモデル」とは何か?
「abliterated」と呼ばれるモデル(「decensored」や「uncensored」と呼ばれることもあります)は、拒否する能力を取り除いたオープンウェイトのLLMです。標準のQwen 3.5なら「I cannot help with that」と拒否するような要求でも、abliterated版は直接回答します。アラインメントに関するメッセージも、説教めいた前置きもなく、質問を別の話題にすり替えることもありません。
重要:これはプロンプトによるジェイルブレイクではありません。モデルは重みのレベルで変更されています。拒否を引き起こす内部の方向成分が取り除かれたため、拒否は仕組み上不可能、あるいは少なくとも極めてまれになっています。
#アブレーションの仕組みは?
これで、「abliterated」モデルとは何かが分かりました。AI無フィルターキットでは、まずフランスとヨーロッパの法的枠組みを取り上げます(第4章)。続いて、モデルの派生版をダウンロードする前に評価する方法(第5章と第6章)と、使用するビデオメモリに収まるものを選ぶ方法(第7章)を学べます。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
アブレーションは、Arditiらが2024年に発表した研究結果(「Refusal in Language Models Is Mediated by a Single Direction」)に基づいています。著者らは、アライメントされたLLMの大半では、拒否が内部の活性化空間における単一の方向によって制御されることを示しています。この方向を表すベクトルは、無害なプロンプトと拒否を引き起こすプロンプトに対する活性化を比較することで分離できます。
アブレーションとは、モデルの重みから、この方向の成分を層ごとに射影によって取り除くことです。具体的には、拒否に関連する成分を生成できなくなるように射影行列を変更します。モデルは引き続き通常どおり動作しますが、「拒否します」というモードに切り替わる原因だった「内部信号」は遮断されています。
- ステップ1 — 調査
- モデルに数十のプロンプトペアを送ります。中立的なプロンプトと拒否を引き起こすプロンプトを含み、各レイヤーの活性化を記録します。
- ステップ2 — 分離
- 2つのグループ間の活性化の平均差を計算します。このベクトルを正規化したものが、拒否の方向です。
- ステップ3 — 射影する
- 各層の重みを変更し、この方向を利用できないようにします。行うのは直交射影を引くという単純な操作であり、再学習ではありません。
- ステップ4 — テスト
- モデルが応答を拒否しなくなったことと、全般的な能力(推論、コーディング、フランス語)が大幅に低下していないことを確認します。
#abliteratedモデルの入手先
エコシステムの大部分はHugging Face上にあります。アブレーションの品質の高さで、コミュニティから高い評価を得ているモデル公開者が何人かいます:
- mlabonne
- Maxime Labonneは、この手法を早くから広めた人物の一人です。Qwen 3.5、Gemma 4、Mistral Smallのabliterated版は、いずれもhuggingface.co/mlabonneに説明が掲載されています。
- huihui-ai
- 対応するモデルの範囲は非常に広く、Qwen 3.5(2B〜27B)、Granite 4.2、Gemma 4、GLM 4.7 をカバーしています。派生モデルには「-abliterated」または「-abliterate」と表記されています。
- failspy
- 複数の代表的な派生モデル(Qwen 3.5 9B abliterated、Gemma 4 12B abliterated)の作者。品質について多くの議論が交わされています。
- Orenguteng / Lexi
- 「Lexi-Uncensored」シリーズは、アブレーションと軽いファインチューニングを組み合わせています。会話的な語り口で知られています。
Ollamaで使う場合、公式レジストリにも多くの派生版が公開されています。ollama.com/libraryでabliteratedまたはuncensoredを含むタグを検索するか、huihui_aiやmlabonneが公開している、そのままpullできるコミュニティ版を利用してください。
#Ollamaでのインストール
abliterated LLMをローカルで動かす最も簡単な方法は、Ollamaを使うことです。デーモンはデフォルトでhttp://localhost:11434で待ち受け、特別な設定なしでコミュニティ版のモデルを利用できます。
- 01Ollama が実行されていることを確認ターミナルでollama --versionを実行する。コマンドが失敗した場合は、続行する前にOllamaのインストールガイドに従う。
- 02VRAM容量に合ったモデルを選ぶ概算を再確認してください:7〜8B Q4モデルは約5GB、14Bは約9GB、32Bは約19GB、70Bは約40GBです。RTX 3060 12GBは8Bモデルの快適な動作を可能にし、RTX 4090 24GBは32Bモデルの動作を可能にします。
- 03ダウンロードして実行する`ollama run`にバリアントの完全な名前を指定して実行してください。モデルがダウンロードされてからVRAMに読み込まれ、会話が始まります。
- 04典型的な拒否をテストしてくださいベースモデルが回答を拒否するような質問をしてください。その派生モデルにabliterationが適切に施されていれば、前置きのない直接的な回答が得られます。
モデルを読み込んだ後は、Ollama で動かすほかの LLM と同じように使えます。:11434 で OpenAI 互換エンドポイントを提供し、Open WebUI、Continue.dev、LiteLLM、お使いの Python スクリプトに組み込めます。abliterated モデルを「動かす」ための特別なオプションは不要です。拒否しない性質は、設定ではなくモデルの重みに組み込まれています。
#GGUF (LM Studio, llama.cpp) を使用
LM Studioやllama.cppを直接使うほうを好む場合は、GGUFファイルを使うことになります。ほとんどのアブレーション版は、すでにHugging Faceで複数の量子化版が提供されています。品質を保ちながらVRAM使用量を最小限に抑えるバランスのよい選択として、引き続きQ4_K_Mを推奨します。余裕があればQ5_K_M、最大限の忠実度を求めるならQ8_0を選びます。
- 01GGUFリポジトリを識別するHugging Faceでは、-GGUFが付いたリポジトリを探してください。例:mlabonne/Qwen3.5-9B-abliterated-GGUF または bartowski/<modele>-abliterated-GGUF。
- 02適切な量子化版をダウンロードするLM Studioでは、インターフェースはサイズと発行元でフィルタリングできます。ほとんどのケースではQ4_K_Mを推奨します。非常に小さなモデル(1〜3B)の場合は、Q5_K_MまたはQ6_Kで顕著な品質損失を回避できます。
- 03ロードおよびテストLM Studioは、VRAMが十分であれば、自動的にレイヤーをGPUに読み込みます。オフロードのインジケーターを確認してください。モデルがVRAMに収まらず、一部がシステムRAMに配置されると、処理速度が低下します。
- 04API経由での公開アプリに統合する場合、ローカルのOpenAI互換サーバーを有効にします。LM Studio のデフォルトポートは1234です(Ollama は11434です)。
#制限と品質の低下
アブレーションには代償があります。残差内のある方向を除去すると、有用な成分も含め、その方向を通っていたものすべてが変化します。実際に観察されている副作用は次のとおりです。
- 論理的推論ベンチマークでわずかな低下
- 通常、MMLUやGSM8Kでは1〜3ポイントの低下が見られます。測定できる差ですが、実際の利用で支障になることはまれです。
- 回答が以前より機械的になることがある
- モデルはアライメントによるきめ細かな対応を一部失います。確認のための質問が減り、注意喚起が役立つ場合でも、その頻度が減ります。
- ハルシネーションの頻度がごくわずかに高い
- 通常ならモデルが「確かではありません」と答えるような質問に対して、自信ありげな回答をでっち上げる傾向があります。
- 残存する振る舞い
- それでも一部の拒否応答は残ります。特に、アブレーションが不十分な場合に見られます。逆に、アブリテレーションが十分に施されたモデルの中には、何にでも答えるものもあります。答えずにいてほしい内容にまで回答してしまいます。
#リスクと責任ある使用
何も拒否しなくなったモデルは、おもちゃではありません。実際の用途に組み込む前に、いくつかの基本的な原則を確認してください:
- 出力の責任はあなたが負います
- アライメント済みモデル、abliteratedモデル、クラウドモデルのどれを使っても、回答をどう利用するかを決めるのはあなた自身です。GDPR、刑法、著作権法は、モデルのバージョンによって変わるものではありません。
- フィルターを設けずに、誰でも自由に使える形で公開しないでください
- チーム向けのエンドポイントを構築する場合は、少なくともアプリケーション側でフィルタリング(キーワードによるフィルタリング、出力のモデレーション)を行うようにしてください。社内チャットでabliteratedモデルをそのまま使うことは、基本的に避けるべきです。
- ユーザーに対して透明性を保つこと
- abliteratedモデルに接続したアプリが、ユーザーを驚かせる可能性のあるコンテンツを生成する場合は、ユーザーに事前に知らせてください。予期せぬ内容を見せなければ、訴訟も避けられます。
- 正当な用途、実際の用途
- AI安全性の研究、レッドチーミング、そしてアライメント済みモデルの拒否によってツールが使い物にならなくなるような機微なコーパス(医療、法律、セキュリティ)の処理。アブレーションが実際に価値を持つのは、こうしたケースです。「面白半分で検閲を取り除いた」という使い方では、何の利益もないまま、非常に望ましくない出力にさらされます。
#ヒントとトラブルシューティング
- モデルはそれでも拒否します
- アブレーションを施したモデルの中には、特定のテーマ(政治、医療、未成年者)で回答を拒否するものもあります。同じモデルに別のアブレーションを施したものか、別の公開者が提供するものを試してください。アブレーションの品質には大きな差があります。
- モデルの出力が支離滅裂になった
- アブレーションが過剰だった場合の症状です(方向を削除しすぎた、または方向を適切に分離できていなかった場合)。手順が記録されていない自作のアブレーションよりも、実績のある公開者が提供する派生版を選んでください。
- フランス語でのパフォーマンスが悪い
- どのオープンウェイトモデルでも、フランス語の性能はベースモデルに依存します。Qwen 3.5、Mistral Small、Gemma 4、Granite 4.2は優れていますが、より古いモデル(Llama 3、Phi-3、Gemma 2)は劣ります。アブレーションを行っても、この点は変わりません。
- 残っている「As an AI, I cannot...」という前置き
- ジェイルブレイクを使う代わりに、役割と期待する出力形式を改めて示す短いシステムプロンプトを追加してください。多くの場合、これだけでアライメントの名残を取り除けます。
- VRAMが満杯です
- 8GBの場合、7-8BモデルでQ4_K_Mを推奨します。12GBの場合、Q5_K_Mにアップグレードするか、14BモデルのQ4を試すことも可能です。24GBの場合、32BモデルのQ4は快適に動作します。
#さらに詳しく
アブレーションは、オープンウェイトモデルのカスタマイズへの入り口です。さらに進めるには:
- Ollama Modelfile でモデルをカスタマイズする
- abliterated版のモデルにシステムプロンプト、パラメータ、テンプレートを追加したい場合は、Modelfileを知っておくとよいでしょう。
- 量子化の選択(Q4、Q5、Q8、FP16)
- VRAM容量と目標とする品質に応じて、どのGGUFを読み込むべきかを理解するために。アブレーションを行っても、選択時のトレードオフは変わりません。
- ローカルでLLMをファインチューニング:LoRAおよびQLoRA
- アブレーションだけでは不十分で、口調や対象分野も調整したい場合は、abliterated版に軽量のLoRAを適用するのが、最もバランスのよい選択となることが多いです。
制限も検閲もないAIは存在しますか?+
検閲のないAIをローカルで実行することは合法ですか?+
制限のないローカルAIは、知能が低くなるのでしょうか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。