中級 10 分カスタマイズ

ローカルで使うabliteratedモデル(検閲なし):ガイド pratique

Qwen、Gemma、Mistralなどのオープンウェイトモデルは、特定のリクエストを拒否するように調整されています。abliteratedモデルとは、この拒否動作を重みのレベルでピンポイントに取り除いた派生モデルです。プロンプトによるジェイルブレイクではなく、ニューラルネットワークを編集することで実現します。このガイドでは、この技術が実際に何をするのか、こうしたモデルをどこで入手できるのか、Ollamaを使うかGGUF形式でローカル実行する方法、そして実際の限界について説明します。

著者 Mohamed Meguedmi·更新 2026-09-01·Windows・macOS・Linuxでテスト済み

#「abliteratedモデル」とは何か?

「abliterated」と呼ばれるモデル(「decensored」や「uncensored」と呼ばれることもあります)は、拒否する能力を取り除いたオープンウェイトのLLMです。標準のQwen 3.5なら「I cannot help with that」と拒否するような要求でも、abliterated版は直接回答します。アラインメントに関するメッセージも、説教めいた前置きもなく、質問を別の話題にすり替えることもありません。

重要:これはプロンプトによるジェイルブレイクではありません。モデルは重みのレベルで変更されています。拒否を引き起こす内部の方向成分が取り除かれたため、拒否は仕組み上不可能、あるいは少なくとも極めてまれになっています。

i
Abliterated、ファインチューニング済み、ジェイルブレイク済み:この3つは別物
ジェイルブレイクされたモデルは、元のモデルに巧妙なプロンプトを組み合わせ、安全策を回避させるものです(不安定)。検閲なしのファインチューニング済みモデルは、拒否応答を含まないデータセットで再訓練されたものです(高コスト)。abliteratedモデルは、線形代数の操作で拒否に対応する方向を除去しただけのものです(処理が速く、品質をよりよく維持)。

#アブレーションの仕組みは?

フィルターなしAIキット

これで、「abliterated」モデルとは何かが分かりました。AI無フィルターキットでは、まずフランスとヨーロッパの法的枠組みを取り上げます(第4章)。続いて、モデルの派生版をダウンロードする前に評価する方法(第5章と第6章)と、使用するビデオメモリに収まるものを選ぶ方法(第7章)を学べます。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

アブレーションは、Arditiらが2024年に発表した研究結果(「Refusal in Language Models Is Mediated by a Single Direction」)に基づいています。著者らは、アライメントされたLLMの大半では、拒否が内部の活性化空間における単一の方向によって制御されることを示しています。この方向を表すベクトルは、無害なプロンプトと拒否を引き起こすプロンプトに対する活性化を比較することで分離できます。

アブレーションとは、モデルの重みから、この方向の成分を層ごとに射影によって取り除くことです。具体的には、拒否に関連する成分を生成できなくなるように射影行列を変更します。モデルは引き続き通常どおり動作しますが、「拒否します」というモードに切り替わる原因だった「内部信号」は遮断されています。

ステップ1 — 調査
モデルに数十のプロンプトペアを送ります。中立的なプロンプトと拒否を引き起こすプロンプトを含み、各レイヤーの活性化を記録します。
ステップ2 — 分離
2つのグループ間の活性化の平均差を計算します。このベクトルを正規化したものが、拒否の方向です。
ステップ3 — 射影する
各層の重みを変更し、この方向を利用できないようにします。行うのは直交射影を引くという単純な操作であり、再学習ではありません。
ステップ4 — テスト
モデルが応答を拒否しなくなったことと、全般的な能力(推論、コーディング、フランス語)が大幅に低下していないことを確認します。
→
なぜこんなに速いのか
アブレーションには、桁外れに高性能なGPUも、何時間もの学習も必要ありません。既存の行列に対する線形代数の計算だけを行うため、70Bモデルでも数分から数時間で十分です。

#abliteratedモデルの入手先

エコシステムの大部分はHugging Face上にあります。アブレーションの品質の高さで、コミュニティから高い評価を得ているモデル公開者が何人かいます:

mlabonne
Maxime Labonneは、この手法を早くから広めた人物の一人です。Qwen 3.5、Gemma 4、Mistral Smallのabliterated版は、いずれもhuggingface.co/mlabonneに説明が掲載されています。
huihui-ai
対応するモデルの範囲は非常に広く、Qwen 3.5(2B〜27B)、Granite 4.2、Gemma 4、GLM 4.7 をカバーしています。派生モデルには「-abliterated」または「-abliterate」と表記されています。
failspy
複数の代表的な派生モデル(Qwen 3.5 9B abliterated、Gemma 4 12B abliterated)の作者。品質について多くの議論が交わされています。
Orenguteng / Lexi
「Lexi-Uncensored」シリーズは、アブレーションと軽いファインチューニングを組み合わせています。会話的な語り口で知られています。
!
モデルカードを確認してください
「uncensored」または「abliterated」とタグ付けされたモデルが、すべて同等とは限りません。モデルカードを読んでください。公開者によっては使用したスクリプトやアブレーション後の評価を提供していますが、派手なタイトルを付けるだけの公開者もいます。迷った場合は、検証可能な実績のある公開者を選んでください。

Ollamaで使う場合、公式レジストリにも多くの派生版が公開されています。ollama.com/libraryでabliteratedまたはuncensoredを含むタグを検索するか、huihui_aiやmlabonneが公開している、そのままpullできるコミュニティ版を利用してください。

#Ollamaでのインストール

abliterated LLMをローカルで動かす最も簡単な方法は、Ollamaを使うことです。デーモンはデフォルトでhttp://localhost:11434で待ち受け、特別な設定なしでコミュニティ版のモデルを利用できます。

  1. 01
    Ollama が実行されていることを確認
    ターミナルでollama --versionを実行する。コマンドが失敗した場合は、続行する前にOllamaのインストールガイドに従う。
  2. 02
    VRAM容量に合ったモデルを選ぶ
    概算を再確認してください:7〜8B Q4モデルは約5GB、14Bは約9GB、32Bは約19GB、70Bは約40GBです。RTX 3060 12GBは8Bモデルの快適な動作を可能にし、RTX 4090 24GBは32Bモデルの動作を可能にします。
  3. 03
    ダウンロードして実行する
    `ollama run`にバリアントの完全な名前を指定して実行してください。モデルがダウンロードされてからVRAMに読み込まれ、会話が始まります。
  4. 04
    典型的な拒否をテストしてください
    ベースモデルが回答を拒否するような質問をしてください。その派生モデルにabliterationが適切に施されていれば、前置きのない直接的な回答が得られます。
例 — Qwen 3.5 9Bのabliterated版
ollama run huihui_ai/qwen3.5-abliterated:9b
例 — Gemma 4 12Bのabliterated版
ollama run huihui_ai/gemma4-abliterated:12b
# ou, depuis Hugging Face directement :
# ollama run hf.co/mlabonne/gemma-4-12b-it-abliterated-GGUF
→
Hugging Faceから直接プル
Ollama 0.4以降、Ollama レジストリを経由せずに ollama run hf.co/<publisher>/<modele>-GGUF を実行できます。mlabonneやfailspyが公開した、まだ公式タグが付いていないアブレーションを素早くテストするのに便利です。

モデルを読み込んだ後は、Ollama で動かすほかの LLM と同じように使えます。:11434 で OpenAI 互換エンドポイントを提供し、Open WebUI、Continue.dev、LiteLLM、お使いの Python スクリプトに組み込めます。abliterated モデルを「動かす」ための特別なオプションは不要です。拒否しない性質は、設定ではなくモデルの重みに組み込まれています。

#GGUF (LM Studio, llama.cpp) を使用

LM Studioやllama.cppを直接使うほうを好む場合は、GGUFファイルを使うことになります。ほとんどのアブレーション版は、すでにHugging Faceで複数の量子化版が提供されています。品質を保ちながらVRAM使用量を最小限に抑えるバランスのよい選択として、引き続きQ4_K_Mを推奨します。余裕があればQ5_K_M、最大限の忠実度を求めるならQ8_0を選びます。

  1. 01
    GGUFリポジトリを識別する
    Hugging Faceでは、-GGUFが付いたリポジトリを探してください。例:mlabonne/Qwen3.5-9B-abliterated-GGUF または bartowski/<modele>-abliterated-GGUF。
  2. 02
    適切な量子化版をダウンロードする
    LM Studioでは、インターフェースはサイズと発行元でフィルタリングできます。ほとんどのケースではQ4_K_Mを推奨します。非常に小さなモデル(1〜3B)の場合は、Q5_K_MまたはQ6_Kで顕著な品質損失を回避できます。
  3. 03
    ロードおよびテスト
    LM Studioは、VRAMが十分であれば、自動的にレイヤーをGPUに読み込みます。オフロードのインジケーターを確認してください。モデルがVRAMに収まらず、一部がシステムRAMに配置されると、処理速度が低下します。
  4. 04
    API経由での公開
    アプリに統合する場合、ローカルのOpenAI互換サーバーを有効にします。LM Studio のデフォルトポートは1234です(Ollama は11434です)。
i
量子化とアブレーション
アブレーションは量子化されていないモデル上で実施され、その後量子化が結果に適用されます。したがって、既にアブレーションが施されたバリエーションのGGUFファイルを直接取得できます。量子化側で「有効化」する必要はありません。

#制限と品質の低下

アブレーションには代償があります。残差内のある方向を除去すると、有用な成分も含め、その方向を通っていたものすべてが変化します。実際に観察されている副作用は次のとおりです。

論理的推論ベンチマークでわずかな低下
通常、MMLUやGSM8Kでは1〜3ポイントの低下が見られます。測定できる差ですが、実際の利用で支障になることはまれです。
回答が以前より機械的になることがある
モデルはアライメントによるきめ細かな対応を一部失います。確認のための質問が減り、注意喚起が役立つ場合でも、その頻度が減ります。
ハルシネーションの頻度がごくわずかに高い
通常ならモデルが「確かではありません」と答えるような質問に対して、自信ありげな回答をでっち上げる傾向があります。
残存する振る舞い
それでも一部の拒否応答は残ります。特に、アブレーションが不十分な場合に見られます。逆に、アブリテレーションが十分に施されたモデルの中には、何にでも答えるものもあります。答えずにいてほしい内容にまで回答してしまいます。
→
導入前に比較してください
ベースモデルをabliterated版に置き換える前に、実際の使用状況を代表する10〜20のプロンプトの小規模なテストセットを、両方のバージョンで実行してください。損失が許容できるかどうかはすぐにわかります。

#リスクと責任ある使用

何も拒否しなくなったモデルは、おもちゃではありません。実際の用途に組み込む前に、いくつかの基本的な原則を確認してください:

出力の責任はあなたが負います
アライメント済みモデル、abliteratedモデル、クラウドモデルのどれを使っても、回答をどう利用するかを決めるのはあなた自身です。GDPR、刑法、著作権法は、モデルのバージョンによって変わるものではありません。
フィルターを設けずに、誰でも自由に使える形で公開しないでください
チーム向けのエンドポイントを構築する場合は、少なくともアプリケーション側でフィルタリング(キーワードによるフィルタリング、出力のモデレーション)を行うようにしてください。社内チャットでabliteratedモデルをそのまま使うことは、基本的に避けるべきです。
ユーザーに対して透明性を保つこと
abliteratedモデルに接続したアプリが、ユーザーを驚かせる可能性のあるコンテンツを生成する場合は、ユーザーに事前に知らせてください。予期せぬ内容を見せなければ、訴訟も避けられます。
正当な用途、実際の用途
AI安全性の研究、レッドチーミング、そしてアライメント済みモデルの拒否によってツールが使い物にならなくなるような機微なコーパス(医療、法律、セキュリティ)の処理。アブレーションが実際に価値を持つのは、こうしたケースです。「面白半分で検閲を取り除いた」という使い方では、何の利益もないまま、非常に望ましくない出力にさらされます。
!
アブレーションによって変化しないこと
アブレーションは応答の拒否を取り除きますが、知識は取り除きません。ベースモデルが学習中に危険なテーマに一度も触れていなければ、abliteratedモデルになっても、そのテーマについて知識が増えるわけではありません。逆に、知っていながら答えることを拒んでいたモデルは、今では答えるようになります。まさにこの点が、慎重さを求める理由です。

#ヒントとトラブルシューティング

モデルはそれでも拒否します
アブレーションを施したモデルの中には、特定のテーマ(政治、医療、未成年者)で回答を拒否するものもあります。同じモデルに別のアブレーションを施したものか、別の公開者が提供するものを試してください。アブレーションの品質には大きな差があります。
モデルの出力が支離滅裂になった
アブレーションが過剰だった場合の症状です(方向を削除しすぎた、または方向を適切に分離できていなかった場合)。手順が記録されていない自作のアブレーションよりも、実績のある公開者が提供する派生版を選んでください。
フランス語でのパフォーマンスが悪い
どのオープンウェイトモデルでも、フランス語の性能はベースモデルに依存します。Qwen 3.5、Mistral Small、Gemma 4、Granite 4.2は優れていますが、より古いモデル(Llama 3、Phi-3、Gemma 2)は劣ります。アブレーションを行っても、この点は変わりません。
残っている「As an AI, I cannot...」という前置き
ジェイルブレイクを使う代わりに、役割と期待する出力形式を改めて示す短いシステムプロンプトを追加してください。多くの場合、これだけでアライメントの名残を取り除けます。
VRAMが満杯です
8GBの場合、7-8BモデルでQ4_K_Mを推奨します。12GBの場合、Q5_K_Mにアップグレードするか、14BモデルのQ4を試すことも可能です。24GBの場合、32BモデルのQ4は快適に動作します。

#さらに詳しく

アブレーションは、オープンウェイトモデルのカスタマイズへの入り口です。さらに進めるには:

Ollama Modelfile でモデルをカスタマイズする
abliterated版のモデルにシステムプロンプト、パラメータ、テンプレートを追加したい場合は、Modelfileを知っておくとよいでしょう。
量子化の選択(Q4、Q5、Q8、FP16)
VRAM容量と目標とする品質に応じて、どのGGUFを読み込むべきかを理解するために。アブレーションを行っても、選択時のトレードオフは変わりません。
ローカルでLLMをファインチューニング:LoRAおよびQLoRA
アブレーションだけでは不十分で、口調や対象分野も調整したい場合は、abliterated版に軽量のLoRAを適用するのが、最もバランスのよい選択となることが多いです。
よくある質問
制限も検閲もないAIは存在しますか?+
はい、ただしクラウドではありません。すべての「制限なし」のオンラインサービスは実際にはサーバー側でフィルタリングを適用し、利用規約に従っています。本当の無検閲AIとは、ローカルで実行されるアブリテレーテッドモデルです。拒否動作そのものがモデルの重みから取り除かれており、データは第三者サーバーを経由しません。このガイドがまさにその内容を扱います。
検閲のないAIをローカルで実行することは合法ですか?+
自宅でabliteratedモデルを実行することは合法です。これは、公開配布されている、変更を加えたオープンウェイトの重みです。ただし、それを使って生成したものには、引き続き一般の法律が適用されます。アブレーションで取り除かれるのはモデルの拒否動作であり、利用者の責任ではありません。使用する派生版のライセンスも確認してください(通常は元のモデルのライセンスを引き継ぎます)。
制限のないローカルAIは、知能が低くなるのでしょうか?+
はい、わずかに低下します。アブレーションによって全般的な品質が少し落ちます(「限界と品質の低下」セクションを参照)。日常的な用途では差はごくわずかですが、コードや高度な推論に使う場合は、元のバージョンも併せて残しておいてください。Ollamaでは両方を問題なく共存させられます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。