Abliteration.aiは、Z.aiのGLM 5.3を基に拒否行動を取り除いたとするモデルを、ブラウザとAPI経由で提供している。 同社は、拒否に関係する重みレベルの挙動を変更してもコーディング、サイバー、エージェント能力は維持されると主張するが、その性能維持を広範に独立検証した証拠は提示されていない。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Abliteration.ai, how does its paid service use “abliteration” to remove refusal mechanisms from open-weight AI models such as Z.ai’s. Article summary: Abliteration.ai is a startup that commercializes “abliteration”: modifying open-weight models to remove their tendency to refuse harmful requests. Its hosted GLM-5.3 derivative makes a previously do-it-yourself practice . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Abliteration.aiは、オープンウェイトAIで議論の多い手法を商用サービスにしたスタートアップだ。モデルが有害な依頼を拒否する傾向を取り除いたうえで、改変モデルをオンラインで提供している。Z.aiのGLM-5.3を基にした同社の派生モデルは、ブラウザまたはAPIから利用できる。従来は技術力のある利用者が自ら改変し、実行環境も用意する必要があった作業を、管理されたサービスへ移した形だ。7
同社は、攻撃的サイバーセキュリティ、レッドチーム、AIエージェントの試験向けインフラだと位置付ける。しかし、TechCrunchの報道では、認証情報の窃取に関わるコードや危険な病原体の培養に関する指示をモデルが出力したとされる。認可された防御目的に役立つ仕組みが、現実の悪用に向けた障壁も下げ得ることが最大の懸念だ。7
ここでいう**abliteration(アブリテレーション)**とは、モデルが危険な依頼を拒否するよう学習した振る舞いを抑制・除去する改変を指す。チャットボットのポリシーをプロンプトで回避しようとする、いわゆる脱獄とは異なる。
Abliteration.aiによれば、拒否反応に結び付くモデル内部の活性化方向を特定し、モデルの重みから除去するという。同社は、コーディング、サイバー、エージェントの能力を保ちながら、安全制約の強いモデルなら中断する作業連鎖を続行できるようにすることが目的だと説明している。13
15
ただし、この技術説明と「有用な能力は維持される」との主張は、同社側の説明として受け止める必要がある。提示された資料には、改変後のGLM-5.3が能力、信頼性、安全性に関わる挙動の全般でベースモデルと同等かを独立して評価した検証は含まれていない。13
Abliteration.aiは、abliterated-model-large-v2を含む改変済みオープンウェイトモデルをホストしている。GLM-5.3ベースのこのモデルは、攻撃的サイバー業務、レッドチーム、エージェント試験向けとして、ウェブ画面とAPI経由で販売・提供されている。1
7
この提供形態には意味がある。オープンウェイトモデルは以前から、必要な技能と計算資源を持つ利用者なら改変して実行できた。一方、ホスト型の製品は、モデルのダウンロード、改変、ローカルでのサービングという手間を減らし、改変済みモデルをすぐに使えるようにする。3
7
TechCrunchは、無料のウェブアカウントを短時間で作成でき、一般的な主要AIサービスなら通常は拒否する依頼に対して、ホスト型モデルから回答を得たと報じた。出力には次が含まれたという。
これらは、無害なセキュリティ教育をめぐる議論にとどまらない。認証情報の窃取や生物学的危害に関係する内容が、利用しやすいホスト型インターフェースを通じて提供され得ることを示している。7
Abliteration.aiの主張は、典型的なデュアルユース(軍民両用・善悪両用途)の論点に基づく。防御側は脆弱性を見つけて修正するため、攻撃側の行動を再現する必要があるというものだ。銀行、航空会社、重要インフラの組織を評価するセキュリティチームは、防御策がエクスプロイト開発、ペイロード作成、悪意ある自動化、多段階の攻撃ワークフローに耐えられるかを試験する必要がある場合がある。AIアシスタントがすべての段階で拒否すれば、現実的な認可済み試験には役立ちにくい、と同社は考える。4
7
認可を得たペネトレーションテスト、マルウェア解析、CTF(Capture The Flag)競技、セキュリティ研究では、管理され許可された環境外では危険になり得る技術を扱うことがある。難しいのは、同じ支援が攻撃者にも有用になり得る点だ。2
4
中心的な懸念は、拒否機能を外したモデルが技術的に存在できること自体ではない。オープンウェイトモデルがあれば、技術力のある利用者はすでに改変を試せる。問題は、ブラウザやAPIで利用できるサービスが、モデルの重みや計算基盤を自分で管理しなくても、潜在的に有害な能力へ近づけてしまうことにある。3
7
同社は、重みレベルの編集後も基礎モデルのコーディングやサイバー能力を保持すると述べる。しかし、拒否行動を変えるために重みを改変すれば、別の学習済み挙動にも影響する可能性がある。提示資料には、能力、信頼性、その他の挙動が改変後も変わらないかを判断できる独立した広範なベンチマーク比較はない。13
15
エクスプロイトコードや攻撃手順の支援を求める依頼は、許可を得た評価の一部かもしれない。だが、実際の侵入準備である可能性もある。Chromeのパスワードや病原体に関する出力の報道は、利用者の自己申告だけから正当な意図を確実に判定することの難しさを示す。7
TechCrunchの報道によれば、同誌が試した経路では強いアクセス管理は確認できなかった。記者は短時間でアカウントを作り、ブラウザ経由で無料アクセスできたという。7
もっとも、提供された報道だけで、同社の現時点の管理策を網羅的に断定することはできない。それでも、次の重要な点は未解決のままだ。
これらの対策があっても、デュアルユースの問題が消えるわけではない。ただ、認可され説明責任を負うセキュリティ試験への道を残しつつ、匿名的・機会的な悪用を難しくする可能性はある。
Abliteration.aiは、モデル改変の手法をホスト型製品へ変えた。拒否行動を取り除いたGLM-5.3派生モデルを、サイバー業務とエージェント試験向けに提供している。1
7 レッドチーム用途という説明には理解できる部分がある一方、TechCrunchが報じたテスト結果は、単なる理論上の安全性懸念では済まない理由を示した。
7
要となるのはガバナンスだ。標準的なモデルが拒否する支援を提供することを目的とするサービスでは、安全性の根拠は利用者が「防御目的だ」と述べることだけに置けない。検証可能なアクセス管理、実効性のあるスクリーニング、そして説明責任の仕組みが強く求められる。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Abliteration.aiは、Z.aiのGLM 5.3を基に拒否行動を取り除いたとするモデルを、ブラウザとAPI経由で提供している。
Abliteration.aiは、Z.aiのGLM 5.3を基に拒否行動を取り除いたとするモデルを、ブラウザとAPI経由で提供している。 同社は、拒否に関係する重みレベルの挙動を変更してもコーディング、サイバー、エージェント能力は維持されると主張するが、その性能維持を広範に独立検証した証拠は提示されていない。
争点は攻撃的セキュリティ試験の正当性そのものではなく、手軽に利用できるホスト型サービスが、悪用を防ぐ審査・本人確認・監視の仕組みを十分に備えているかどうかにある。