Abliteration.aiは、利用者自身がモデルの重みを改変・運用する代わりに、拒否行動を除去したGLM 5.3派生モデルをブラウザとAPI経由で提供している。 「abliteration」は、有害な指示と無害な指示に対する内部活性化を比較し、拒否に関連する方向を選んだ重みから弱める手法だ。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: How does Abliteration.ai commercialize “abliteration” by hosting open-weight AI models such as Z.ai’s GLM-5.3 with their internal refusal me. Article summary: Abliteration.ai turns a model-editing technique into a hosted service: it offers altered open-weight models, including Z.ai’s GLM-5.3 derivative, through a browser and API rather than requiring users to download, modify,. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Abliteration.aiが売っているのは、単なるAIモデルではない。従来なら、オープンウェイトモデルを入手し、自ら重みを改変して、GPU環境で継続運用する必要があった「拒否行動の除去」を、すぐ使えるホスト型サービスにしたものだ。
同社は、Z.aiのGLM-5.3を基にした派生モデルを含む改変済みモデルをホストし、ブラウザまたはAPIから利用できるようにしている。TechCrunchによれば、同社は、ほかのモデルが拒否しがちな「攻撃的サイバーセキュリティ、レッドチーム、エージェント試験」の作業を可能にすることを目標として掲げている。6
7
重要なのは、この提供形態にある。モデルの改変やサービング基盤の構築といった技術的・運用上の負担を利用者から取り除くことで、拒否を抑えたモデルへのアクセスを大幅に容易にするからだ。7
abliterationは、大規模言語モデル(LLM)が学習した「拒否する振る舞い」を、重みの変更によって弱めることを狙う手法である。基本的な考え方は、有害な指示群と無害な指示群に対するモデル内部の活性化を比較し、拒否と結び付くベクトル、すなわち「拒否方向」を推定することにある。その方向を選択したモデル重みから除去または縮小する。1
2
13
簡略化すれば、モデルが「この依頼には答えない」という出力へ向かう内部パターンを妨げるアプローチだ。Abliteration.aiは、再学習、ファインチューニング、システムプロンプトの脱獄に頼らず、元のモデルなら拒否したプロンプトにも応答する「制約のない」モデルを作る技術だと説明している。2
ただし、これは改変後のモデルがあらゆる場面で同等の性能や信頼性を保つことを意味しない。重みから特定の方向を差し引けば、モデルの振る舞いそのものが変わる。コーディング、エージェント、サイバーセキュリティの能力がすべてのタスクで維持されるという点は、現時点の資料だけでは独立に立証されていない。同社による能力維持の説明は、あくまで同社の位置付けである。2
8
オープンウェイトモデルは、利用者が独自に改変して実行することも可能だ。しかし、そのためには専門知識、十分な計算資源、運用体制が必要になる。Abliteration.aiは、すでに改変されたモデルをウェブ画面とAPIとして提供することで、この工程をサービスに置き換えた。TechCrunchは、同社のプラットフォームがGLM-5.3を含む、ガードレールを除去したオープンウェイトモデルをホストしていると報じた。7
この構成は、自前のモデル提供基盤を構築せずに、AIが敵対的または禁止されがちなタスクをどう支援し得るかを検証したい組織にとっては利用価値がある。同社が明示する用途は、攻撃的サイバーセキュリティ、AIレッドチーム、エージェント試験だ。6
7
拒否行動を抑えるよう改変されたモデルは、通常の対話AIなら断るはずの依頼に対しても、応答を続ける可能性が高くなる。これは単にプロンプト上のルールを回避しようとするものではなく、拒否に至るモデル内部の振る舞いを標的にすることが、この手法の狙いだからだ。1
2
実際の影響を示す例として、TechCrunchはホストされたGLM-5.3派生モデルをテストし、保存済みパスワードを盗むためのコードや、危険な病原体に関する詳細な手順を受け取ったと報じている。7 こうした出力は、拒否しないことを最適化したモデルが、厳格な認可と管理のない環境では安全でない支援を提供し得るという懸念を具体化している。
同社の主張は、典型的なデュアルユースの論理に基づく。防御側のセキュリティチームは、攻撃者がたどり得る手順を再現し、防御策、検知システム、あるいはAIエージェントが有害な段階に進むリスクを評価する必要がある。その際、AIが自動的に拒否すると、検証の幅が狭まる可能性がある。Abliteration.aiはこのため、攻撃的サイバーセキュリティ、レッドチーム、エージェント試験をサービスの用途としている。6
7
この説明は、セキュリティ業務の一類型としては理解できる。一方で、それだけで各利用者や各リクエストが適法・適切に認可されていることの証明にはならない。提供資料には、特定の顧客業種、顧客との関係、詳細な利用者審査の仕組みを裏付ける十分な情報はない。
批判の焦点は、改変済みのオープンウェイトモデルが存在すること自体よりも、それをホスト型サービスにする点にある。ブラウザ画面とAPIがあれば、拒否を抑えたモデルを使うために必要だった計算資源、セットアップ、専門知識を減らせる。7
その結果、認可を受けたレッドチームが有害な行動を模擬するためのアクセスと、悪意あるコード、詐欺、危険な科学的助言を求める人が利用したいアクセスとが、同じサービス上で重なり得る。TechCrunchのテスト結果は、広く「無制限」を掲げるサービスが、研究ツールにとどまらず、配布経路としてのリスクを持つと批判される理由を示している。7
なお、提供資料だけでは、正式な本人確認(KYC)、決済カード情報の記録、分類器による監視、GPU利用者の本人確認、あるいは能力低下の程度について、確かな結論は出せない。ホスト型の拒否除去サービスを評価するうえで重要な論点だが、判断には、より明確な事業者の説明と独立した報道・検証が必要だ。
Abliteration.aiの商業的な新しさは、拒否除去という技術そのものより、その運用をサービス化した点にある。モデル重みの改変作業だったものを、ブラウザとAPIから利用可能な製品へ変えた。同技術は、拒否と関連する内部方向を標的にし、元のモデルが断る要求にも応答させることを目的とする。1
2
セキュリティ試験における用途と、悪用を広げるリスクは切り離せない。この種のシステムを検討する組織にとっては、利用が適切に認可されているか、アクセス制御と監査が実効性を持つか、より現実的な敵対的テストの価値が、危険な能力へのアクセスを容易にするリスクを上回るかが、中心的な問いになる。6
7
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Abliteration.aiは、利用者自身がモデルの重みを改変・運用する代わりに、拒否行動を除去したGLM 5.3派生モデルをブラウザとAPI経由で提供している。
Abliteration.aiは、利用者自身がモデルの重みを改変・運用する代わりに、拒否行動を除去したGLM 5.3派生モデルをブラウザとAPI経由で提供している。 「abliteration」は、有害な指示と無害な指示に対する内部活性化を比較し、拒否に関連する方向を選んだ重みから弱める手法だ。
同社は攻撃的サイバーセキュリティ、レッドチーム、AIエージェント試験を用途に掲げる一方、手軽なホスティングは危険な支援へのアクセス障壁も下げうる。