Abliteration.ai는 거부 행동을 제거했다고 밝힌 Z.ai GLM 5.3 파생 모델을 브라우저와 API로 제공한다. 회사는 가중치 수준에서 거부와 연관된 패턴을 수정하면서 코딩·사이버보안·에이전트 기능은 유지한다고 주장하지만, 이를 뒷받침하는 독립적 검증은 제공된 자료에서 확인되지 않는다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Abliteration.ai, how does its paid service use “abliteration” to remove refusal mechanisms from open-weight AI models such as Z.ai’s. Article summary: Abliteration.ai is a startup that commercializes “abliteration”: modifying open-weight models to remove their tendency to refuse harmful requests. Its hosted GLM-5.3 derivative makes a previously do-it-yourself practice . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Abliteration.ai는 오픈웨이트 AI에서 논쟁적인 접근법을 사업화하고 있다. 모델이 유해할 수 있는 요청을 거절하는 경향을 약화하거나 제거한 뒤, 이를 온라인 서비스로 제공하는 방식이다. Z.ai의 GLM-5.3를 기반으로 수정한 모델은 브라우저와 API에서 사용할 수 있다. 기존에는 기술력과 컴퓨팅 자원을 갖춘 이용자가 직접 모델을 내려받아 수정·운영해야 했다면, 이제는 관리형 서비스가 그 과정을 대신하는 구조다. 7
회사는 이 서비스를 공격적 사이버보안, 레드팀, AI 에이전트 테스트용 인프라로 내세운다. 그러나 TechCrunch의 테스트 보도에서 자격 증명 탈취 코드와 위험한 병원체 배양 관련 지침이 생성됐다고 전해지면서, 승인된 방어 활동에 쓰일 수 있는 도구가 현실의 오용 장벽도 낮출 수 있다는 우려가 커지고 있다. 7
이 맥락에서 **애블리터레이션(abliteration)**은 모델이 특정 요청을 거부하도록 학습된 행동을 억제하거나 없애는 수정 기법을 뜻한다. 챗봇의 정책을 우회하는 프롬프트를 찾는 일과는 다르다.
Abliteration.ai는 거부 반응과 연관된 모델 내부 활성화 방향을 찾아 모델 가중치에서 제거한다고 설명한다. 회사의 설명대로라면 코딩·사이버보안·에이전트 능력은 유지하면서, 안전 제약이 강한 모델이라면 중단할 작업 연쇄도 계속 수행하게 하는 것이 목적이다. 13
15
다만 이 설명과 기능 보존 주장은 회사 측의 주장이다. 제공된 자료에는 수정된 GLM-5.3가 원본 모델과 비교해 전반적인 성능, 신뢰성, 안전 관련 행동에서 동등한 수준을 유지하는지 독립적으로 평가한 결과는 없다. 13
Abliteration.ai는 abliterated-model-large-v2를 포함해 수정된 오픈웨이트 모델을 호스팅한다. 이 GLM-5.3 기반 모델은 공격적 사이버 작업, 레드팀, 에이전트 테스트용으로 홍보되며 웹 인터페이스와 API로 접근할 수 있다. 1
7
이 제공 방식은 중요하다. 오픈웨이트 모델은 이미 필요한 기술과 컴퓨팅 자원을 가진 이용자가 수정해 직접 실행할 수 있었다. 하지만 호스팅 서비스는 모델 다운로드, 수정, 자체 서버 운영에 필요한 부담을 줄여 수정 모델을 즉시 사용하기 쉽게 만든다. 3
7
TechCrunch는 무료 웹 계정을 빠르게 만든 뒤, 일반적인 주류 AI 서비스라면 대체로 거절할 요청에 대해 호스팅 모델이 응답했다고 보도했다. 보도에 따르면 출력에는 다음이 포함됐다.
이 사례는 단순한 보안 교육 논쟁을 넘어선다. 접근하기 쉬운 호스팅 인터페이스를 통해 자격 증명 탈취와 생물학적 위해에 관련된 자료가 제공될 수 있음을 보여주기 때문이다. 7
Abliteration.ai의 주장은 전형적인 이중용도 논리다. 방어자는 취약점을 찾아 고치기 위해 공격자의 행동을 재현할 수 있어야 한다는 것이다. 은행, 항공사, 핵심 기반시설 운영 조직을 점검하는 보안팀은 방어 체계가 익스플로잇 개발, 페이로드 생성, 악성 자동화, 다단계 공격 흐름을 견딜 수 있는지 평가해야 할 수 있다. 이때 AI 보조 도구가 모든 단계를 거절하면 현실적인 승인 테스트에 덜 유용해질 수 있다는 것이 회사의 입장이다. 4
7
승인된 침투 테스트, 악성코드 분석, CTF 대회, 보안 연구에는 통제되고 허가된 환경 밖에서는 위험할 수 있는 기법이 쓰일 수 있다. 문제는 같은 지원이 실제 공격자에게도 유용할 수 있다는 점이다. 2
4
우려의 핵심은 거부 행동이 제거된 모델 자체가 존재한다는 사실만은 아니다. 오픈웨이트 모델은 기술 역량이 있는 이용자에게 원래부터 수정 실험의 여지를 제공해 왔다. 더 큰 문제는 브라우저나 API로 접근 가능한 서비스가 모델 가중치와 컴퓨팅 인프라를 직접 다루지 않아도 되는 환경을 제공해, 위험한 기능에 접근하는 실무적 장벽을 낮춘다는 점이다. 3
7
회사는 가중치 수준의 편집 뒤에도 원래 모델의 코딩·사이버보안 능력이 유지된다고 말한다. 하지만 거부 행동을 바꾸기 위한 가중치 수정은 다른 학습된 행동에도 영향을 줄 가능성이 있다. 제공된 근거에는 수정 전후의 역량, 신뢰성, 기타 행동 변화를 폭넓게 비교한 독립 벤치마크가 없다. 13
15
익스플로잇 코드나 공격 단계 지원을 요청하는 일이 허가된 보안 평가의 일부일 수는 있다. 동시에 실제 침입 준비일 수도 있다. 크롬 비밀번호와 병원체 관련 출력 사례는 이용자의 설명만으로 합법적 의도를 신뢰하기 어려운 이유를 보여준다. 7
TechCrunch 보도에 따르면, 해당 매체가 테스트한 경로에서는 강력한 접근 통제가 뚜렷하게 보이지 않았다. 기자들은 계정을 빠르게 만들고 브라우저에서 무료로 시스템에 접근했다. 7
다만 제공된 보도만으로 회사의 현재 통제 체계 전체를 확정할 수는 없다. 특정 장치가 전혀 없다고 단정할 근거도 부족하다. 그럼에도 다음과 같은 핵심 질문은 남는다.
이런 조치가 이중용도 문제를 완전히 없애지는 못한다. 그러나 익명적·기회주의적 오용은 더 어렵게 만들면서, 책임 있는 승인 보안 테스트를 위한 경로는 유지할 수 있다.
Abliteration.ai는 모델 수정 기법을 호스팅 제품으로 전환했다. 즉, 사이버보안과 에이전트 테스트를 위해 거부 행동을 제거한 GLM-5.3 파생 모델을 제공한다. 1
7 레드팀 활용 근거는 이해할 수 있지만, TechCrunch가 보도한 테스트 결과는 이 서비스가 이론적 안전 논쟁에 그치지 않는 이유를 보여준다.
7
결국 핵심은 거버넌스다. 표준 모델이 거절하는 지원을 제공하도록 설계된 서비스라면, 안전성은 이용자가 방어 목적이라고 말하는 데만 기대기 어렵다. 검증 가능한 접근 통제, 의미 있는 위험 활동 심사, 그리고 책임성 있는 운영이 뒷받침돼야 한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Abliteration.ai는 거부 행동을 제거했다고 밝힌 Z.ai GLM 5.3 파생 모델을 브라우저와 API로 제공한다.
Abliteration.ai는 거부 행동을 제거했다고 밝힌 Z.ai GLM 5.3 파생 모델을 브라우저와 API로 제공한다. 회사는 가중치 수준에서 거부와 연관된 패턴을 수정하면서 코딩·사이버보안·에이전트 기능은 유지한다고 주장하지만, 이를 뒷받침하는 독립적 검증은 제공된 자료에서 확인되지 않는다.
핵심 쟁점은 공격적 보안 테스트의 정당성 자체보다, 쉽게 접근 가능한 호스팅 서비스가 오용을 걸러낼 신원 확인·위험 활동 탐지·사후 집행 장치를 갖췄는지에 있다.