비용 산출 방식: GLM 5.2의 공개 API 가격은 GPT-5.5 또는 Claude Opus 4.8의 약 1/5에서 1/6 수준입니다 GD. 순수 출력 기준으로만 보면, GLM 5.2(100만 토큰당 4.40달러)는 GPT-5.5(30달러)의 약 1/6.8 가격입니다 OF. 캐시된 입력의 경우 100만 토큰당 0.26달러로 더 저렴해집니다 GF.
이는 업계에서 흔히 볼 수 있는 NVIDIA H100/H200 기반과는 확연히 다른 하드웨어 전략이며, Featherless는 이를 통해 NVIDIA 공급망 병목 현상을 피할 수 있다고 설명합니다 I.
| 사양 | 세부 정보 |
|---|---|
| 아키텍처 | 총 744B 파라미터, Mixture-of-Experts (MoE), 토큰당 약 40B 활성화 GS |
| 컨텍스트 윈도우 | 공개 클라우드 최대 256K 토큰, 프라이빗 클라우드 최대 100만 토큰 FI |
| 양자화 | 기본 FP8 (가중치 약 750GB VRAM 필요) FOR |
| 오픈 웨이트 | 예 — Z.ai가 MIT 라이선스로 오픈 웨이트 공개 IDA |
| 훈련 집중 분야 | 코딩 우선, 소프트웨어 엔지니어링 작업 특화 GDS |
FP8 양자화에서 모델 가중치는 약 750GB의 VRAM이 필요하며, 이는 4개의 MI325X GPU(4 x 256GB)가 제공하는 총 1TB VRAM에 여유 있게 수용되며, 확장된 컨텍스트 길이에서 KV 캐시를 위한 여유 공간도 확보됩니다 OR.
SWE-bench Pro (실제 소프트웨어 엔지니어링):
Terminal-Bench 2.1 (에이전트 코딩 작업):
Featherless에 따르면 GLM 5.2는 Arena WebDev 코딩 리더보드에서 2위를 기록했습니다 F.
GLM 5.2의 가장 큰 강점은 비용 우위입니다. Z.ai 공식 API 요금 기준:
| 모델 | 입력 (100만 토큰당) | 출력 (100만 토큰당) |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GPT-5.5 | ~$5.00 | ~$30.00 |
| Claude Opus 4.8 | ~$8.00 | ~$40.00 |
현실적인 3:1 출력-입력 워크로드 비율에서 GLM 5.2는 100만 토큰당 약 3.65달러인 반면, GPT-5.5는 약 23.75달러로 약 1/6.5의 비용 비율을 보입니다 O. 독립적인 트래커들은 오픈 웨이트를 제공하는 여러 제공업체의 중간값을 더 낮게(입력 약 0.55달러, 출력 약 1.85달러) 기록하기도 합니다 DD.
Featherless의 GLM 5.2 프라이빗 클라우드는 다음과 같은 팀에 가장 적합합니다.
또한 Featherless는 소형 모델에 대한 서버리스 액세스를 위해 월 25달러부터 시작하는 저렴한 정액 요금제도 제공하지만, 7,500달러짜리 전용 노드는 전체 GLM 5.2 모델에 대해 지속적이고 대량의 추론이 필요한 팀을 위한 제품입니다 F.
Featherless의 새로운 서비스는 4x AMD MI325X GPU에서 구동되는 GLM 5.2용 월 7,500달러 정액제 프라이빗 클라우드를 제공하며, 대규모 에이전트 사용 시 독점 API 대비 94%의 비용 절감을 주장합니다. 744B MoE 모델은 SWE-bench Pro에서 GPT-5.5를 능가하면서 토큰당 가격은 약 1/6에 불과하여, 코딩 및 에이전트 추론 워크로드가 많은 조직에게 매력적인 오픈 웨이트 대안입니다. Claude Opus 4.8이 일부 벤치마크에서 여전히 앞서고 있지만, GLM 5.2와 Featherless 조합의 비용 우위는 성능 저하 없이 예산을 고려하는 팀에게 진지하게 고려할 만한 옵션입니다.