이 모델은 Mixture‑of‑Experts(MoE) 구조를 사용한다. 전체 파라미터는 약 80억 개 이상이지만, 실제 추론 과정에서는 약 7억 6천만 개 정도만 활성화된다.
MoE 구조에서는 여러 전문 서브네트워크(‘expert’) 중 일부만 선택적으로 활성화된다. 그 결과 비슷한 규모의 밀집 모델보다 연산 비용을 크게 줄이면서 성능을 유지할 수 있다.
대부분의 언어 모델은 자기회귀 생성 방식을 사용한다.
동작 과정은 단순하다.
문제는 각 토큰이 이전 토큰에 의존하기 때문에 계산을 병렬화하기 어렵다는 점이다. 생성 과정은 결국 순차적 작업이 되고, KV 캐시에 반복적으로 접근하면서 메모리 대역폭이 병목이 되는 경우가 많다.
Zyphra의 확산 방식은 이 디코딩 과정을 바꾼다.
토큰을 하나씩 생성하는 대신, 모델은 먼저 여러 후보 토큰 블록을 동시에 생성한다. 현재 공개된 프리뷰 모델에서는 한 단계에서 16개의 토큰 블록을 다룬다.
과정은 대략 다음과 같다.
이 방식의 핵심 장점은 여러 토큰이 동일한 prefix와 KV 캐시 상태를 공유한다는 것이다. 덕분에 모델은 단일 forward pass에서 여러 토큰을 병렬 계산할 수 있다.
즉, 작업 특성이 메모리 대역폭 중심의 순차 처리에서 GPU가 잘하는 대규모 병렬 연산 중심으로 이동한다.
Zyphra가 공개한 속도 향상 수치는 샘플링 전략에 따라 달라진다.
Lossless 샘플러
Logit‑mixing 샘플러
현재 성능 수치는 대부분 Zyphra의 자체 실험 결과이기 때문에 실제 서비스 환경에서 동일한 성능이 나오는지는 독립적인 벤치마크 검증이 필요하다.
이 프로젝트의 또 다른 특징은 하드웨어 생태계다.
Zyphra는 이 모델을 AMD GPU에서 학습한 최초의 확산 언어 모델이라고 설명한다. 대부분의 대규모 AI 모델이 Nvidia GPU 중심 인프라에서 개발되는 것과 대비된다.
이는 단순한 기술적 선택 이상의 의미가 있다.
AI 인프라 시장에서는 이러한 경쟁이 비용 구조에도 영향을 줄 수 있다.
ZAYA1‑8B 모델은 **CCA(Compressed Convolutional Attention)**이라는 어텐션 메커니즘도 사용한다.
이 구조의 목표는 어텐션 연산 비용을 줄이는 것이다. 특히 확산 방식에서는 여러 토큰을 동시에 계산하는 과정이 대규모 prefill 연산과 유사해지기 때문에, 어텐션 효율이 전체 속도에 큰 영향을 준다.
즉,
이 두 요소가 결합되면서 전체 추론 속도 개선이 가능해진다.
이 기술이 실제 서비스 환경에서 동일하게 작동한다면, AI 서비스 비용 구조에도 영향을 줄 수 있다.
추론 속도가 빨라지면 다음과 같은 효과가 가능하다.
다만 Zyphra 역시 확산 기반 LLM 추론 스택은 아직 기존 자기회귀 스택만큼 최적화되지 않았다고 설명한다. 따라서 실제 운영 환경에서의 이득은 워크로드에 따라 달라질 수 있다.
최근 대형 추론 모델은 강화학습(RL) 기반 학습을 많이 사용한다.
이 방식에서는 모델이 하나의 질문에 대해 여러 개의 후보 답변을 생성하고 평가하는 롤아웃(rollout) 과정이 필요하다.
생성 속도가 빨라지면 다음과 같은 효과가 있다.
실제로 RL 기반 모델 개발에서는 추론 비용이 전체 학습 비용의 상당 부분을 차지하는 경우가 많다.
ZAYA1‑8B‑Diffusion‑Preview는 AI 개발의 또 다른 흐름을 보여준다.
최근 연구는 단순히 모델 크기를 키우는 것보다 **"달러당 지능(intelligence per dollar)"**을 높이는 방향으로 이동하고 있다.
이 모델이 결합한 전략은 다음과 같다.
이 접근이 실제 대규모 서비스에서도 효과를 보인다면, 미래의 언어 모델은 단순한 규모 경쟁이 아니라 효율 경쟁으로 발전할 가능성이 있다. 현재로서는 기존 자기회귀 LLM을 확산 디코더로 변환하는 방법이 새로운 속도 최적화 경로가 될 수 있다는 초기 증거로 평가된다.