| 버전 | 총 매개변수 | 활성 매개변수 | 컨텍스트 윈도우 | 최대 출력 |
|---|---|---|---|---|
| V4-Pro | 1.6조 (MoE) | 토큰당 약 490억 개 | 100만 토큰 | 38만 4000 토큰 |
| V4-Flash | 2840억 (MoE) | 토큰당 약 130억 개 | 100만 토큰 | 38만 4000 토큰 |
두 버전 모두 멀티모달(텍스트, 이미지, 비디오)을 지원하며, JSON 출력 및 도구 호출 기능을 갖추고 API와 웹을 통해 사용할 수 있다 .
| 버전 | 입력 (비성수기) | 출력 (비성수기) | 캐시 적중 시 |
|---|---|---|---|
| V4-Pro | 0.435달러 | 0.87달러 | 90% 할인 |
| V4-Flash | 0.14달러 | 0.28달러 | 90% 할인 |
딥시크는 또한 2026년 5월 초까지 V4-Pro에 대해 75% 할인 프로모션을 진행하기도 했다 . 참고로 GPT-5.5의 출력 가격은 백만 토큰당 약 30달러로, V4-Flash가 출력 가격 기준으로 약 107배 저렴한 셈이다 .
딥시크 V4의 벤치마크 결과는 흥미로운 그림을 보여준다:
미국 국립표준기술연구소(NIST) CAISI 평가(2026년 5월)의 중요 경고: 딥시크의 자체 보고 벤치마크는 GPT-5.4 및 Opus 4.6과 동등한 성능을 주장했지만, CAISI의 독립 평가 결과 V4는 비공개 벤치마크에서 "상당히 덜 뛰어난" 것으로 나타나, 일부 자체 보고 점수가 부풀려졌을 가능성을 시사한다 . 인공지능 분석(Artificial Analysis)의 인텔리전스 지수(Intelligence Index)는 GPT-5.5(높음)를 53으로, 딥시크 V4 Pro (추론, 고노력)를 41*로 평가했다. GPT-5.5가 더 뛰어난 지능과 빠른 속도(초당 69 토큰 대 56 토큰)를 보이지만, 딥시크는 극적으로 저렴하다(추론 모드 기준 백만 토큰당 0.18달러 대 4.35달러) .
알리바바의 큐원(Qwen) 팀은 2026년 7월 19일 상하이에서 열린 세계 AI 컨퍼런스(World AI Conference)에서 **큐원 3.8 맥스(Qwen 3.8 Max)**를 프리뷰로 공개했다 . 이는 1조 개 이상의 매개변수를 가진 첫 번째 플래그십 모델이다.
| 속성 | 세부 정보 |
|---|---|
| 총 매개변수 | 2.4조 (희소 MoE) |
| 아키텍처 | Mixture-of-Experts, 멀티모달(텍스트 + 시각 확인됨) |
| 컨텍스트 윈도우 | 큐원 클라우드(Qwen Cloud) 엔드포인트 기준 983,616 토큰 ; 일부 소스에서는 약 100만 개로 언급 |
| 최대 출력 | 64,000 토큰 |
| 라이선스 | 아직 공개되지 않음; 알리바바는 "곧" 오픈웨이트를 공개할 것이라고 밝힘 |
공개된 종량제 요금제는 없다. 현재 접근은 큐원 채팅(Qwen Chat) 및 선별된 API 파트너를 통한 구독 형태로만 가능하다. 벤치LM(BenchLM)은 큐원 3.8 맥스 프리뷰의 가격을 "명시되지 않음"으로 표기하고 있다 . 일부 제3자 추적 사이트에서는 입력/출력 백만 토큰당 1.50달러/5.00달러의 자동 가격을 보여주지만, 이는 알리바바가 공식 확인한 바가 없다 .
알리바바는 큐원 3.8이 "페이블 5(Fable 5: Anthropic의 최고 클로드 모델)에 이어 두 번째" 라고 주장하는데, 이는 알리바바 자체 순위에서 GPT-5.5와 딥시크 V4보다 앞서는 위치다 . 큐원 3.7 맥스 대비 코딩, 전문가 생산성, 풀스택 개발, 데이터 분석, 오피스 워크플로우에서 향상된 점이 있다고 주장한다 .
그러나 독립적인 벤치마크 결과는 전혀 공개되지 않았다. 벤치마크 추적 사이트인 벤치LM은 2026년 7월 20일 기준으로 큐원 3.8 맥스 프리뷰에 대해 321개의 벤치마크를 추적하고 있지만, 검증된 결과는 0건이다 . 한 분석은 "큐원 3.8은 테스트해볼 가치가 있지만, 키미 K3(Kimi K3), GPT-5.6 솔(Sol), 또는 클로드 페이블 5(Claude Fable 5)를 대체할 안정적인 프로덕션 모델로 간주하기에는 아직 이르다"고 평가했다 .
맥락을 위해 언급하자면, 큐원의 이전 모델들은 강력한 기반을 마련했다: 큐원 3.6-맥스-프리뷰(Qwen 3.6-Max-Preview) (2026년 4월 20일)는 총 350억 개/활성 30억 개 매개변수의 텍스트 전용 모델로, 26만 2천 토큰 컨텍스트를 갖추고 6개 코딩 및 에이전트 벤치마크에서 1위를 주장했다 . 큐원 3.7-맥스(Qwen 3.7-Max) (2026년 5월)는 100만 토큰 컨텍스트 윈도우로 확장되었으며 추론 에이전트 기능을 추가했다 . 하지만 둘 다 에이전트 코딩 외에는 일반적으로 최첨단 수준으로 간주되지 않았다.
알리바바는 큐원 3.8을 "페이블 5에 이어 두 번째"라고 명확히 위치시킨다 . 이 주장이 독립적인 평가에서 사실로 밝혀진다면, 큐원 3.8이 GPT-5.5와 딥시크 V4를 훨씬 앞서는 것이 된다. 하지만 검증된 벤치마크가 전혀 없기 때문에, 이는 현재로서는 마케팅 주장에 불과하며 확립된 사실이 아니다. 알리바바 자체 구도에 따르면, Anthropic의 페이블 5가 현재 인정된 최첨단 선두주자로 보인다 .
딥시크의 공격적인 가격 정책은 API 비용의 바닥 경쟁(race to the bottom)을 촉발했다. V4-Flash의 입력 가격(백만 토큰당 0.14달러)은 어떤 서방 최첨단 모델보다도 급진적으로 저렴하다. 알리바바는 아직 큐원 3.8의 가격을 책정하지 않았지만, 큐원 3.6은 이미 공격적인 가격(입력/출력 약 1.25달러/7.50달러)으로 제공되었다 .
딥시크 V4의 MIT 라이선스 오픈웨이트는 자체 호스팅을 가능하게 하여 폐쇄형 모델 제공업체의 마진을 더욱 압박한다 . 한 분석이 지적했듯이, 실질적인 효과는 "개발자들이 GPT-5.5나 클로드 비용의 극히 일부만으로 (코딩 작업에서) 최첨단에 근접한 성능에 접근할 수 있게 되었다"는 것이다.