DeepSeek V4 Flash는 OpenRouter의 7월 27일 8월 2일 주간 순위에서 7조 2,200억 토큰으로 1위를 기록했다. 다만 집계 기간에는 7월 31일 출시된 정식 0731 빌드 이전의 프리뷰 사용량도 포함된다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731의 급부상은 모델 기본 선택지가 얼마나 빨리 바뀔 수 있는지를 보여준다. 낮은 토큰 가격, 대용량 컨텍스트, 그리고 OpenRouter 같은 모델 집계 플랫폼의 쉬운 접근성이 한꺼번에 맞물렸기 때문이다. 보도에 따르면 이 모델은 7월 27일~8월 2일 OpenRouter 주간 사용량 순위에서 7조 2,200억 토큰으로 1위에 올랐다. 5
다만 이 수치를 ‘정식 출시 후 나흘 만에 발생한 사용량’으로 읽어서는 안 된다. 정식 0731 빌드의 공개 베타는 7월 31일 시작됐지만, V4-Flash에는 그 이전 프리뷰 경로가 있었고 deepseek-v4-flash 엔드포인트는 이후 0731 빌드로 전환됐다. 즉 해당 주간 합계에는 새 정식 빌드만의 사용량이 아니라 프리뷰 기간의 트래픽도 섞여 있다. 3
7월 31일 빌드는 전체 파라미터 2,840억 개 가운데 토큰당 130억 개를 활성화하는 희소 Mixture-of-Experts(MoE) 모델이다. OpenRouter는 이 모델을 코딩·추론·에이전트 워크플로에 적합한 모델로 소개하며, 컨텍스트 윈도는 131만 720토큰으로 표기한다. 1
이 조합은 특히 다음과 같은 토큰 집약적 업무에서 매력적이다.
MoE 구조 자체가 실제 비용 절감이나 품질 우위를 보장하는 것은 아니다. 전체 모델 크기보다 적은 파라미터만 토큰별로 활성화해, 비슷한 총규모의 밀집형 모델보다 토큰당 연산 부담을 낮추려는 설계라는 점이 핵심이다. 실제 서비스에서 이 이점이 얼마나 살아나는지는 지연 시간, 공급자 수용량, 라우팅, 프롬프트 설계, 출력 길이에 따라 달라진다.
TechNode는 DeepSeek V4 Flash가 해당 주간 OpenRouter에서 7조 2,200억 토큰을 처리했다고 보도했다. 같은 보도에 따르면 중국 모델들이 상위 4개 자리를 차지했고, DeepSeek V4 Flash 0731과 V4 Pro도 상위 6위 안에 들었다. 5
여기서 또 하나의 중요한 변수는 무료 체험이다. 보도에 따르면 OpenCode에서 이 모델은 8월 1일 하루 8조 토큰을 처리했는데, 이 중 5조 토큰은 무료 체험으로 소비됐고 개발자가 지불한 물량은 3조 토큰이었다. 5
무료 체험은 단순한 잡음만은 아니다. 개발자가 모델을 시험하는 장벽을 낮추고, 이후 채택으로 이어질 수 있기 때문이다. 하지만 무료 트래픽과 지속적인 유료 프로덕션 수요는 분명히 구분해야 한다. 현재 증거가 뒷받침하는 결론은 V4-Flash가 매우 빠르게 배포되고 폭넓게 시험됐다는 것이지, 초기 물량 전체가 유료 전환이나 장기 운영 사용이었다는 뜻은 아니다.
가격은 공급자, 라우팅 경로, 할인, 캐시 상태, 확인 시점에 따라 달라진다. 7월 31일 출시 보도에서 언급된 공식 가격은 캐시 미적용 입력 100만 토큰당 0.14달러, 출력 0.28달러였고, 8월 초 OpenRouter에는 이와 다른 경로별 가격이 등록됐다. 3
OpenRouter의 후속 deepseek-v4-flash-0731 등록 정보는 입력 100만 토큰당 0.05달러, 출력 0.16달러, 캐시 읽기 0.013달러를 제시한다. 1
| 모델 | 공개된 입력 / 출력 가격(100만 토큰당) | V4-Flash 0.05 / 0.16달러 대비 |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0.05달러 / 0.16달러 |
기준 |
| Kimi K3 | 3달러 / 15달러 |
약 60배 / 94배 높음 |
| GPT-5.6 Sol | 5달러 / 30달러 |
약 100배 / 188배 높음 |
| Claude Fable 5 | 10달러 / 50달러 |
약 200배 / 313배 높음 |
이는 공개 리스트 가격을 단순 산술 비교한 결과다. 네 모델의 품질, 속도, 도구 호출 신뢰성, 안전성, 가동률이 동등하다는 뜻은 아니다. 실제 작업 비용은 입력·출력 길이, 캐시 활용률, 재시도, 도구 호출, 공급자 선택, 상위 모델로의 에스컬레이션 빈도에 따라 크게 달라진다.
이 모델들을 모두 고급 코딩·에이전트 용도라는 이유만으로 서로 대체 가능한 제품처럼 볼 수는 없다. 제공된 비교 자료에서 Kimi K3는 2조 8,000억 파라미터 MoE 모델과 100만 토큰 컨텍스트를 갖춘 것으로 소개된다. GPT-5.6 Sol은 105만 토큰, Claude Fable 5는 100만 토큰 컨텍스트로 제시된다. 17
실무에서는 다음처럼 접근하는 편이 유용하다.
공개 벤치마크는 후보군을 좁히는 데 도움을 주지만, 단일 점수로 프로덕션 기본 모델을 결정할 수는 없다. 기존 주장에 포함된 ‘Agent Ultimate 25.2 대 25.7’ 비교는 제공된 1차 성격 자료로 독립 검증되지 않았으므로, 성능 동등성의 근거로 쓰기 어렵다. DeepSeek의 공개 자료는 Terminal Bench 2.1에서 82.7점, NL2Repo에서 54.2점 등을 제시하지만, 이 역시 실제 업무별 검증을 대체하지는 않는다. 10
현실의 결정은 “어느 모델이 리더보드에서 이겼나”가 아니다. 더 중요한 질문은 우리 업무에서 충분히 안정적으로 작동하면서, 라우팅과 실패 비용까지 감안해도 얼마나 절감되는가다.
실무 평가의 순서는 다음과 같다.
V4-Flash의 상승이 의미 있는 이유는 초기 토큰 수치에 체험 물량이 포함됐을 가능성이 있어도 달라지지 않는다. 집계 플랫폼을 통해 개발자는 긴 컨텍스트와 매우 낮은 단가를 갖춘 선택지를 즉시 시험할 수 있었다. 자체 평가에서 충분한 성능을 보인다면, 일상적 대량 업무의 기본 모델을 더 비싼 모델에서 바꾸는 계기가 될 수 있다.
제공된 근거는 OpenRouter 주간 7조 2,200억 토큰 1위, 프리뷰 기간과의 중첩, OpenCode 무료 체험 물량을 뒷받침한다. 3
5 반면 중국 모델이 상위 10개 중 9개를 차지했다거나, 미국 모델 호출량을 14주 연속 앞섰다거나, 미국·유럽 개발자의 광범위한 이동이 발생했다거나, 실제 추론 비용이 60~85% 절감됐다는 주장은 이 자료만으로 충분히 입증되지 않는다. GPT-5.6 Luna가 특정 이유로 80% 가격 인하를 했다는 주장도 마찬가지다.
이런 결론에는 OpenRouter 대시보드 원자료, 공급자별 가격 기록, 재현 가능한 업무별 비용 연구가 필요하다. 지금 확인할 수 있는 더 좁고 정확한 결론은 이렇다. DeepSeek V4-Flash는 매우 낮은 경로별 가격, 큰 컨텍스트 윈도, 폭넓은 접근성을 결합해 개발자들이 저렴한 에이전트·코딩 모델을 시험하려는 순간 빠른 사용량 급증을 만들었다. 다만 그것만으로 시장의 영구적인 재편까지 증명되지는 않는다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
DeepSeek V4 Flash는 OpenRouter의 7월 27일 8월 2일 주간 순위에서 7조 2,200억 토큰으로 1위를 기록했다. 다만 집계 기간에는 7월 31일 출시된 정식 0731 빌드 이전의 프리뷰 사용량도 포함된다.
DeepSeek V4 Flash는 OpenRouter의 7월 27일 8월 2일 주간 순위에서 7조 2,200억 토큰으로 1위를 기록했다. 다만 집계 기간에는 7월 31일 출시된 정식 0731 빌드 이전의 프리뷰 사용량도 포함된다. OpenRouter의 후속 등록 정보상 0731 경로 가격은 입력 100만 토큰당 0.05달러, 출력 0.16달러다. 긴 문서·코드베이스·에이전트 반복 작업처럼 토큰 사용량이 큰 업무에서 특히 매력적이다.
초기 급증에는 무료 체험 트래픽도 영향을 줬을 가능성이 크다. OpenCode의 8월 1일 처리량 8조 토큰 중 5조 토큰이 무료 체험분이었다고 보도됐다.