DeepSeek는 2026년 8월 17일 0시(베이징 시간)부터 V4 Flash와 V4 Pro에 시간대별 요금을 적용했다. 오프피크 요금은 피크 요금의 절반이며, 피크 시간은 매일 09:00 12:00와 14:00 18:00다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek가 V4 API 요금 체계를 고정 요금제에서 피크·오프피크 시간대별 과금제로 바꿨다. 변경 사항은 2026년 8월 17일 0시(베이징 시간)에 적용됐으며, 한국 시간으로는 같은 날 오전 1시다. UTC 기준으로는 8월 16일 16시부터다. 오프피크 요금은 피크 요금의 정확히 절반이다. 1
2
이번 조정에 따라 모델과 토큰 유형, 요청이 접수된 시간에 따라 기존 고정 요금 대비 인상폭이 50%에서 최대 1,100%까지 달라진다. 1
2
새 요금제는 DeepSeek-V4-Flash와 DeepSeek-V4-Pro에 적용된다. 피크 시간은 베이징 시간 기준으로 다음 두 구간이다.
나머지 시간은 오프피크로 분류된다. 요청이 실제로 처리 완료된 시간이 아니라, 플랫폼 서버가 요청을 접수한 시점을 기준으로 과금 구간이 결정된다. 따라서 개발자는 트래픽을 예약하거나 지연시킬 때 베이징 시간 기준을 고려해야 한다. 2
7
결국 같은 모델과 같은 토큰 수를 사용하더라도 피크 시간에 요청하면 오프피크보다 두 배의 비용이 발생한다.
아래 금액은 모두 토큰 100만 개당 중국 위안화다. ‘캐시 적중 입력’은 이전에 저장된 프롬프트 접두부를 재사용할 수 있는 입력이고, ‘캐시 미적중 입력’은 캐시를 활용하지 못해 더 높은 입력 요금이 적용되는 경우다.
| 모델·토큰 유형 | 기존 고정 요금 | 오프피크 요금 | 기존 대비 | 피크 요금 | 기존 대비 |
|---|---|---|---|---|---|
| V4-Flash 캐시 적중 입력 | ¥0.02 | ¥0.05 | +150% | ¥0.10 | +400% |
| V4-Flash 캐시 미적중 입력 | ¥1.00 | ¥1.50 | +50% | ¥3.00 | +200% |
| V4-Flash 출력 | ¥2.00 | ¥4.50 | +125% | ¥9.00 | +350% |
| V4-Pro 캐시 적중 입력 | ¥0.025 | ¥0.15 | +500% | ¥0.30 | +1,100% |
| V4-Pro 캐시 미적중 입력 | ¥3.00 | ¥4.50 | +50% | ¥9.00 | +200% |
| V4-Pro 출력 | ¥6.00 | ¥13.50 | +125% | ¥27.00 | +350% |
V4-Flash의 공식적으로 제시된 요금은 오프피크 기준 캐시 적중 입력 ¥0.05, 캐시 미적중 입력 ¥1.50, 출력 ¥4.50이며, 피크 시간에는 각각 ¥0.10, ¥3, ¥9로 오른다. 2 전체 V4 요금 조정의 인상폭은 모델과 토큰 유형에 따라 50~1,100%로 보고됐다.
1
8
특히 눈에 띄는 부분은 V4-Pro의 캐시 적중 입력이다. 피크 요금 ¥0.30은 기존 ¥0.025보다 12배 높아져 가장 큰 증가율을 기록했다. 다만 절대 금액 자체는 캐시 미적중 입력이나 출력보다 여전히 낮다. 1
19
모델 평가, 문서 색인, 데이터 백필, 합성 데이터 생성, 비긴급 에이전트 작업처럼 즉시 결과가 필요하지 않은 업무는 피크 시간대를 피해 실행할 수 있다. 오프피크 요금이 피크의 절반인 만큼, 작업 예약만으로도 비용을 크게 줄일 수 있다. 2
이제 AI 인프라 운영에서 시간대가 새로운 비용 변수가 됐다. 작업 큐가 마감 시한과 베이징 시간 기준의 과금 구간을 함께 파악한다면, 모델을 바꾸거나 토큰 예산을 줄이지 않고도 일부 작업을 뒤로 미룰 수 있다.
고객지원 챗봇, 코딩 보조 도구, 실시간 에이전트는 사용자가 서비스를 이용하는 시간에 작동하므로 피크 요금을 피하기 어렵다. 대신 다음과 같은 방식으로 비용을 관리할 수 있다.
캐싱은 특히 중요하다. 두 모델 모두 캐시 적중 입력이 캐시 미적중 입력보다 훨씬 저렴하기 때문이다. 같은 지침이나 문서 내용을 반복적으로 전송하는 대규모 시스템이라면, 요청 수를 조금 줄이는 것보다 캐시 적중률을 높이는 편이 더 큰 절감 효과를 낼 수 있다.
긴 추론 과정, 보고서 작성, 대규모 코드 생성처럼 출력 토큰을 많이 사용하는 서비스는 새 요금제의 영향을 크게 받는다. 피크 시간 기준 출력 요금은 Flash가 100만 토큰당 ¥9, Pro가 ¥27이다. 1
2
개발자는 출력 상한을 조정하고, 일상적인 요청에는 Flash를 사용하며, 추가 성능이 꼭 필요한 작업에만 Pro를 배정하는 방식으로 대응할 수 있다.
V4-Pro의 피크 캐시 적중 입력 요금은 기존보다 1,100% 올랐다. 절대 비용은 낮지만, 같은 프롬프트를 대규모로 반복 처리하는 서비스에서는 누적 비용 차이가 커질 수 있다. 캐시 적중률과 피크 시간대 요청 비중을 함께 점검해야 하는 이유다. 1
19
이번 요금 조정은 8월 13일 DeepSeek-V4-Pro-0813이 deepseek-v4-pro 엔드포인트를 통해 일반 제공되기 시작한 직후 이뤄졌다. 공개된 사양에 따르면 이 텍스트 모델은 100만 토큰 컨텍스트 창과 최대 38만4,000토큰 출력을 지원하며, 총 약 1조6,000억 개 파라미터와 토큰당 약 490억 개 활성 파라미터를 사용하는 Mixture-of-Experts 구조다. 29
33
계정 기준 동시 요청 한도도 두 모델 간 차이가 있다.
스트리밍 응답을 포함해 요청이 완료될 때까지 슬롯 하나를 점유한다. 28
가격과 동시성 한도를 함께 보면 Flash는 대규모·고처리량의 일반 작업에, Pro는 더 높은 성능이 필요한 추론 및 대규모 컨텍스트 작업에 맞춘 계층으로 볼 수 있다. 다만 이는 공개된 가격 구조와 한도를 바탕으로 한 해석이며, DeepSeek가 모든 사용 사례를 이렇게 규정했다는 직접적인 발표는 아니다. 2
28
DeepSeek의 새 정책은 GPU 추론 수요를 시간대별로 분산하려는 수요 조절 전략에 가깝다. 이용자가 몰리는 시간에는 용량이 부족해지고, 배치 작업은 대기할 수 있다. 피크 시간에 더 높은 요금을 부과하고 나머지 시간에 낮은 요금을 제공하면, 개발자는 유연한 작업을 한산한 시간대로 옮길 유인을 갖게 된다.
개발팀의 비용 최적화 기준도 달라진다. 이제 단순히 어떤 모델을 선택하고 토큰을 얼마나 썼는지만 계산해서는 부족하다. 다음 항목을 함께 관리해야 한다.
더 넓게 보면 이는 대규모 언어 모델 가격 경쟁이 무조건적인 단가 인하에서 컴퓨팅 용량의 희소성에 따른 차등 가격으로 이동하고 있음을 보여준다. DeepSeek는 유연한 수요를 위한 저렴한 경로를 남겨두면서도, 고성능 추론 용량을 언제 사용하는지에 따라 비용이 달라지도록 만들었다. 로이터는 이번 조정을 단일한 일괄 인상이 아니라 모델, 토큰 유형, 사용 시간에 따라 달라지는 상당한 폭의 인상으로 설명했다. 1
DeepSeek V4를 사용하는 팀이 얻을 수 있는 실무적 교훈은 분명하다. API 비용 모델에 작업 예약, 캐싱, 모델 라우팅, 출력 제어를 포함해야 한다는 것이다. 시간대를 바꿀 수 없는 실시간 작업은 더 저렴한 모델이나 더 짧은 토큰 예산이 필요할 수 있고, 기다릴 수 있는 작업은 오프피크 실행만으로 비용 증가분의 상당 부분을 줄일 수 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
DeepSeek는 2026년 8월 17일 0시(베이징 시간)부터 V4 Flash와 V4 Pro에 시간대별 요금을 적용했다. 오프피크 요금은 피크 요금의 절반이며, 피크 시간은 매일 09:00 12:00와 14:00 18:00다.
DeepSeek는 2026년 8월 17일 0시(베이징 시간)부터 V4 Flash와 V4 Pro에 시간대별 요금을 적용했다. 오프피크 요금은 피크 요금의 절반이며, 피크 시간은 매일 09:00 12:00와 14:00 18:00다. 피크 시간 기준 출력 토큰 요금은 V4 Flash가 100만 토큰당 ¥9, V4 Pro가 ¥27이다. 캐시 적중 입력은 캐시 미적중 입력보다 훨씬 저렴하다.
이번 변화로 모델 선택뿐 아니라 프롬프트 캐싱, 작업 예약, 출력 길이 제한까지 API 비용을 좌우하는 핵심 운영 요소가 됐다.