딥시크 V4 Flash는 딥시크 V4 제품군의 효율성 중심 버전으로, 높은 볼륨과 짧은 지연 시간이 중요한 작업을 위해 설계되었다. MoE 아키텍처를 사용하여 총 2840억 개의 파라미터를 가지고 있지만, 토큰당 단 130억 개의 파라미터만 활성화된다. 즉, 모델은 방대한 전문 지식 풀에 접근하면서도 추론 속도를 빠르게 유지하고 비용 효율성을 높인다.
| 속성 | 값 |
|---|---|
| 총 파라미터 | 284B (DSpark 드래프트 모듈 포함 시 304B) |
| 활성 파라미터 | 토큰당 13B |
| 아키텍처 | Mixture-of-Experts (MoE) |
| 컨텍스트 윈도우 | 100만 토큰 |
| 최대 출력 | 384K 토큰 |
| 정밀도 | FP4 + FP8 혼합 |
| 라이선스 | MIT |
| 다운로드 크기 | 약 160 GB |
출처:
V4 Flash와 V4 Pro 모두 MIT 라이선스로 배포되어, 로열티 없이 상업적 사용, 수정, 배포가 무제한으로 가능하다. 웨이트는 Hugging Face에서 다운로드할 수 있으며, 사설 인프라에 자체 호스팅할 수 있다. 딥시크 V4는 MIT 라이선스 하에 100만 토큰 컨텍스트 윈도우를 제공하는 유일한 오픈 웨이트 모델 제품군이다.
V4 Flash 모델은 두 가지 새로운 메커니즘을 결합한 하이브리드 어텐션 아키텍처를 통해 100만 토큰 컨텍스트 윈도우를 구현한다.
모델은 CSA와 HCA 계층을 번갈아 사용한다. 2번째 계층부터 짝수 계층은 CSA(4:1 압축)를, 3번째 계층부터 홀수 계층은 HCA(128:1 압축)를 사용한다. 최신 정보 유지를 위해 마지막 128개의 원시 토큰에 대한 슬라이딩 윈도우 브랜치가 항상 존재한다.
모델 체크포인트는 혼합 정밀도 양자화를 사용하여 메모리 사용량을 줄인다.
nvidia/DeepSeek-V4-Flash-NVFP4)도 제공된다.FP8에서 전체 284B 모델의 웨이트는 약 284GB이다. 자체 호스팅을 위한 100만 컨텍스트 전체 사용 권장 최소 구성은 4x NVIDIA H200 SXM5(총 564GB VRAM)이다.
딥시크 V4 Flash는 개발자가 모델의 추론 모드를 선택할 수 있는 구성 가능한 reasoning_effort 파라미터를 제공한다.
이 파라미터를 통해 개발자는 응답 시간과 추론 깊이 사이의 균형을 조정할 수 있어, 간단한 분류부터 고급 코드 생성 및 다단계 계획에 이르기까지 다양한 사용 사례에 적응시킬 수 있다.
딥시크 V4 Flash의 가격은 입력 토큰 100만 개당 $0.14(캐시 미스 기준), 출력 토큰 100만 개당 $0.28이다. 반복되는 시스템 프롬프트나 공통 접두사와 같은 캐시된 입력의 경우 가격이 토큰 100만 개당 $0.0028로 98%까지 할인된다.
비교해보면, V4 Flash의 출력 가격은 Sonnet 4.6($15/백만 토큰)보다 54배 저렴하고, GPT-5.5($30/백만 토큰)보다 107배 저렴하다. 여러 소스에서 이를 "가장 저렴한 프론티어급 API"라고 설명한다.
7월 31일 프로덕션 릴리스(V4-Flash-0731)는 아키텍처 변경 없이 재학습(re-post-training)을 통해 에이전트 및 코딩 성능을 크게 향상시켰다. 공식 업데이트 로그에 따르면:
릴리스 노트에 따르면, 이 모델은 "에이전트 및 코딩 벤치마크에서 더 큰 형제 모델인 V4-Pro와 비슷한 수준의 성능을 보인다"고 밝혔다. 이는 에이전트 작업 부하에 있어 기존의 Pro/Flash 성능 계층 구조를 사실상 무너뜨리는 결과이다.
딥시크는 또한 에이전트 AI 분야로 적극적으로 확장하고 있다. 2026년 8월 1일, 회사는 DeepSeek Harness의 클로즈드 베타에 참여할 오픈소스 개발자 모집을 시작했다. 이 프레임워크는 LLM을 작업을 자율적으로 실행하고, 컨텍스트를 관리하며, 도구를 호출할 수 있는 AI 에이전트로 변환하도록 설계되었다.
이 이름은 7월 31일 V4-Flash-0731 변경 로그에 "곧 출시 예정"이라는 메모와 함께 처음 등장했다. Harness 엔지니어링 팀은 2026년 3월, Cui Tianyi가 딥시크에 합류하면서 처음부터 팀을 구축하여 설립되었다.
베타 테스트에 참여하려면 개발자는 Agent Harness 관련 프로젝트 경험이 있어야 하며, GitHub ID와 대표 작업물을 제출해야 한다.
CEO Liang Wenfeng의 지휘 아래 딥시크의 접근 방식은 AGI(범용 인공지능)로 가는 길로 저렴하면서도 강력한 모델을 구축하는 데 중점을 둔다. V4 Flash의 가격($0.14/$0.28/백만 토큰)과 MIT 오픈 웨이트 전략은 이러한 철학을 가장 잘 보여주는 운영적 증거이다. 한 소식통은 "V4-Flash의 $0.28/M 출력 가격은 GPT-5.5보다 약 107배 저렴하다"고 언급한다.
딥시크는 알리바바(Qwen 시리즈), 바이트댄스(Doubao), Moonshot AI, MiniMax, Z.AI와 같은 국내 경쟁사와 경쟁하고 있지만, V4 제품군은 자사의 성능 계층에서 MIT 허용 라이선스 하에 제공되는 유일한 오픈 웨이트 모델이다. 또한 여러 소스에서 딥시크의 IPO 준비에 대해 언급하고 있지만, 구체적인 날짜나 인수 주간사는 확인되지 않았다.
수집된 소스는 포괄적인 그림을 제시하지만, 다음 주장들은 독립적으로 확인할 수 없었다.
이러한 세부 사항은 더 넓은 업계 보도에서 확인될 수 있으며, 추가 검색을 통해 확인할 수 있다.