긴 문서와 대화 기록을 반복해서 읽는 AI 에이전트에서는 얼마나 긴 입력을 받을 수 있는가만큼 그 기록을 처리하고 유지하는 데 얼마나 많은 자원이 드는가가 중요하다. DeepSeek-V4.1-Flash는 이미지와 텍스트를 다루는 공개 가중치 전문가 혼합(MoE) 모델로, 최대 100만 토큰의 문맥을 지원한다. 다만 이는 입력 가능한 길이의 상한이지, 긴 세션의 모든 정보를 빠짐없이 찾아낸다는 보장은 아니다.
2
8
긴 입력에서 연산량을 줄이는 구조
이 모델의 백본은 5,520억 개 파라미터를 갖지만, 입력을 처리하는 프리필(prefill) 단계에서 토큰당 활성화되는 파라미터는 약 80억 개다. 답변을 생성하는 디코드(decode) 단계에서는 약 160억 개가 활성화된다. 기록을 길게 읽고 비교적 짧게 답하는 작업에 맞춘 비대칭 구조다.
2
8
전체 40개 층은 20층 인과적 인코더와 20층 디코더로 나뉜다. 디코더가 과거 입력을 참조할 때 쓰는 전역 키·값(KV) 캐시는 각 디코더 층에서 별도로 만들어지는 대신, 인코더의 최종 상태를 바탕으로 구성된다.
2
9
캐시를 줄이는 두 가지 방식
CSA2와 FP4 저장. CSA2(Compressed Sparse Attention 2)는 어텐션 층을 Full·Reindex·Reuse 중 하나의 고정 모드로 운용해 층 사이에서 캐시 정보와 희소 어텐션의 선택 결과를 재사용한다. 주요 KV 캐시를 FP4 형식으로 저장하는 방식까지 결합하면, DeepSeek가 제시한 전역 KV 캐시 용량은 토큰당 890바이트로 기존 V4-Flash의 약 4분의 1이다. 이는 캐시 용량의 비교치이지, 어느 배포 환경에서나 총비용이 그만큼 줄어든다는 뜻은 아니다.
6
8
저장 대신 필요한 부분만 재생. SWA Bounded Replay는 누락된 슬라이딩 윈도 어텐션의 KV 상태를 가장 최근 토큰 구간만 다시 처리해 복원한다. 해당 상태를 SSD에 계속 보관하지 않아도 되는 방식이다. 모델 카드가 제시한 영구 저장 KV 캐시 용량은 V4-Flash의 약 8분의 1이다. 앞서 언급한 ‘전역 캐시 4분의 1’과는 측정 대상이 다르다.
5
9
학습과 성능: 발표 수치의 범위
모델 카드 목록에 따르면 45조 토큰 규모의 멀티모달 자료로 처음부터 학습했고, 희소 어텐션은 6만 4,000토큰 길이에서 학습했다. 학습량이 34조 토큰에 이르렀을 때 문맥 길이를 100만 토큰으로 확장했다. DeepSeek는 새로운 사전학습 방식과 더 큰 규모의 강화학습 후처리도 성능 향상 요인으로 제시하지만, 인용된 자료만으로 세부 학습 절차까지 확인할 수는 없다.
9
16
DeepSeek의 평가에서 베이스 모델은 지식·추론·코딩 능력이 V4-Pro-Base와 비슷했고, 별도로 남겨둔 평가에서는 5~10% 개선을 보였다. 이때 사용한 전체 파라미터는 약 3분의 1, 활성 파라미터는 약 4분의 1이었다는 게 DeepSeek의 설명이다. 공개된 모델이 에이전트 작업에서 V4-Pro를 앞선다는 발표도 있지만, 제공된 근거로는 개별 벤치마크를 신뢰성 있게 대조하기 어렵다. 모두 독립적인 맞대결 검증 결과가 아닌 발표 수치로 읽어야 한다.
1
16
이미지와 텍스트는 모델이 기본적으로 처리하며, DeepSeek는 API에서도 멀티모달 기능을 제공한다고 밝혔다. 다만 인용된 자료에는 시각 처리 성능을 세부적으로 판단할 만한 벤치마크 결과가 제시되지 않았다.
2
16
API를 쓴다면 모델 이름도 확인해야 한다
DeepSeek API의 모델 이름은 **deepseek-flash**다. 공개 가중치는 MIT 라이선스로 안내되며, 모델 자료에는 SGLang을 이용한 서빙 경로가 소개된다. 모델 목록은 Transformers와 vLLM 추론 지원도 명시한다. 다만 긴 문맥과 멀티모달 기능이 모든 실행 환경에서 동일하게 지원되는지는 각각의 요구 사항을 확인해야 한다.
8
9
16
DeepSeek는 V4-Flash와 V4-Flash-Vision-Exp를 종료하고, 기존 API 이름인 **deepseek-v4-flash**와 **deepseek-v4-flash-vision-exp**를 일시적으로 V4.1-Flash에 연결한다고 밝혔다. 또 2026년 9월 14일부터 deepseek-v4-pro 요청도 V4.1-Pro 출시 전까지 Flash 요금으로 V4.1-Flash에 연결한다고 발표했다. 따라서 Pro 모델의 동작에 의존하는 애플리케이션이라면 API 이름만 보고 판단하지 말고 실제로 어떤 모델이 요청을 처리하는지 확인하는 편이 안전하다.
16