2026년 8월 21일 출시된 DeepSeek V4 Flash Vision Exp는 기존 V4 Flash에 이미지 이해 기능을 추가한 실험형 멀티모달 모델이다. API 모델 식별자는 deepseek v4 flash vision exp다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp는 DeepSeek의 V4-Flash에 시각 이해 기능을 더한 실험형 멀티모달 모델이다. 2026년 8월 21일 출시됐으며, 텍스트·추론·에이전트 작업에 더해 사진, 스크린샷, 차트, 문서 등 시각 자료를 해석할 수 있다. DeepSeek API 플랫폼에서 개발자용 API로 제공된다.
이번 발표의 핵심은 ‘최고 성능의 새 플래그십’이라기보다, 비교적 낮은 비용으로 기존 텍스트·에이전트 모델에 비전 기능을 붙일 수 있게 했다는 점이다. DeepSeek는 자사 모델이 Anthropic의 Claude Opus 4.8에 근접한다고 강조했지만, 현재 공개된 비교 결과는 주로 DeepSeek가 직접 구성하고 발표한 평가에 기반한다. 따라서 경쟁 구도를 흔들 만한 출시인 것은 분명하지만, Anthropic의 플래그십과 전반적으로 동급이라고 단정하기에는 이르다.
가장 큰 변화는 이미지 입력이다. 개발자는 텍스트와 이미지를 한 요청에 함께 보내고, 모델이 화면이나 이미지 속 정보를 파악한 뒤 답변하거나 도구를 호출하도록 만들 수 있다. API 요청에 사용하는 모델명은 다음과 같다.
deepseek-v4-flash-vision-expDeepSeek는 Vision-Exp가 V4-Flash 계열의 텍스트 능력, 추론, 에이전트 기능, 세계 지식을 유지한다고 설명한다. 공식 변경 이력에 공개된 관련 점수는 Terminal Bench 2.1 83.9점, DeepSWE 59.3점, DSBench-Hard 63.6점 등이다.
즉, 이 모델은 단순히 이미지를 설명하거나 이미지 캡션을 생성하는 시스템이 아니다. 코딩 에이전트가 화면을 읽고, 문서 처리 에이전트가 페이지를 분석하며, 도구를 사용하는 시스템이 이미지 속 정보를 작업 맥락에 반영하도록 설계된 모델이다.
DeepSeek는 Vision-Exp가 V4-Flash 수준의 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서는 Claude Opus 4.8에 가까워졌다고 주장한다. The Next Web이 전한 DeepSeek의 비교표에서는 11개 벤치마크 가운데 3개에서 DeepSeek 모델이 앞섰다.
다만 이 결과는 범위를 좁혀 해석해야 한다. ‘Opus 4.8에 근접한다’는 표현은 DeepSeek가 선택한 평가 세트에서의 비교를 뜻할 뿐, 모든 시각 작업이나 코딩 업무, 장시간 에이전트 세션에서 동일한 품질을 보장한다는 의미는 아니다.
DeepSeek가 공개한 Vision-Exp 점수는 다음과 같다.
텍스트 및 코드 에이전트 관련 평가에서는 Terminal Bench 2.1 83.9점, NL2Repo 57.7점, DeepSWE 59.3점, DSBench-Hard 63.6점, AutomationBench 공개 세트 25.7점이 제시됐다.
이 숫자만으로 실제 서비스 성능을 판단하기는 어렵다. 프롬프트, 도구 환경, 과제 선정, 응답 지연 시간, 실패 처리 방식, 평가 방법론에 따라 결과가 달라질 수 있기 때문이다. 현재 제공된 자료만으로는 이 비교를 확정적인 모델 순위로 받아들일 만큼 독립적인 검증 결과가 충분하지 않다.
텍스트 중심 작업에서 DeepSeek가 내세우는 강점은 압도적인 우위라기보다 ‘기존 성능의 유지’에 가깝다. Vision-Exp는 이미지 입력을 추가하면서도 V4-Flash의 추론, 에이전트 동작, 세계 지식 능력을 이어간다는 설명이다.
모델 선택 관점에서 보면 다음과 같이 정리할 수 있다.
Vision-Exp는 DeepSeek API 플랫폼에서 사용할 수 있다. Chat Completions, Messages, Responses 형식을 지원하며 텍스트와 이미지를 섞어 입력할 수 있다.
이미지를 전달하는 방법은 세 가지다.
file_id로 참조지원되는 이미지 형식은 JPEG, PNG, GIF, WebP다. Responses API에서는
input_image 콘텐츠 파트에 이미지 URL, base64 데이터 URL 또는 업로드된 파일 참조를 넣는 방식으로 처리한다.
이미지 입력도 과금 대상 입력 토큰으로 변환된다. DeepSeek는 이미지 1장당 과금 입력 토큰이 최대 384개이며, V4-Flash와 같은 가격 체계를 적용한다고 밝혔다.
출시와 연계해 공개된 V4-Flash 요금은 토큰 100만 개 기준 다음과 같다.
이미지 부분이 최대 384토큰으로 제한되기 때문에 이미지 자체의 비용은 비교적 예측하기 쉽다. 다만 함께 입력하는 텍스트, 도구 호출, 모델이 생성하는 출력 토큰에는 별도 비용이 발생한다. 에이전트가 여러 단계로 작업하면 전체 요청 비용은 이미지 자체보다 훨씬 커질 수 있다.
DeepSeek는 Vision-Exp를 기본 지원하는 Harness 0.1.1도 함께 공개했다. Harness는 단발성 이미지 질의보다 도구를 호출하고 여러 단계를 수행하는 에이전트 워크플로를 구축하려는 개발자에게 더 직접적인 의미가 있다.
동시에 무료 Files API도 출시됐다. 개발자는 이미지를 한 번 업로드한 뒤 이후 요청에서 file_id를 전달해 같은 이미지를 재사용할 수 있다. 파일 참조 ID는 file-api-... 형식이다.
예를 들어 에이전트가 같은 스크린샷이나 문서 페이지를 여러 차례 검토해야 한다면, 매번 이미지 데이터를 다시 전송하지 않고 파일 ID만 재사용할 수 있다. Files API를 이용한 업로드 자체는 무료지만, 모델 추론과 토큰 사용에 따른 비용까지 무료라는 뜻은 아니다.
이번 출시는 AI 경쟁의 기준이 모델 성능표 하나에서 API 가격, 멀티모달 지원, 파일 재사용, 에이전트 도구, 개발 편의성을 포함한 전체 패키지로 넓어지고 있음을 보여준다. DeepSeek는 V4-Flash의 요금 체계를 유지한 채 Flash 계열에 시각 기능을 추가했고, 자사 보고서에서는 Anthropic의 Opus 4.8을 고성능 비교 대상으로 삼았다.
이 점에서 Vision-Exp는 중국 AI 기업들이 미국 업체와 단순한 모델 성능뿐 아니라 개발자 생태계와 운영 비용을 놓고도 경쟁하고 있음을 보여주는 사례다. 그러나 ‘Flash’와 ‘Exp’라는 이름이 암시하듯, 이번 제품은 플래그십 선언이라기보다 V4-Flash를 실용적인 시각 워크플로로 확장한 중간급 실험형 출시로 보는 편이 정확하다.
결국 성패는 벤치마크 표보다 실제 사용성에서 갈릴 가능성이 크다. 스크린샷 기반 코딩, 문서·이미지 분석, 사용자 인터페이스 에이전트, 시각 정보를 활용한 도구 호출에서 얼마나 안정적으로 작동하는지, 그리고 낮은 토큰 비용이 프리미엄 멀티모달 모델보다 실제 운영에 유리한지가 핵심이다.
현재로서는 결론을 신중하게 내리는 것이 맞다. DeepSeek는 기존 API 생태계 안에서 저렴한 시각 추론 기능에 접근할 수 있는 길을 열었고, 초기 자체 평가에서는 일부 멀티모달 테스트에서 의미 있는 경쟁력을 주장했다. 독립 평가, 실제 업무에서의 안정성, 개발자 채택이 이어져야 Vision-Exp가 지속 가능한 대안이 될지, 흥미로운 실험작에 머물지 판가름 날 것이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 8월 21일 출시된 DeepSeek V4 Flash Vision Exp는 기존 V4 Flash에 이미지 이해 기능을 추가한 실험형 멀티모달 모델이다.
2026년 8월 21일 출시된 DeepSeek V4 Flash Vision Exp는 기존 V4 Flash에 이미지 이해 기능을 추가한 실험형 멀티모달 모델이다. API 모델 식별자는 deepseek v4 flash vision exp다. 이미지는 base64 데이터 URL, 공개 HTTP(S) URL, Files API의 재사용 가능한 file id로 전달할 수 있으며 이미지 1장당 과금 입력 토큰은 최대 384개다.
출시와 함께 Vision Exp를 기본 지원하는 Harness 0.1.1과 무료 Files API가 공개됐다. 스크린샷 기반 코딩, 문서 분석, 화면 조작 에이전트 같은 다중 턴 작업에 활용하기 쉽도록 구성됐다.