2026년 8월 21일 공개된 DeepSeek V4 Flash Vision Exp는 V4 Flash에 이미지 이해 기능을 더한 실험형 멀티모달 모델이다. 이미지는 인라인 Base64, 외부 URL, 무료 Files API를 통해 보낼 수 있다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek가 2026년 8월 21일 실험형 멀티모달 모델 deepseek-v4-flash-vision-exp를 API 플랫폼에 공개했다. V4-Flash의 텍스트·추론·에이전트 기반에 이미지 이해 기능을 더한 모델로, 개발자는 스크린샷과 차트, 애플리케이션 화면, 게임 장면 등을 텍스트 프롬프트와 함께 전달할 수 있다. 114
이번 출시에서 가장 눈에 띄는 부분은 ‘비전 기능도 Flash 가격’이라는 설계다. 이미지 한 장은 과금 기준 최대 384 입력 토큰으로 변환되며, 별도의 비전 처리 할증 없이 V4-Flash의 입력 요금이 적용된다. DeepSeek는 비주얼 에이전트 성능이 Claude Opus 4.8에 근접했다고 주장하지만, 이는 회사가 공개한 평가 결과를 바탕으로 한 설명이며 독립적인 검증이 끝난 것은 아니다. 319
새 모델은 deepseek-v4-flash-vision-exp라는 API 식별자로 호출한다. Chat Completions, Messages, Responses 형식에서 이미지와 텍스트를 섞어 입력할 수 있어 기존 에이전트 및 도구 호출 흐름에 시각 정보를 추가하기 쉽다. 412
따라서 기능은 단순한 이미지 설명에 그치지 않는다. 예를 들어 에이전트가 현재 화면의 스크린샷을 분석하고, 다음 행동을 결정한 뒤 도구를 호출하고, 결과 화면을 다시 확인하는 순환 구조를 만들 수 있다. 공개된 시연에는 스크린샷을 바탕으로 실행 가능한 코드를 생성하거나, 시각 입력을 활용해 게임 제작 작업을 수행하는 사례가 포함됐다. 510
개발자는 다음 세 경로 중 하나로 이미지를 전송할 수 있다. 6714
file_id를 요청에서 재사용Files API는 무료로 제공된다. 같은 스크린샷이나 이미지 상태를 여러 요청에서 반복적으로 확인하는 애플리케이션이라면 이미지를 매번 다시 전송하지 않고 파일 참조만 사용할 수 있어, 요청 대역폭을 줄이는 데 유리하다. 112
DeepSeek에 따르면 이미지 한 장은 과금 목적으로 최대 384 입력 토큰으로 계산된다. 해당 토큰에는 일반 V4-Flash 입력 요금이 적용되므로 이미지 이해를 위해 별도의 프리미엄 요금제를 선택할 필요가 없다. 3614
공개된 가격표에는 비전 모델의 피크 요금이 캐시되지 않은 입력 토큰 100만 개당 0.44달러, 출력 토큰 100만 개당 1.32달러로 제시돼 있다. 컨텍스트 윈도우는 100만 토큰, 최대 출력은 38만4,000토큰으로 표기됐다. 1
일부 비교 자료는 384토큰 상한이 GPT와 Claude 계열의 유사한 이미지 처리량보다 절반 이하라고 설명한다. 다만 제공된 자료만으로는 비교 대상 모델의 정확한 버전, 이미지 해상도, 토큰화 및 과금 조건이 동일한지 확인할 수 없다. 따라서 이는 방향성을 보여주는 비교로 보는 편이 안전하다. 327
실제 의미는 분명하다. 에이전트가 화면을 자주 확인해야 하는 서비스에서 이미지 입력 비용을 비교적 예측 가능한 수준으로 관리할 수 있다는 점이다. 매번 고가의 멀티모달 모델을 호출하지 않고도 스크린샷 기반 자동화 루프를 구성할 수 있다.
DeepSeek는 V4-Flash-Vision-Exp가 기존 V4-Flash의 텍스트 생성 능력과 추론, 세계 지식, 에이전트 기능을 유지하면서 시각 입력을 추가했다고 설명했다. 626
또한 멀티모달 에이전트 벤치마크에서 큰 폭의 개선을 이뤄 Claude Opus 4.8에 가까운 성능을 냈다고 밝혔다. 일부 공개 비교표에서는 특정 작업에서 두 모델이 비슷한 수준으로 나타나지만, 벤치마크에 따라 결과 편차도 확인된다. 4192123
따라서 ‘Opus 4.8에 근접했다’는 표현은 현재로서는 DeepSeek의 평가 환경에서 나온 성능 주장으로 해석해야 한다. 실제 서비스에서의 시각적 정확도, 응답 안정성, 도구 사용 능력까지 동등하다는 뜻은 아니다. 다양한 이미지와 작업 조건을 사용한 제3자 테스트가 뒤따라야 한다.
비전 에이전트를 실제 서비스에 연결하기 전에는 추론 설정을 반드시 점검해야 한다. 한 실사용 테스트에서는 thinking 모드의 추론 토큰이 전체 completion 예산을 소진해 사용자에게 보여줄 답변이 남지 않는 현상이 보고됐다. 이에 따라 일부 시각 작업에서는 thinking 모드를 끄거나 max_tokens 값을 높이는 방법이 권장됐다. 27
이는 모델의 전반적인 성능과는 별개의 통합 문제다. 추론을 활성화할 경우 내부 추론과 최종 답변에 모두 사용할 수 있도록 출력 용량을 확보해야 한다. 실제 적용 전에는 DeepSeek의 최신 API 문서에서 현재 파라미터 이름과 동작 방식도 다시 확인하는 것이 좋다.
제공된 자료에서 DeepSeek가 공식적인 전략적 배경을 별도로 설명한 것은 아니다. 다만 제품 구성만 놓고 보면 방향은 뚜렷하다. 에이전트가 스크린샷, 대시보드, 게임 화면, 앱 상태를 반복해서 확인해도 부담이 크지 않도록 시각 인식 비용을 낮추려는 접근이다.
비전 기능을 실험형 Flash 모델로 제공하면 개발자는 기존의 저비용 에이전트와 도구 호출 흐름을 유지한 채 이미지 입력만 추가할 수 있다. 별도의 고가 멀티모달 모델로 전체 애플리케이션을 옮기지 않아도 된다는 뜻이다. 이 때문에 화면 기반 에이전트, 스크린샷-코드 변환 도구, 잦은 시각 피드백이 필요한 애플리케이션을 만드는 개발자에게 특히 의미가 있다.
결론적으로 DeepSeek V4-Flash-Vision-Exp의 가장 강한 메시지는 벤치마크보다 가격과 반복 사용성에 있다. 이미지당 최대 384토큰이라는 낮은 상한, 세 가지 입력 방식, 무료 Files API는 시각 에이전트의 진입 장벽을 낮춘다. 반면 성능 우위와 실제 운영 안정성은 아직 검증 대상이다. 개발자는 현실적인 스크린샷으로 통제된 테스트를 진행하고, 출력 토큰 예산을 명시적으로 설정하며, 독립적인 품질 검사를 함께 운영하는 것이 바람직하다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 8월 21일 공개된 DeepSeek V4 Flash Vision Exp는 V4 Flash에 이미지 이해 기능을 더한 실험형 멀티모달 모델이다.
2026년 8월 21일 공개된 DeepSeek V4 Flash Vision Exp는 V4 Flash에 이미지 이해 기능을 더한 실험형 멀티모달 모델이다. 이미지는 인라인 Base64, 외부 URL, 무료 Files API를 통해 보낼 수 있다. Files API에서는 이미지를 한 번 업로드한 뒤 file id로 반복 참조할 수 있다.
텍스트 생성과 추론, 에이전트 기능은 V4 Flash 계열을 유지한다고 DeepSeek는 설명했지만, 비주얼 에이전트 성능이 Claude Opus 4.8에 가깝다는 주장은 독립 검증이 필요하다.