DeepSeek의 실험 모델 V4 Flash Vision Exp는 이미지 이해 기능을 V4 Flash와 같은 요금 체계로 제공하며, 이미지 한 장당 입력 토큰은 최대 384개로 제한된다. 스크린샷·문서·브라우저 에이전트를 대량 처리하는 개발자라면 호출 비용을 크게 낮출 가능성이 있지만, 고밀도 문서나 세밀한 시각 작업에서는 384토큰 제한이 약점이 될 수 있다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How could DeepSeek’s August 22, 2026 release of the V4-Flash-Vision-Exp multimodal AI model—which it says matches its existing V4-Flash mode. Article summary: DeepSeek’s vision release is potentially more important as a pricing signal than as proof of a lasting capability lead: if independent tests confirm near-frontier multimodal-agent performance at Flash-level cost, it coul. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
DeepSeek의 V4-Flash-Vision-Exp는 새로운 성능 선두 모델이라는 점보다, 멀티모달 AI의 가격 기준을 흔드는 신호라는 점에서 더 주목할 만하다. 이 실험 모델은 V4-Flash 아키텍처에 이미지 이해 기능을 더하면서 텍스트 모델의 추론·에이전트 역량을 유지한다고 DeepSeek는 설명했다. 또 멀티모달 에이전트 평가에서 Anthropic의 Claude Opus 4.8에 근접한 성능을 내며, 이미지는 V4-Flash 요금으로 처리되고 한 장당 입력 토큰은 최대 384개라고 밝혔다. 64
이 조합이 실제 서비스에서도 안정적으로 작동한다면 시각 AI의 배포 비용은 크게 낮아질 수 있다. 다만 출시 당일의 벤치마크 비교는 주로 기업 자체 발표나 이에 기반한 보도에 의존한다. 실제 상용화 결과를 가를 요소는 단일 점수가 아니라 안정성, 이용 가능성, 지연시간, 장애율, 기업 고객 도입 여부다.
이미지 처리는 추가적인 연산과 모델 용량을 요구하기 때문에 그동안 프리미엄 기능으로 취급되는 경우가 많았다. DeepSeek의 방식은 다르다. 별도의 고가 비전 모델을 내놓는 대신, 이미지 입력을 저가형 Flash 등급에 포함했다.
보고된 V4-Flash-Vision-Exp 요금은 비수요 시간 기준 100만 캐시 미적중 입력 토큰당 0.22달러, 출력 토큰당 0.66달러다. 수요가 몰리는 시간에는 각각 0.44달러, 1.32달러로 올라간다. 캐시 적중 입력은 더 저렴하다. 51
이 가격 구조는 스크린샷, 신청서, 영수증, 대시보드, 기술 도면, 브라우저 화면을 반복적으로 읽는 서비스에 특히 중요하다. 일상적인 시각 작업을 낮은 입력 비용으로 처리할 수 있다면, 같은 예산으로 더 많은 검증·재시도·에이전트 단계를 실행할 수 있기 때문이다.
다만 이미지당 384토큰이라는 상한은 분명한 조건이다. 비용을 낮추는 데는 유리하지만, 작은 글씨를 읽거나 복잡한 도표를 해석하거나 정밀한 공간 관계를 파악해야 하는 작업에서는 성능을 제한할 수 있다. 이미지가 싸다는 사실이 모든 시각 작업에서 높은 품질을 보장하는 것은 아니다. 53
DeepSeek는 V4-Flash-Vision-Exp가 텍스트 전용 V4-Flash보다 멀티모달 에이전트 평가에서 크게 향상됐으며 Opus 4.8에 가까워졌다고 밝혔다. 그러나 공개된 비교 결과는 전면적인 승리라기보다 엇갈린 양상에 가깝다. ApexBench Pass@1에서는 DeepSeek 모델이 36.5점, Opus 4.8이 39.4점을 기록했다. 반면 Agents’ Last Exam에서는 27.3점 대 25.7점, ZeroBench에서는 35.0점 대 34.0점으로 DeepSeek가 앞섰다. 58
이 결과는 의미가 있지만, 벤치마크에서의 근접성이 곧바로 실제 서비스 성능의 동등함을 뜻하지는 않는다. 도입을 검토하는 기업과 개발자는 다음 항목을 별도로 확인해야 한다.
다음 단계는 독립적이고 재현 가능한 평가다. 그런 검증이 나오기 전까지 가장 신중한 결론은 DeepSeek가 저비용 대안을 제시하는 신뢰할 만한 도전장을 내밀었다는 것이다. 선도 프런티어 모델을 확실히 넘어섰다고 단정할 단계는 아니다.
이 모델이 DeepSeek 외부의 실제 환경에서도 안정적으로 작동한다면 Anthropic, OpenAI, Google은 일반적인 추론이나 시각 이해만으로 높은 프리미엄을 유지하기 어려워질 수 있다. 특히 모델이 ‘최고’일 필요 없이 ‘충분히 좋은’ 수준이면 되는 대량·비용 민감형 업무에서 압박이 클 전망이다.
프리미엄 업체들이 방어할 수단은 여전히 많다. 장시간 실행되는 업무의 안정성, 도구 생태계, 보안과 거버넌스, 기술 지원, 클라우드 통합, 유통망이 대표적이다. 좁은 벤치마크에서 조금 더 저렴하거나 높은 점수를 받은 모델이라도, 실제 기업 환경에서 오류가 잦고 모니터링 비용이 늘어나거나 필요한 통제 기능이 없으면 선택받기 어렵다.
따라서 시장은 다음처럼 더욱 세분화될 가능성이 있다.
프리미엄 업체의 위험은 반드시 수요 감소 자체가 아니다. 차별화되지 않은 성능에 고객이 지불하려는 금액이 줄어드는 것이 더 직접적인 위험이다. 고객은 여러 모델을 함께 사용하면서 단순한 시각 작업은 저렴한 모델로 보내고, 품질이 결정적인 경우에만 프리미엄 모델을 호출할 수 있다.
DeepSeek가 제품군 전체의 가격을 무조건 낮추고 있는 것은 아니다. 지난 8월 V4-Pro와 V4-Flash에 수요가 몰리는 시간과 그렇지 않은 시간을 구분한 요금제를 도입했으며, 모델·토큰 종류·사용 시간에 따라 인상 폭은 **50%에서 1,100%**에 이르는 것으로 보도됐다. 17
이는 DeepSeek 역시 경쟁사보다 싸게 파는 것만이 아니라, 제한된 처리 용량과 수요를 관리하며 수익화하려 한다는 점을 보여준다. Flash Vision을 저가형 진입로로 활용하는 동시에 프리미엄 추론, 높은 처리량, 수요 집중 시간대의 사용량에서 수익을 확보할 가능성도 있다.
개발자에게 중요한 것은 가장 낮은 광고 요금이 아니라 실제 총비용이다. 예산을 짤 때는 피크 시간 사용량, 출력 토큰, 캐시 적중률, 재시도 횟수, 지연시간, 실패율을 함께 계산해야 한다. 호출 단가는 싸더라도 여러 번 재실행해야 한다면 실제 비용은 달라질 수 있다.
DeepSeek의 출시는 Anthropic이 강한 수요를 보이는 시점에 나왔다. 로이터는 Anthropic의 연환산 매출 규모가 5월 470억 달러에서 7월 말 650억 달러를 넘어섰다고 보도했다. 여기서 연환산 매출은 최근 실적을 1년 기준으로 환산한 추정치이지, 확정된 연간 매출이나 미래 마진을 보장하는 수치가 아니다. 33
이 구분은 중요하다. DeepSeek 모델이 Anthropic의 현재 성장 신호를 지우는 것은 아니지만, 향후 가격 결정력과 인프라 투자 수익률에 대한 가정에는 도전할 수 있다. 고객이 일상적인 멀티모달 작업을 더 저렴한 모델로 옮기면 Anthropic은 점유율을 지키기 위해 할인 폭을 키우거나 추가 투자를 해야 할 수 있다.
Amazon의 노출은 특히 직접적이다. Amazon은 Anthropic에 현재 50억 달러를 투자하고, 상업적 목표 달성 여부에 따라 최대 200억 달러를 추가 투자하기로 했다. Anthropic은 그 대가로 10년 동안 Amazon의 클라우드 기술에 1,000억 달러 이상을 지출하기로 약속했다. 1
Claude 수요가 계속 강하면 Amazon은 Anthropic의 클라우드 사용량과 투자 지분 가치라는 두 경로에서 이익을 얻을 수 있다. 반대로 저가 경쟁 모델이 Anthropic의 사용량 증가나 가격 결정력을 지속적으로 약화시키면, 대규모 인프라 약정의 활용도와 투자 정당성이 부담으로 돌아올 수 있다. 이 계약은 큰 상승 여력을 제공하는 동시에 Amazon의 AI 투자 논리를 Anthropic의 확장에 집중시키는 구조이기도 하다.
Alphabet의 노출은 다르다. Alphabet은 Anthropic의 투자자이면서 Gemini와 Google Cloud를 통해 직접 경쟁하고 있다. 6 경쟁력 있는 저가 멀티모달 모델이 등장하면 Google의 API와 클라우드 AI 상품도 가격 압박을 받을 수 있다. Anthropic 가치 상승에 따른 간접적인 이익은 Alphabet 자체 AI 제품의 경쟁 심화와 함께 평가해야 한다.
이제 중요한 것은 출시 발표가 아니라 후속 데이터다. 투자자와 개발자는 다음 지표를 지켜볼 필요가 있다.
DeepSeek V4-Flash-Vision-Exp는 AI 경쟁의 중심을 단순한 성능 경쟁에서 가격 대비 성능 경쟁으로 옮겨 놓을 수 있다. 가장 중요한 특징은 특정 평가에서 Opus 4.8을 가끔 앞선다는 점보다, 유용한 멀티모달 에이전트 성능을 저가형 Flash 등급에 넣었다고 주장한다는 데 있다.
다만 이것이 재무적으로 파괴적인 변화가 되려면 모델이 지속적인 실서비스 운영을 견딜 만큼 안정적이어야 한다. 현재로서는 프리미엄 AI 업체와 투자자에게 보내는 분명한 경고로 보는 편이 적절하다. 앞으로 프런티어 모델의 가격, 고객 잠금 효과, 대규모 인프라 투자 수익률은 벤치마크 명성만이 아니라 측정 가능한 제품 우위로 방어해야 한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
DeepSeek의 실험 모델 V4 Flash Vision Exp는 이미지 이해 기능을 V4 Flash와 같은 요금 체계로 제공하며, 이미지 한 장당 입력 토큰은 최대 384개로 제한된다.
DeepSeek의 실험 모델 V4 Flash Vision Exp는 이미지 이해 기능을 V4 Flash와 같은 요금 체계로 제공하며, 이미지 한 장당 입력 토큰은 최대 384개로 제한된다. 스크린샷·문서·브라우저 에이전트를 대량 처리하는 개발자라면 호출 비용을 크게 낮출 가능성이 있지만, 고밀도 문서나 세밀한 시각 작업에서는 384토큰 제한이 약점이 될 수 있다.
Anthropic의 연환산 매출 규모는 7월 말 650억 달러를 넘어선 것으로 알려져 있다. 따라서 DeepSeek는 프리미엄 AI 수요가 사라졌다는 증거라기보다 가격 결정력과 마진에 대한 새로운 위험 요인에 가깝다.