이 구조는 에이전트 개발자에게 특히 중요합니다. 에이전트가 다음 도구를 호출하기 전에 스크린샷, 차트, 스캔 문서, 웹페이지 같은 시각 정보를 먼저 해석할 수 있기 때문입니다. DeepSeek는 Codex 연동에서도 이미지 입력을 지원하는 모델 옵션으로 Vision Exp를 안내하고 있습니다.
DeepSeek는 또한 Harness 0.1.1 버전에서 이 모델을 기본 지원한다고 밝혔습니다. 반면 GitHub Copilot 관련 공식 문서에는 모델 선택기에 V4 Pro와 V4 Flash가 명시돼 있으며, 이미지 처리는 별도로 설치된 Copilot 모델을 통해 수행된다고 설명합니다. 따라서 Vision Exp가 해당 선택기에 직접 제공된다고 단정할 근거는 현재 자료에 없습니다.
DeepSeek의 핵심 주장은 두 가지입니다. 첫째, 텍스트 능력은 V4-Flash와 대체로 같다는 점입니다. 둘째, 시각 정보가 필요한 멀티모달 에이전트 벤치마크에서 큰 폭으로 도약해 Claude Opus 4.8에 가까워졌다는 점입니다.
일부 보도는 Chartography 64.3, ApexBench Pass@1 36.5, Agents’ Last Exam 27.3, ZeroBench Pass@5 35.0 등의 수치를 전했습니다. 다만 이 수치들은 DeepSeek 발표를 소개한 2차 보도에 기반하며, 여러 사업자의 모델을 같은 프롬프트·도구 환경에서 재현한 독립 평가 결과는 아닙니다.
이 차이를 구분해야 합니다. ‘Opus 4.8에 근접하다’는 표현은 모든 작업에서 Claude를 앞선다거나, 모든 상황에서 같은 신뢰성과 안정성을 제공한다는 뜻이 아닙니다. 현재 자료에는 DeepSeek와 Anthropic을 대상으로 프롬프트, 도구 환경, 지연 시간, 실패율, 비용을 통일한 중립적 비교가 없습니다.
따라서 가장 신중한 결론은 다음과 같습니다. DeepSeek는 실제로 문서화된 시각 입력 지원 API 모델을 출시했고, 자체 발표 수치는 이미지가 필요한 작업에서 텍스트 전용 V4-Flash보다 의미 있는 개선이 있었음을 시사합니다. 그러나 Claude, OpenAI, Google 또는 다른 중국계 AI 모델과의 상대적 위치는 아직 확정되지 않았습니다.
공개된 모델 목록에 따르면 Vision Exp의 가격은 입력 토큰 100만 개당 0.22달러, 출력 토큰 100만 개당 0.66달러이며 컨텍스트 길이는 100만 토큰입니다. DeepSeek의 공식 가격 문서도 가격을 토큰 100만 개 단위로 계산하며
deepseek-v4-flash-vision-exp를 모델 표에 포함하고 있습니다.
이미지는 API 과금 과정에서 토큰으로 변환됩니다. DeepSeek의 공개 안내를 인용한 보도에 따르면 이미지 한 장은 최대 384토큰으로 계산될 수 있으며 V4-Flash와 같은 가격 체계를 적용받습니다. 따라서 실제 이미지 작업 비용은 이미지의 개수와 크기, 주변 텍스트, 출력 길이, 대화 문맥의 반복 여부에 따라 달라집니다.
Anthropic은 Claude Opus 4.8의 기본 입력 가격을 토큰 100만 개당 5달러, 출력 가격을 25달러로 제시하고 있습니다. 캐시와 Fast mode에는 별도 요금이 적용됩니다.
표면적인 토큰 단가만 비교하면 DeepSeek가 상당히 저렴합니다. 이는 테스트를 시작할 만한 이유지만, 곧바로 전체 운영비가 낮다는 뜻은 아닙니다. 재시도가 많거나 도구 호출 오류가 잦고 이미지 전처리가 추가로 필요하다면, 단가가 낮아도 실제 업무 비용은 커질 수 있습니다.
두 모델은 비슷한 활용처를 겨냥하지만 제품의 위치는 다릅니다.
DeepSeek의 전략은 분명합니다. 상대적으로 저렴한 Flash 모델에 시각 기능을 추가하고, 멀티모달 에이전트 작업에서는 프리미엄 모델에 가까운 성능을 내겠다는 접근입니다. 반면 Claude의 비교 우위는 모든 벤치마크에서 절대적으로 더 뛰어나다는 점이 이번 자료로 입증됐다는 뜻이 아니라, 제품 성숙도와 도구 생태계, 시장에서의 검증된 포지셔닝에 있습니다.
실제 선택은 작업별로 이뤄져야 합니다. 스크린샷 읽기나 차트 추출 파이프라인에서는 Vision Exp가 충분한 품질을 훨씬 낮은 토큰 비용으로 제공할 가능성이 있습니다. 그러나 고위험 자율 업무에서는 일관성, 도구 사용 정확도, 거부 행동, 관측 가능성, 지원 체계, 오류 복구 능력이 더 중요합니다.
이번 출시는 시각 이해가 단순한 이미지 질의응답 기능을 넘어 에이전트 작업의 일부가 되고 있다는 점에서 의미가 있습니다. 코딩 에이전트는 오류 화면을 읽어야 하고, 브라우저 에이전트는 웹페이지를 해석해야 하며, 기업용 자동화 시스템은 문서·차트·구조화된 도구 호출을 함께 처리해야 합니다.
DeepSeek V4 제품군은 긴 컨텍스트와 에이전트 작업을 강조해 왔고, 회사 문서에서도 Flash를 더 빠르고 경제적인 제품군으로 소개하고 있습니다. Vision Exp는 별도의 이미지 전용 모델을 내놓기보다 이 방향을 멀티모달 에이전트로 확장한 모델에 가깝습니다.
다만 현재 자료만으로 DeepSeek가 Anthropic, OpenAI, Google 또는 주요 중국 AI 연구소를 전반적으로 앞섰다고 선언하기는 어렵습니다. 독립적인 동일 조건의 교차 평가가 없고, 실험적 API 출시와 성숙한 플래그십 제품은 같은 기준으로 볼 수 없기 때문입니다.
테스트할 가치는 충분합니다. 단, 통제된 비교가 전제돼야 합니다.
다음과 같은 이미지·도구 결합 작업을 동일한 조건에서 Vision Exp, Claude Opus 4.8, 현재 운영 모델에 각각 실행해 보는 것이 좋습니다.
현재 시점의 결론은 조심스럽지만 긍정적입니다. DeepSeek V4 Flash Vision Exp는 매력적인 공개 단가와 실용적인 개발자 인터페이스를 갖춘 신뢰할 만한 멀티모달 API 실험 모델입니다. 다만 Claude Opus 4.8에 근접한다는 주장은 직접 검증해 볼 만한 가설이지, 독립적으로 확립된 사실로 받아들일 단계는 아닙니다.