유출된 이미지는 흥미로운 내부 실험의 신호일 수는 있어도, 검증된 제품 발표는 아니다. 9월 14일 확산된 게시물은 해당 모델의 내부 코드명이 **‘argon’**이며, 매우 큰 문맥 창과 출력 한도를 가졌다고 주장한다. 하지만 구글은 코드명, 화면 구성, 벤치마크, API 제공 여부, 가격, 출시 시점을 공식 확인하지 않았다.
8
15
스크린샷이 주장하는 내용
원 게시물과 뒤이은 유출 보도에 따르면, 이미지는 Gemini 4 Pro가 고난도(high-effort) 설정으로 시각 생성 작업을 수행한 장면을 담고 있다. 이 작업에는 약 2.4분이 걸렸고, 화면에는 25만 6,000토큰 출력 한도와 200만 토큰 문맥 창이 표시됐다고 전해진다. 적응형 추론 방식도 언급된다.
8
15
다만 이는 어디까지나 내부 빌드의 속성으로 주장된 내용이다. 스크린샷이 실제 테스트 환경을 포착했더라도, 해당 한도가 정식 서비스에서 적용되는지, 어떤 입력·출력 형식에 해당하는지, 비용은 얼마인지, 독립 평가에서 얼마나 안정적으로 작동하는지는 알 수 없다.
구글은 과거 Gemini 1.5 Pro에 200만 토큰 문맥 창을 제공한 바 있어, 숫자 자체가 전례 없는 주장은 아니다. 그렇다고 이 유출의 진위나 Gemini 4 Pro 정식 사양을 입증하는 것은 아니다.
1
이미지 품질보다 중요한 쟁점: 장시간 코딩 에이전트
유출 이미지의 시각적 결과에 대한 반응은 엇갈린다. 이미지 생성만 놓고 보면 선도적인 이미지 생성 시스템을 뚜렷하게 앞선다는 증거는 아직 없다. 더 중요한 대목은 긴 문맥, 대규모 출력, 조절 가능한 추론 강도의 조합이다.
이 기능들이 실제 공개 모델에 적용된다면, 대형 소프트웨어 저장소를 다루는 코딩 에이전트에 의미가 있을 수 있다. 더 많은 코드와 문서를 한꺼번에 읽고, 여러 파일에 걸친 구현 계획을 세우며, 큰 규모의 패치를 만들고, 도구를 활용하는 긴 작업 흐름을 반복 수행하는 식이다. 기존 Gemini 4 유출 보도도 코딩, 장기 작업, 대규모 문맥 처리를 목표 강점으로 거론했지만, 해당 사양과 평가는 검증되지 않았다고 분명히 밝혔다.
3
여기서 구분할 점이 있다. 큰 토큰 한도는 처리 용량에 관한 주장일 뿐, 저장소 단위 소프트웨어 엔지니어링을 안정적으로 해낸다는 증거는 아니다. 실제 가치는 코드 정확도, 도구 사용의 신뢰성, 긴 문맥에서의 정보 회수 정확도, 지연 시간, 비용, 다단계 작업이 실패했을 때의 복구 능력에 달려 있다.
확인된 구글 로드맵과의 연결점
공개된 로드맵을 보면, 검증되지 않은 Gemini 4 Pro 테스트가 주목받는 이유를 이해할 수 있다.
- 구글은 2026년 2월 Gemini 3.1 Pro를 출시했다.
4
- 5월 Google I/O에서 구글은 Gemini 3.5 Pro를 개발 중이며 다음 달 배포를 기대한다고 밝혔다.
17
- 그러나 6월 목표는 지켜지지 않았다. 로이터는 7월 구글이 특히 코딩 역량을 보완하는 과정에서 주력 모델 출시가 지연됐다고 보도했다.
18
- 같은 달 구글은 Gemini 3.5 Pro가 파트너들과 테스트 중이고, Gemini 4 학습이 시작됐다고 밝혔다.
17
이로부터 확실히 말할 수 있는 범위는 좁다. 구글의 Pro 모델 출시가 지연됐고, 다음 세대 모델 개발을 시작했다는 점이다. 이것이 Gemini 3.5 Pro의 영구 취소, ‘argon’이 Gemini 4 Pro의 공식 코드명이라는 사실, 또는 10월 공개 출시를 뜻하지는 않는다.
인용된 보도 시점까지 구글은 Gemini 4 모델 카드, 공개 API 모델 ID, 가격표, 벤치마크 보고서, 문서화된 문맥 한도를 내놓지 않았다.
7
Gemini 4 Pro가 전략적으로 중요한 이유
Gemini 3.5 Pro 지연은 특히 코딩 역량과 연결됐다는 점에서 중요하다. 개발자와 기업 고객에게 코딩은 최전선 AI 모델의 핵심 업무 중 하나이기 때문이다.
18 로이터 보도에 따르면 구글은 주력 Pro 모델이 파트너 테스트에 머무는 동안 경량 Gemini 모델을 계속 출시했다.
17
따라서 Gemini 4 Pro가 공개된다면, 단지 큰 문맥 창을 내세우는 것만으로는 부족하다. 개발자들이 확인하려 할 지점은 다음과 같다.
- 추론 품질: 고난도 모드가 늘어난 시간과 비용을 감수할 만큼 어려운 작업의 결과를 개선하는지
- 코딩 에이전트 신뢰성: 여러 파일을 정확히 수정하고 도구를 실행하며 일관된 계획을 유지하는지
- 긴 문맥 성능: 대형 코드베이스를 단순히 입력으로 받는 데 그치지 않고, 필요한 정보를 정확히 찾아 활용하는지
- 멀티모달 역량: 이미지 등 미디어 생성 기능이 ‘제공된다’는 수준을 넘어 경쟁력이 있는지
- 운영 경제성: 지연 시간, 토큰 가격, 사용량 제한이 장시간 에이전트를 데모 밖의 실제 업무에 쓸 수 있는 수준인지
Gemini 3.8 Flash 사례는 제품 포지셔닝이 왜 중요한지를 보여준다. Artificial Analysis는 고추론 설정에서 59점을 기록해 Gemini 3.7 Flash보다 3점 높았다고 전했다. Flash 계열로서는 의미 있는 개선이지만, 복잡하고 장기적인 작업에서 성능이 입증된 폭넓게 제공되는 Pro급 주력 모델을 대체하는 것은 아니다.
14
다음에 확인할 신호
의미 있는 다음 증거는 구글의 1차 문서나 재현 가능한 접근 방식일 것이다. 예를 들어 공식 발표, 모델 카드, API 목록, 가격 페이지, 기술 보고서, 독립 벤치마크 결과가 여기에 해당한다.
그때까지 이 스크린샷은 야심 찬 목표를 드러낸 내부 실험에 관한 보고로 보는 편이 적절하다. 주장된 25만 6,000토큰 출력과 200만 토큰 문맥 창은 실제 출시될 경우 코딩 에이전트에 매우 중요한 사양이 될 수 있다. 그러나 현재 공개된 증거만으로는 이 기능들이 정식 모델에 탑재된다고 단정할 수 없다.
8
15