구글이 9월 30일 새 제미나이 4 세대의 최상위 모델인 제미나이 4 아르곤을 발표했습니다. 장시간 이어지는 소프트웨어 개발과 법률·금융 등 전문 지식 업무, 사이버 방어를 겨냥한 모델입니다. 차세대 프런티어 모델을 내놓기까지 여러 차례 지연을 겪은 뒤 나온 발표지만, 아직 일반 이용자를 대상으로 폭넓게 공개된 것은 아닙니다.
1
11
14
아르곤은 어떤 일을 겨냥하나
구글은 아르곤을 단발성 질문에 답하는 데 그치지 않고 여러 단계에 걸쳐 진행되는 복잡한 업무를 처리하도록 설계했다고 설명합니다. 주요 활용 분야로는 실제 소프트웨어 엔지니어링, 기업의 법률·금융 업무, 사이버 방어를 꼽았습니다.
11
구글에 따르면 내부 엔지니어들은 이미 아르곤을 디버깅과 코드베이스 이전 작업 등에 활용하고 있습니다. 알고리즘 설계에도 쓰이고 있다고 밝혔습니다. 이는 구글이 기대하는 활용 사례를 보여주지만, 회사 내부 활용이 독립적인 성능 검증을 뜻하는 것은 아닙니다.
3
10
벤치마크 성적은 어디까지 봐야 할까
구글은 장시간 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서 아르곤이 **77.9%**를 기록했다고 밝혔습니다. 보안 취약점 수정 능력을 평가하는 CWE-bench v1에서는 **68%**로 공동 1위에 올랐다고 설명했습니다.
9
10
22
다만 이는 구글이 공개한 특정 벤치마크 결과입니다. 여러 종류의 코딩 작업이나 실제 보안 업무 전반에서 항상 최고라는 뜻은 아닙니다. 현재 제공된 발표와 보도만으로 아르곤이 모든 작업에서 경쟁 모델보다 앞선다고 단정하기도 어렵습니다.
10
22
‘100만 토큰 출력’은 무엇을 뜻하나
아르곤의 최대 출력 한도는 기존 6만 4,000토큰에서 100만 토큰으로 늘었습니다. 한 번의 응답에서 훨씬 긴 결과물을 생성할 수 있어 대규모 코드 작업이나 상세한 문서처럼 분량이 큰 작업에 여지를 줍니다.
3
4
22
여기서 말하는 한도는 모델이 만들어낼 수 있는 출력량입니다. 입력으로 받아들일 수 있는 텍스트의 양을 뜻하는 것은 아닙니다. 출력 한도가 커졌다는 사실만으로 추론의 정확도가 높아지거나 모든 업무에서 성능이 좋아졌다고 볼 수도 없습니다.
지금 누가 쓸 수 있나
구글 외부에서 초기 접근이 허용된 대상은 페어윈드 프로그램을 통해 선정된 검증된 사이버 보안 담당자들입니다. 구글은 사이버 방어 역량을 갖춘 모델의 공개를 단계적으로 진행하고 있다고 설명했습니다.
2
10
11
이후 유료 API 고객과 구글 AI 울트라 구독자에게 접근을 넓힐 계획입니다. 다만 제공된 보도와 발표에는 확대 시점이 구체적으로 나오지 않았습니다. 따라서 아르곤은 발표와 제한적 제공이 시작된 모델이지, 일반 대중이 곧바로 이용할 수 있는 서비스는 아닙니다.
5
6
23
이번 발표의 의미
아르곤은 구글의 차세대 프런티어 모델인 동시에, 차세대 AI 계획이 지연된 뒤 나온 제한적 출시라는 점에서 주목됩니다. 구글은 코딩과 사이버 보안 벤치마크를 앞세워 경쟁력을 강조하는 한편, 초기 이용 대상을 일부 보안 담당자로 한정했습니다.
1
14
지금 확인할 수 있는 핵심은 모델이 겨냥하는 업무, 100만 토큰의 출력 한도, 그리고 구글이 공개한 벤치마크 결과입니다. 더 폭넓은 이용과 독립적인 평가가 가능해져야 이 결과가 실제 업무에서 어떤 의미를 갖는지 한층 분명해질 것입니다.