구글은 9월 30일 차세대 모델군 ‘제미나이 4’의 주력 모델로 제미나이 4 아르곤을 발표했습니다. 소프트웨어 개발, 법률·금융을 포함한 기업 업무, 사이버보안처럼 복잡하고 오래 이어지는 작업을 겨냥한 모델입니다. 다만 지금은 일반 이용자에게 공개하지 않고, 검증된 사이버보안 방어 인력부터 제한적으로 제공하고 있습니다.
9
아르곤은 구글의 이전 고급 프로 모델보다 규모가 큰 모델로 소개됐습니다. 구글이 공개한 벤치마크에서도 오픈AI와 앤스로픽의 일부 모델보다 높은 점수를 기록했다고 밝혔습니다. 하지만 이용 대상이 제한돼 있어 대다수 개발자와 기업이 실제 작업에서 성능을 직접 확인하기는 아직 어렵습니다.
6
코딩부터 보안까지, 복잡한 업무에 초점
구글은 아르곤을 지금까지 만든 모델 가운데 복잡한 작업을 가장 잘 처리하는 모델이라고 설명합니다. 주요 용도는 여러 단계가 이어지는 소프트웨어 개발, 법률·금융 등 기업의 지식 업무, 사이버보안 방어입니다. 이전 최상위 프로 모델보다 규모가 크다고 밝혔지만, 현재 확인 가능한 보도와 자료에는 구체적인 매개변수 수가 공개되지 않았습니다.
9
따라서 ‘더 크다’는 표현은 이전 구글 모델과 비교한 설명이지, 아르곤의 정확한 크기를 보여주는 수치는 아닙니다. 크기만으로 사용 비용이나 속도, 특정 업무에서의 우열까지 판단할 수도 없습니다.
구글이 공개한 벤치마크 성적은
구글이 공개한 비교표에서 아르곤은 지식 업무를 평가하는 Vals Index에서 68.9%를 기록했습니다. 오픈AI의 GPT-6 Astra는 63.1%, 앤스로픽 Claude Opus 5.5는 67.0%였습니다. 업무 자동화 성능을 측정하는 AutomationBench에서는 아르곤이 51.3%로, Astra의 41.4%와 Opus 5.5의 42.5%보다 높았습니다.
장기 소프트웨어 개발 과제를 평가하는 DeepSWE v1.1에서는 77.9%를 기록했다고 구글은 밝혔습니다. 사이버보안 관련 비교에서는 공동 1위라는 보도가 나왔습니다. 다만 이는 해당 보안 지표에 대한 결과이지, 모든 분야에서 경쟁 모델을 앞선다는 뜻은 아닙니다.
3
7
이 수치들은 구글이 공개한 특정 평가에서 아르곤이 어떤 성과를 냈는지 보여주는 자료입니다. 하지만 벤치마크 몇 개만으로 모델 전반의 우열이 확정되는 것은 아닙니다. 특히 접근이 제한된 현재로서는 독립적인 비교와 일상적인 업무에서의 검증이 충분히 이뤄지기 어렵습니다.
6
지금 사용할 수 있는 사람은 누구인가
구글은 우선 ‘페어윈드(Fairwind) 프로그램’을 통해 선별·검증된 사이버보안 방어 인력에게 아르곤을 제공하고 있습니다. 회사는 제한적 공개가 방어 현장에서 모델을 활용하도록 돕는 동시에 오용 위험을 줄이기 위한 조치라고 설명했습니다. 구글은 미국 정부의 자발적 사전 모델 접근 절차에도 참여하고 있습니다.
6
5
아직 개발자와 기업, 일반 소비자가 폭넓게 이용할 수 있는 단계는 아니며, 현재 보도에는 일반 공개를 시작할 구체적인 날짜도 나오지 않았습니다.
6 이런 제한적 출시 방식은 앤스로픽이 Claude Mythos Preview의 이용을 일부 기관으로 제한한 사례와 닮은 점이 있다고 보도됐습니다. 다만 두 프로그램을 세부적으로 비교할 만한 정보는 공개된 자료에 충분하지 않습니다.
6
제미나이 3.5 프로 지연이 남긴 과제
블룸버그 보도에 따르면 구글은 제미나이 3.5 프로의 역량을 개선하는 과정에서 출시가 늦어졌고, 특히 코딩 성능을 끌어올리는 데 공을 들였습니다. 이후 구글은 3.5 프로를 내놓는 대신 제미나이 4 아르곤을 발표했습니다.
이런 경과는 아르곤에 전략적 무게를 더합니다. 오픈AI와 앤스로픽이 차세대 모델을 선보이는 동안 구글의 주력 모델 계획은 지연됐고, 이제 아르곤이 경쟁력을 다시 입증해야 하는 상황입니다. 다만 공개된 보도는 3.5 프로 지연의 이유로 모델 역량 개선 작업을 들고 있을 뿐, 특정 딥마인드 조직 변화가 직접적인 원인이었다고 확인해주지는 않습니다.
성능 경쟁에 더해 비용도 변수지만
구글은 경쟁 전략의 일부로 모델의 비용 효율성도 강조해왔습니다. 최고 성능을 내세우는 것 외에 비용을 낮추는 방식으로 차별화를 꾀할 수 있다는 의미입니다. 그러나 현재 인용된 자료만으로는 아르곤 자체가 경쟁사의 주력 모델보다 실제로 저렴하다고 검증됐다고 말하기 어렵습니다.
지금까지 확인되는 그림은 분명합니다. 구글은 코딩과 기업 업무 관련 일부 벤치마크에서 강한 성적을 제시했지만, 모델은 제한된 대상에게만 제공하고 있습니다. 이 결과가 실제 현장에서도 경쟁 우위로 이어질지, 비용 면에서 어떤 차이를 보일지는 더 많은 이용자가 시험해볼 수 있게 된 뒤 판단할 문제입니다.
6