구글의 최신 플래그십 AI 모델 제미나이 4 아르곤을 두고 상반된 평가가 나오고 있습니다. 구글은 여러 벤치마크에서 앞선 성적을 거뒀다고 밝혔지만, 모델을 실제 업무에 써본 일부 직원은 코딩 작업에서 성능이 기대에 미치지 못할 때가 있다고 전했습니다. 이는 내부 평가가 엇갈린다는 보도이지, 제미나이 4가 경쟁 모델보다 뒤처진다는 결론이 내려졌다는 뜻은 아닙니다.
11
벤치마크 점수만으로 실무 성능을 알 수 있을까
구글은 제미나이 4가 여러 벤치마크에서 선도적인 결과를 냈으며, 보안 역량을 측정하는 한 평가에서는 오픈AI의 아스트라보다 높은 점수를 받았다고 밝혔습니다. 반면 모델을 직접 접한 일부 직원은 실제 코딩 작업에서 다른 경험을 했다고 전해졌습니다. 특히 프런트엔드 개발을 비롯한 일부 과제에서 어려움을 겪는다는 지적이 나왔습니다.
11
14
벤치마크는 정해진 평가 항목에서 모델을 비교하는 데 유용하지만, 일상적인 개발 업무에서 모델이 얼마나 유용하고 일관되게 작동하는지까지 모두 보여주지는 않습니다. 그렇다고 내부의 몇몇 경험만으로 벤치마크 결과가 틀렸다고 단정할 수도 없습니다. 두 평가는 서로 다른 측면을 짚고 있습니다.
구글은 반박…직원들 사이에서도 의견 갈려
구글은 제미나이 4가 코딩 분야에서 부진하다고 보는 것은 부정확하다며, 벤치마크 성과를 근거로 들었습니다. 한편 보도에 인용된 직원들의 견해는 한쪽으로 모이지 않았습니다. 일부는 앤트로픽의 페이블과 오픈AI의 아스트라가 더 빠르게 발전하고 있다고 보는 반면, 다른 직원들은 제미나이 4가 선두 모델들과 어깨를 나란히 하게 됐다고 평가했습니다.
11
12
13
따라서 내부의 우려나 구글의 벤치마크 설명 중 하나만으로 모델의 역량을 최종 판정하기는 이릅니다. 실제 성능은 어떤 작업을 맡기느냐에 따라서도 달라질 수 있습니다.
제미나이 3.5 프로 계획 변경이 더한 배경
보도에 따르면 구글은 2026년 6월 제미나이 3.5 프로를 출시할 계획이었지만, 해당 버전 개발을 접고 제미나이 4로 방향을 바꿨습니다. 이 과정은 구글의 모델 개발과 출시 속도를 둘러싼 관심을 키우는 배경이 됐습니다. 다만 계획 변경만으로 제미나이 4의 코딩 약점이 설명되거나, 모델이 열세라고 입증되는 것은 아닙니다.
6
13
보도 뒤 알파벳 주가가 보인 움직임
보도 이후 알파벳 주가는 앞서 2% 넘게 올랐던 상승 폭을 반납해, 보도된 수요일 거래에서 약 0.5% 상승으로 마감했습니다. 주가 움직임은 보도와 함께 시장의 분위기가 달라졌음을 보여주지만, 직원들의 우려가 사실이라고 증명하거나 그 우려가 주가 변동의 원인이었다고 단정해 주지는 않습니다.
1
14
시장 참여자들이 주목한 더 큰 질문은 구글이 오픈AI와 앤트로픽을 상대로 최상위 AI 모델 경쟁력을 유지할 수 있느냐는 점입니다. 제미나이 4는 이 경쟁의 한 축으로 다뤄지고 있지만, 보도는 구글의 개별 제품에 어떤 영향이 발생했는지까지 밝히지는 않았습니다. 그보다 넓은 파급 효과는 아직 확인된 결과라기보다 지켜봐야 할 문제입니다.
10