일론 머스크가 9월 14일 공개한 xAI의 로드맵은 아직 출시되지 않은 Grok 모델들의 야심 찬 순서를 제시했다. Grok 4.8은 그 주 사전학습을 마치고 강화학습(RL·reinforcement learning) 단계로 넘어가며, Grok 5는 인공일반지능(AGI·Artificial General Intelligence)에 도달할 수 있는 모델로 언급됐다.
하지만 이 발표에는 공개 벤치마크 결과, 모델 카드, AGI의 운영상 정의, 출시 날짜가 없었다. 따라서 이는 AGI 달성의 실증 결과라기보다 창업자의 전망으로 읽는 편이 타당하다.
1
2
4
Grok 4.8과 Grok 5에 대해 머스크가 말한 것
머스크는 Grok 4.8을 xAI의 새 C++ 소프트웨어 스택으로 학습한 2조5,000억 파라미터 모델이라고 소개했다. 그는 사전학습이 그 주에 끝나고 이어서 RL에 들어갈 것이라고 밝혔다.
1
2
Grok 4.7 이후 모델들의 역량은 다음과 같이 그렸다.
- Grok 4.8: 4.7보다 “눈에 띄는 개선”
- Grok 4.9: Astra 또는 Fable 급일 가능성
- Grok 5: “어떤 것보다 나을지도 모른다”는 수준이며, AGI에 얼마나 가까운지를 묻는 질문에는 4.8이 아닌 Grok 5를 가리켰다.
2
14
표현의 수위는 중요하다. “어떤 것보다 나을지도 모른다”는 말은 측정된 성능 우위 주장보다 훨씬 덜 구체적이다. 또한 AGI로 인정받기 위한 능력 범위, 신뢰성 기준, 자율성, 안전 기준, 평가 체계도 제시되지 않았다. 보도에서는 Grok 5를 xAI의 AGI 돌파구로 해석했지만, 원래 로드맵 자체에는 검증 가능한 세부 사항이 부족했다.
2
10
지연된 Grok 4.7의 위치
가까운 시점에 나올 것으로 예상됐던 Grok 4.7에 관해 머스크는 비교적 신중한 평가를 내렸다. 그는 이 모델이 앤트로픽의 Opus 5.0과 대체로 비슷한 수준이지만 5.1은 아니다라고 했고, 일부 영역에서는 더 낫고 다른 영역에서는 뒤처질 수 있다고 말했다. 멀티모달 성능도 개선해야 한다고 인정했다.
3
8
이는 전반적 선두를 선언하는 것보다 훨씬 제한적인 주장이다. 게다가 개발자들이 독립적으로 평가할 수 있는 공개 Grok 4.7이 없는 상태에서 4.8, 4.9, 5의 성능 단계가 거론됐다는 점에서 이후 로드맵은 본질적으로 잠정적이다.
Grok 4.7 출시 지연이 중요한 이유
머스크는 9월 2일 Grok 4.7이 약 10일 뒤 나온다고 말해 9월 12일 전후 출시를 시사했다. 그러나 9월 11일에는 “며칠 더” 필요하다고 밝혔다.
7
20
그가 든 설명은 RL 튜닝 문제였다. 응답 길이에 대한 패널티를 지나치게 크게 줬을 가능성이 있고, 이 때문에 모델이 원래 풀 수 있는 어려운 문제도 너무 일찍 포기하거나 자신의 작업을 충분히 검토하지 않는다는 것이다. 다만 머스크도 이를 확정된 기술적 진단이 아니라 가능한 원인으로 표현했다.
20
21
이는 단순한 일정 문제가 아니다. 대규모 사전학습을 끝내는 것과 신뢰할 수 있는 제품을 내놓는 일은 다르다는 점을 보여준다. RL 이후의 행동 특성, 평가, 멀티모달 품질, 신뢰성, 안전성 검토, 배포 준비, 가격 정책 모두가 출시 시점과 실제 출시 여부에 영향을 줄 수 있다.
당시 공개된 모델은 Grok 4.6
9월 14일 기준 Grok 4.7은 공개 출시되지 않았다. 보도에 따르면 xAI의 최신 공식 플래그십은 8월 12일 나온 Grok 4.6이었으며, API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 제시됐다.
3
11
같은 시기에는 Claude Fable 5.1, Gemini 3.8 Flash, GPT-6 Astra가 9월 출시 또는 발표 모델로 보도됐다.
34
45 경쟁 구도는 xAI 로드맵의 중요성을 키우지만, 아직 나오지 않은 Grok 모델의 비교 성능을 입증해 주지는 않는다.
핵심: 로드맵은 검증해야 할 주장이다
2조5,000억 파라미터 규모와 새 학습 스택은 상당한 인프라 투자를 시사할 수 있다. 그러나 파라미터 수나 컴퓨팅 역량만으로 모델의 실제 능력, 신뢰성, AGI 달성을 증명할 수는 없다. Grok 4.7의 지연은 학습 이후 단계의 모델 행동이 결정적일 수 있음을 보여주는 사례다.
1
20
개발자·고객·투자자가 확인해야 할 기준은 로드맵 문구보다 구체적이다.
- 정식 출시: 실제로 호출 가능한 모델 또는 제품 제공 여부
- 가격·문서·모델 카드: 사용 조건과 한계를 확인할 수 있는 공식 자료
- 재현 가능한 벤치마크: 필요하다면 멀티모달 및 장기 과제 평가까지 포함한 결과
- 명확한 AGI 정의와 평가 기준: AGI 주장을 단순한 목표 이상으로 받아들이기 위한 전제
이런 자료가 나오기 전까지 9월 14일의 발언은 xAI가 향하는 방향을 보여준다. 즉, 사전학습과 RL을 거친 Grok 4.8, 더 강력한 4.9, 그리고 매우 야심 찬 Grok 5다. 하지만 어느 모델이 약속된 능력 수준에 도달했다는 사실까지 입증하지는 않는다.
2
4