중국과 미국의 선두 AI 모델 간 성능 격차가 빠르게 좁혀지고 있다. 블룸버그 인텔리전스(BI)는 딥시크가 2026년 9월 V4.1 플래시를 공개한 뒤 그 격차가 약 **3%**로 줄었다고 분석했다. 5월에는 약 9%, 연초에는 약 **15%**였다는 추산이다. 다만 이는 특정 벤치마크에서 측정한 모델 성능의 차이이지, 중국이 AI 산업 전반에서 미국을 앞섰다는 의미는 아니다.
라이브벤치에서 확인된 점수 차이
딥시크 V4.1 플래시는 대규모 언어모델 성능을 비교하는 라이브벤치에서 81.1점을 기록해 글로벌 순위 6위에 올랐다. 앤트로픽의 선두 모델은 83.4점이었다. 두 점수의 차이는 2.3점으로, BI가 추산한 약 3% 격차와 맞닿아 있다.
12
이 수치는 라이브벤치라는 한 평가 기준에서 두 모델이 얼마나 가까운 점수를 얻었는지를 보여준다. 모든 종류의 작업에서 성능 차이가 같거나, AI 산업의 다른 경쟁 요소까지 비슷해졌다는 뜻은 아니다.
격차는 줄었지만, 중국의 전면적 우위는 아니다
변화는 몇 달에 걸쳐 이어졌다. BI는 중국 모델과 미국 모델의 성능 격차가 5월 약 9%에서 6월 약 6%로 줄었고, 당시 중국 모델 두 개가 라이브벤치 글로벌 순위에 진입했다고 밝혔다. 이후 격차가 약 3%까지 좁혀졌다는 추산은 개선 흐름이 계속됐음을 보여준다.
2
그렇다고 중국 모델이 상위권을 폭넓게 장악했다고 보기는 어렵다. 이후 라이브벤치 순위에서 상위 15개 모델 가운데 중국 모델은 3개였다. 최고 성능 모델 간 격차가 좁다는 점과 상위권에 포진한 모델의 수가 비슷하다는 점은 구분해서 봐야 한다.
8
반도체 수출통제와 미국의 AI 주도권
첨단 칩 접근이 제한된 상황에서도 중국 연구소들이 성과를 내면서, 미국의 반도체 수출통제가 모델 성능에서 미국의 우위를 지키는 데 얼마나 효과적인지를 둘러싼 질문이 제기되고 있다. 다만 이번 벤치마크 결과만으로 수출통제가 효과가 없었다고 결론 내릴 수는 없다. BI는 중국 AI 기업들이 미국 경쟁사보다 자금 여력이 작고, 가장 첨단화된 칩에 접근하기 어렵다는 점도 짚었다.
1
17
신중하게 말하면, 이번 결과는 벤치마크에서 측정한 미국의 성능 우위가 크게 줄었다는 뜻이다. AI 주도권의 더 넓은 균형을 판단하려면 단일 순위표를 넘어 기업의 자원과 모델을 실제로 널리 쓰이고 수익을 내는 제품으로 발전시키는 능력도 살펴야 한다.
좋은 모델이 곧 안정적인 수익은 아니다
모델 성능은 사업의 한 부분일 뿐이다. 블룸버그 보도는 중국 모델이 저비용 대안으로 경쟁력을 갖추고 있다고 전하면서도, 업계가 수익을 내는 데는 장벽이 있다고 지적했다. 딥시크의 낮은 가격은 경쟁사에 압박을 더할 수 있지만, 낮은 가격으로 이용자를 끌어들이는 것만으로 지속 가능한 수익이 입증되는 것은 아니다.
3
18
핵심은 BI가 측정한 성능 격차가 2026년 연초 약 15%에서 딥시크 V4.1 플래시 출시 이후 약 3%로 줄었다는 점이다. 이는 미국의 모델 성능 우위가 계속 유지될 것이라는 가정에 도전하는 결과지만, 중국이 AI 전반에서 앞섰다는 증거는 아니다. 경쟁력 있는 모델을 안정적인 수익으로 연결할 수 있을지도 여전히 과제로 남아 있다.
3