iFLYTEK는 25만6,000토큰을 넘는 장문 학습에서 국산 가속기가 엔비디아 H200보다 최대 약 5배 비효율적일 수 있다고 인정했지만, 모든 고객이 100만 토큰급 문맥을 필요로 하지는 않는다고 본다. 회사는 모델 구조, 연산자와 커널, 분산 통신, 메모리·KV 캐시, 학습 프레임워크를 함께 최적화해 국산 클러스터 효율을 초기 약 30%에서 84 93%까지 끌어올렸다고 밝혔다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How is iFLYTEK responding to domestic compute constraints, as discussed at its August 21, 2026 earnings call, given that domestic accelerato. Article summary: iFLYTEK’s response is not to outspend Nvidia-based frontier labs on the biggest possible model. It is to make domestic compute productive enough for commercially valuable, bounded-context applications—then monetize integ. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
iFLYTEK가 엔비디아 기반 연구소를 따라잡기 위해 택한 길은 가장 큰 모델을 만드는 것이 아니다. 회사가 확보할 수 있는 국내산 컴퓨팅 자원을 교육, 의료, 자동차, 기업용 서비스에 충분히 생산적으로 활용하고, 최대 문맥 길이보다 안정적인 업무 결과를 판매하는 전략이다.
그 배경에는 뚜렷한 격차가 있다. iFLYTEK는 25만6,000토큰을 넘는 장문 학습에서 국산 가속기의 효율이 엔비디아 H200보다 최대 약 5배 낮을 수 있다고 밝혔다. 다만 이 수치는 경영진이 공개한 설명에 기반한 것으로, 1차 실적 발표 녹취를 통해 독립적으로 검증된 수치는 아니다. 8
그렇다고 모든 산업용 AI가 100만 토큰의 문서를 한 번에 읽어야 하는 것은 아니다. 학교 시스템은 교육과정과 학생 기록 중 필요한 부분을 검색하면 되고, 의료 서비스는 관련 환자 정보와 임상 지식을 찾아오면 된다. 차량용 비서는 대화 상태와 차량 데이터를, 기업용 시스템은 정해진 내부 문서와 업무 절차를 활용하면 된다.
이런 환경에서는 모든 정보를 하나의 긴 문맥 창에 넣는 대신 검색·분할, 구조화된 메모리, 도구 호출과 에이전트를 조합할 수 있다. 초장문 처리 능력의 가치가 사라지는 것은 아니지만, 가장 비싼 문맥 창을 매번 사용할 필요는 줄어든다.
결국 iFLYTEK의 승부수는 분명하다. 고객이 최대 문맥 길이보다 도메인 정확도, 데이터 통제권, 개인정보 보호, 지연시간, 안정적인 업무 완료를 더 중요하게 여긴다면, 엔비디아와 동일한 학습 비용 구조를 갖추지 않고도 경쟁할 수 있다는 판단이다.
iFLYTEK의 대응은 특정 소프트웨어 최적화 하나에 머물지 않는다. 회사는 다음 영역을 함께 손보는 하드웨어·소프트웨어 공동 설계에 집중하고 있다.
목표는 통신 오버헤드와 메모리 병목을 줄이고, 가속기 활용률을 높이며, 국산 칩의 특성에 맞춰 모델을 재설계하는 것이다. 실제 시스템 성능은 가속기의 사양표만으로 결정되지 않기 때문이다.
iFLYTEK의 공식 자료에 따르면 국산 클러스터는 초기 업계 주류 클러스터 성능의 약 30% 수준에서 출발했다. 이후 연산자 최적화, 분산 전략 개선, 전반적인 엔지니어링 튜닝을 거쳐 효율을 84~93%까지 높였다는 것이 회사 측 설명이다. 이 역시 독립적인 감사를 거친 벤치마크가 아니라 회사가 공개한 성과 수치다. 17
이 전략을 뒷받침하는 가장 선명한 사례는 iFLYTEK가 국산 칩을 단순한 추론용 대체재로만 사용하지 않고, Spark 모델군의 학습부터 배포까지 국내 인프라에서 이어가고 있다는 점이다.
Spark X2-Flash는 300억 개 파라미터 규모의 혼합 전문가 모델로, 화웨이 어센드 910B 클러스터에서 전 과정이 학습·배포됐다고 설명됐다. 이는 다른 환경에서 학습한 모델을 국산 칩으로 옮긴 사례가 아니라, 학습과 배포를 모두 아우르는 엔드투엔드 국내 경로라는 의미가 있다. 8
회사는 장문 추론 파이프라인과 Spark X2를 모델과 인프라를 공동 최적화한 사례로 제시했다. Spark X2-VL은 이 모델군을 멀티모달 작업으로 확장한 버전이며, iFLYTEK의 공개 자료는 X2, X2-Flash, X2-VL이 2026년에 차례로 업그레이드됐다고 밝히고 있다. 17
이는 회사가 앞서 추진해 온 국산 컴퓨팅 전략과도 일치한다. iFLYTEK는 Spark 모델이 학습, 반복 개선, 추론 배포를 모두 국산 컴퓨팅 체계에서 수행해 왔다고 설명한다. 또한 이전 보도에 따르면 새로운 모델 알고리즘을 국산 칩에 맞추는 데 매번 6개월 이상이 걸렸고, 고성능 엔비디아 칩 성능의 80%를 넘기기까지 상당한 엔지니어링 작업이 필요했다. 5
iFLYTEK는 2026년 8월 21일 실적 설명회에서 완전 국산 컴퓨팅 기반의 새로운 범용 플래그십 모델을 올해 글로벌 1024 개발자 페스티벌에서 출시하겠다고 발표했다. 행사 전 단계적 버전이 공개될 가능성은 제시됐지만, 질문에 포함된 ‘8월 말’이라는 정확한 출시 시점까지 확정된 것은 아니다. 1
이 모델은 iFLYTEK의 접근법이 특정 산업용 시나리오를 넘어 범용 모델 세대에도 적용될 수 있는지를 보여주는 시험이 될 전망이다. 성공적인 출시라면 국산 인프라가 또 하나의 대형 모델 세대를 뒷받침할 수 있다는 증거가 된다. 그러나 그것만으로 모든 학습 작업에서 엔비디아와 하드웨어 성능이 같다는 의미는 아니다.
컴퓨팅 자원이 제한된 기업은 선택의 기로에 선다. 최첨단 모델 학습의 비용과 규모를 정면으로 겨루거나, 모델 외에도 제품·데이터·배포·운영이 함께 가치를 만드는 산업 현장에 AI를 심는 것이다. iFLYTEK는 후자에 무게를 두고 있다.
회사의 모델 포트폴리오는 교육과 의료처럼 민감한 데이터의 비공개 배포, 분야별 정확도, 운영 안정성이 중요한 영역을 겨냥한다. iFLYTEK의 자료는 Spark가 교육 등 응용 분야를 지원한다고 설명하며, 의료 부문에서는 Spark 의료 모델을 기반으로 한 임상 의사결정 지원 시스템을 소개한다. 17
35
이런 제품 중심 전략의 장점은 엔지니어링 성과를 반복 사용할 수 있다는 데 있다. 연산자, 통신 방식, 메모리 관리, 배포 프레임워크를 개선하면 다음 모델 세대와 여러 고객 설치 환경에 재활용할 수 있다.
따라서 경쟁력은 절대적인 학습 비용이 엔비디아보다 낮다는 데 있지 않다. 제한된 하드웨어에서 더 많은 실사용 작업을 뽑아내고, 학습부터 배포까지 전체 생명주기를 통제할 수 있다는 데 있다.
류칭펑 회장이 격차가 약 2년 안에 좁혀질 수 있다고 보는 근거는 국산 칩이 이미 엔비디아와 동등하다는 가정이 아니다. iFLYTEK가 수년간 모델 구조, 분산 시스템, 소프트웨어 도구를 국내 인프라에 맞춰온 경험에 기반한다.
칩과 네트워크, 컴파일러, 프레임워크, 개발자 생태계가 개선되면 새로운 모델을 생산 환경에 올리는 데 필요한 시간이 짧아질 수 있다. 이 경우 지금의 약점이 오히려 조직적 강점으로 바뀔 가능성이 있다. iFLYTEK는 경쟁사보다 낮은 전환 비용, 축적된 실전 경험, 성숙한 국내 배포 스택을 갖게 될 수 있기 때문이다.
회사는 이를 컴퓨팅 인프라부터 모델 애플리케이션까지 독립적이고 통제 가능한 시스템을 구축하는 과정으로 설명해 왔다. 3
17 다만 이는 가능한 경로이지 보장된 결과는 아니다. 중국 AI 하드웨어 시장에 대한 최근 보도 역시 국산 칩이 추론 분야에서는 진전을 보이고 있지만, 메모리 시스템 성능을 포함한 학습 영역에서는 엔비디아의 우위가 여전히 남아 있다고 구분한다.
2
6
이 전략은 교육, 의료, 자동차, 기업 고객이 무제한 문맥보다 보안, 배포 통제, 지연시간, 도메인 정확도, 실제 업무 성과를 계속 중시할 때 가장 잘 작동한다.
반대로 고객이 100만 토큰급 학습과 추론을 표준 기능으로 요구하기 시작하면 매력은 떨어질 수 있다. 핵심 질문은 iFLYTEK가 모든 하드웨어 격차를 없앨 수 있느냐가 아니다. 엔지니어링과 제품 통합으로 그 격차를 충분히 많은 고부가가치 응용 분야에서 상업적으로 중요하지 않게 만들 수 있느냐가 관건이다.
Spark X2 모델군, 회사가 보고한 효율 개선, 그리고 완전 국산 컴퓨팅 기반 플래그십 계획은 iFLYTEK가 그 목표를 실제로 추구하고 있음을 보여준다. 다만 초장문 학습과 추론의 최전선은 여전히 해결되지 않은 가장 큰 과제다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
iFLYTEK는 25만6,000토큰을 넘는 장문 학습에서 국산 가속기가 엔비디아 H200보다 최대 약 5배 비효율적일 수 있다고 인정했지만, 모든 고객이 100만 토큰급 문맥을 필요로 하지는 않는다고 본다.
iFLYTEK는 25만6,000토큰을 넘는 장문 학습에서 국산 가속기가 엔비디아 H200보다 최대 약 5배 비효율적일 수 있다고 인정했지만, 모든 고객이 100만 토큰급 문맥을 필요로 하지는 않는다고 본다. 회사는 모델 구조, 연산자와 커널, 분산 통신, 메모리·KV 캐시, 학습 프레임워크를 함께 최적화해 국산 클러스터 효율을 초기 약 30%에서 84 93%까지 끌어올렸다고 밝혔다.
화웨이 어센드 910B에서 학습과 배포를 모두 진행한 300억 파라미터급 Spark X2 Flash와 Spark X2 VL, 완전 국산 컴퓨팅 기반 차기 플래그십 모델이 이 전략의 실증 사례로 제시됐다.