작지만 긴 문맥을 겨냥한 두 모델
Spark X2.5-4B와 Spark X2.5-1.7B는 클라우드 전용이 아니라 PC, 스마트폰, 스마트 기기, 로봇, 차량 시스템 등 기기 내부 또는 가까운 엣지 환경에서 실행하도록 설계된 범용 언어 모델이다. iFLYTEK의 완전자회사 **츠위안 싱훠(Ciyuan Xinghuo·XHToken/SparkLLM)**가 2026년 9월 1일 두 모델을 공개하고 오픈소스화했다.
2
4
공식 프로젝트는 대화, 글쓰기, 번역, 추론, 코딩, 도구 사용, 에이전트 워크플로 등 폭넓은 작업을 지원 대상으로 제시한다.
22
핵심은 ‘최대 100만 토큰’이라는 주장
iFLYTEK는 두 모델을 최대 100만 토큰의 네이티브 컨텍스트를 지원하는 최초의 온디바이스 오픈소스 모델이라고 설명한다. 다만 이는 iFLYTEK 측의 주장으로, 독립적인 검증을 거친 업계 기록으로 단정할 수는 없다.
1
2
5
네이티브 긴 컨텍스트란 긴 입력을 하나의 문맥으로 받아들이도록 모델 자체가 설계됐다는 뜻이다. 일반적인 검색증강생성(RAG) 방식처럼 매뉴얼이나 코드베이스를 여러 조각으로 나누고, 관련 부분만 검색해 답변에 조합하는 의존도를 낮출 가능성이 있다.
예를 들어 사후 서비스 매뉴얼에는 한 장의 예외 조항, 다른 장의 작업 절차, 별도의 부품·고장 코드 표가 함께 얽혀 있을 수 있다. 더 많은 내용을 같은 문맥에 유지할 수 있다면, 서로 떨어진 조항 간 관계를 검색된 일부 발췌문만으로 추론하는 방식보다 보존하기 쉬워진다. 장문 기술 문서, 대량 문서 묶음, 대규모 코드베이스도 같은 맥락에서 볼 수 있다.
다만 지원 가능한 최대 컨텍스트 길이와 특정 기기에서 실제로 쓸 수 있는 길이는 다르다. 외부 분석은 공개 자료만으로는 스마트폰이나 싱글보드컴퓨터에서 100만 토큰 전체를 유지할 때 필요한 메모리와 지연 시간이 확인되지 않았다고 지적한다. 실제 도입 전에는 하드웨어, 양자화 형식, 사용할 컨텍스트 길이, 허용 가능한 응답 지연을 직접 조합해 시험하는 편이 안전하다.
1
긴 문맥 비용을 낮추려는 하이브리드 어텐션
Spark X2.5는 전체 어텐션 1개 층과 슬라이딩 윈도우 어텐션 3개 층을 반복하는 하이브리드 구조를 사용한다.
6
18
전체 어텐션은 시퀀스 전반에 걸친 관계를 파악하는 데 유리하고, 슬라이딩 윈도우 어텐션은 대부분의 층에서 주변 토큰만 보도록 제한한다. 이는 매우 긴 입력에 모든 층이 전체 어텐션을 적용할 때 발생할 계산 비용을 줄이기 위한 설계다.
6
온디바이스 변환 버전의 설명에 따르면 4B 모델은 약 41억 1,000만 개 파라미터의 밀집형 디코더다. 엣지 배포를 겨냥한 비교적 작은 모델 규모를 보여주는 수치다.
18
로컬 에이전트가 겨냥하는 작업
이번 모델은 단순히 명령을 이해하는 모델보다, 로컬 시스템이 지시를 해석하고 여러 단계의 작업을 수행하는 데 초점을 둔다.
3
4
긴 문서·사무 업무·코딩
iFLYTEK는 사무 업무에서 4B 모델이 원시 데이터 분석부터 이중언어 보고서 작성까지 처리할 수 있다고 제시한다. 개발 작업에서는 코딩, 도구 사용, 추론, 에이전트 워크플로에 맞춰 조정됐다고 설명한다.
10
16
22
SparkLLM은 4B 모델의 코딩 성능이 자신보다 2~3배 큰 클라우드 모델과 경쟁할 수 있다고 주장한다. 그러나 이는 공급업체가 제시한 모델 크기 기준의 주장이다. 제공된 자료만으로는 독립 벤치마크, 작업 유형, 하드웨어 조건 전반에서 우위가 입증됐다고 보기는 어렵다.
16
스마트홈 제어
더 작은 1.7B 모델은 기기 제어 워크플로를 주요 활용처로 제시한다. iFLYTEK는 Domux 스마트홈 테스트 세트에서 이 모델이 엔드투엔드 명령 정확도 90.3%, 평균 지연 시간 0.85초를 기록했다고 발표했다.
4
10
16
이 수치는 회사의 테스트 결과를 보여주는 지표이지만, 모든 경쟁 모델이나 실제 배포 환경과 직접 비교할 수 있는 보편적 성능 지표는 아니다.
로봇과 엣지 하드웨어
iFLYTEK는 로보틱스 역시 대상 분야로 꼽는다. 로봇 본체나 엣지 장비에서 구동되는 언어 기반 워크플로는 로봇 조작·제어, 객체 추적, 내비게이션 판단 같은 작업을 지원하는 용도로 제시된다.
10
20
다만 제공된 자료에는 물체 조작, 추적, 내비게이션 각각에 대한 별도 벤치마크 결과가 없다. 이는 성능 보증이라기보다 배포 목표와 활용 시나리오로 이해하는 것이 적절하다.
로컬 실행의 장점과 남는 과제
모델을 로컬에서 실행하면 네트워크 연결과 클라우드 왕복 처리에 대한 의존도를 낮출 수 있다. 프롬프트와 문서를 기기 안에 남겨둘 수 있다는 점도 민감한 매뉴얼, 스마트홈 제어 명령, 로봇 작업 같은 사례에서 유용할 수 있다.
3
4
하지만 로컬 실행이 모든 작업을 자동으로 빠르게 만들거나 완전한 프라이버시를 보장하는 것은 아니다. 실제 체감 성능은 하드웨어, 추론 런타임, 양자화, 메모리 용량, 활성 컨텍스트 길이에 좌우된다. 특히 기본 모델 크기가 비교적 작더라도 100만 토큰 문맥을 실제로 다루는 일은 상당한 자원을 요구한다.
1
학습, 실행 환경, 공개 범위
iFLYTEK는 Spark X2.5가 중국 내 컴퓨팅 플랫폼에서 학습됐으며, 약 20조 토큰 규모의 다양한 사전학습 데이터를 사용했다고 밝혔다. 후속 학습은 에이전트, 코드, 수학, 지시 이행에 집중했다고 설명한다.
10
16
지원 하드웨어는 NVIDIA, 화웨이, 하이곤(Hygon), HOUMO이며, vLLM·SGLang·llama.cpp 같은 추론·배포 도구와 호환된다. Ollama와 LM Studio로도 배포할 수 있고, 미세조정 도구로는 LLaMA-Factory가 제시됐다.
4
10
16
모델 가중치, 소스 자료, 배포 문서는 XHToken의 Spark-X2.5 프로젝트와 관련 모델 릴리스를 통해 공개됐다. Hugging Face와 GitHub에서도 확인할 수 있다.
2
22 XHToken의 Hugging Face 페이지는 2026년 9월 4일 FP8 및 INT8 양자화 버전도 공개했다고 안내한다.
28
SparkLLM은 iFLYTEK 싱천(Xingchen)·Spark MaaS를 통한 API와 기간 한정 무료 이용도 발표했다. 다만 제공된 정보에는 혜택 기간, 대상, 할당량, 현재 유효 여부가 명시되지 않았다. 해당 API를 도입 계획에 반영하기 전에는 최신 이용 조건을 직접 확인해야 한다.
10
16
결론
Spark X2.5-4B와 1.7B의 주목점은 경량 엣지 모델 크기에 최대 100만 토큰 네이티브 컨텍스트와 로컬 에이전트 지향성을 결합했다는 데 있다. 모든 스마트폰이 지금 당장 100만 토큰 작업을 무리 없이 처리한다거나, 두 모델이 시장 전반의 성능 선두임이 입증됐다는 뜻은 아니다.
보다 현실적인 평가는 iFLYTEK가 긴 문맥, 로컬 배포, 작업 실행을 한데 묶어 실험할 수 있는 오픈 모델을 내놓았다는 것이다. 실제 가치는 목표 기기와 업무 조건에서 메모리 사용량, 응답 속도, 정확도를 직접 검증할 때 가려질 전망이다.
1
2
22