StepFun의 Step 5 Preview는 답변 하나를 빨리 생성하기보다 많은 자료를 읽고 여러 단계를 거쳐 결과물을 만드는 작업에 초점을 맞춘 모델이다. StepFun은 소프트웨어 개발, 전문 지식 업무, 다단계 AI 에이전트에 이 모델을 권장한다. 텍스트뿐 아니라 이미지와 동영상을 입력받고, 한 번에 처리하도록 설정할 수 있는 문맥 창은 100만 토큰이다. 다만 문맥 창이 크다는 사실만으로 긴 작업 전체에서 정보를 정확히 기억하거나 끝까지 완수한다고 보장할 수는 없다.
1
3
지금 쓸 수 있나? 오픈 가중치는 언제 나오나?
Step 5 Preview는 현재 StepFun의 API에서 선택할 수 있는 모델로 문서화돼 있다. 모델 가중치를 공개해 자체 환경에서 실행할 수 있도록 하는 ‘오픈 가중치’ 공개는 2026년 10월 15일 예정이라는 보도가 있다. 기준일인 9월 25일에는 아직 미래의 일정이며, 공식 공개가 끝났다는 뜻은 아니다.
3
32
허깅페이스에는 이미 BF16 가중치를 제공한다고 주장하는 제3자 저장소들이 있다. 하지만 해당 목록만으로 StepFun이 공식 체크포인트를 배포했다고 확인할 수는 없다.
5
11
6,000억 매개변수와 100만 토큰 문맥의 의미
Step 5 Preview는 전체 매개변수 6,000억 개, 토큰당 활성화되는 매개변수 약 270억 개의 희소 전문가 혼합(MoE) 모델로 소개된다. 모든 매개변수를 매번 사용하는 방식이 아니라 입력을 처리할 때 일부를 활성화하는 구조다. 텍스트·이미지·동영상 입력과 100만 토큰 문맥 창을 결합해 방대한 자료를 다루는 작업을 겨냥한다.
1
5
StepFun은 소프트웨어 환경에서 오래 이어지는 작업과 금융 관련 업무도 강조한다. 이는 회사가 내세우는 활용 방향이지, 모든 실제 업무에서 검증된 성능을 보장하는 설명은 아니다.
1
16
가격·측정 성능과 기술 주장, 구분해서 볼 점
독립 모델 평가 사이트 Artificial Analysis는 Step 5 Preview에 지능 지수 44점을 부여했다. 제시된 가격은 입력 100만 토큰당 1달러, 출력 100만 토큰당 2.70달러다. StepFun API를 통해 측정한 출력 속도는 초당 약 83토큰이다. 이 속도는 해당 시험 조건에서 나온 값으로, 모든 요청에서 일정하게 유지되는 수치는 아니다.
21
긴 문맥을 구현하는 기술로 제3자 모델 목록은 Sparse GQA를 언급한다. 별도 보도에는 장기 작업을 위한 온폴리시 강화학습, MoE 경로 선택의 학습·추론 정렬, MTP-3 추측 디코딩, FP8 MoE, KV 캐시 오프로딩이 열거돼 있다. 같은 보도는 StepFun이 장기 강화학습의 전체 처리 속도가 3배 넘게 빨라졌다고 주장한다고 전한다. 다만 제공된 공식 문서만으로는 이런 세부 기술이나 개선 폭을 독립적으로 확인하기 어렵다.
5
37
또한 제공된 자료에는 Step 5 Preview가 검증 가능한 과제를 생성하는 데 구체적으로 어떤 역할을 하는지 뒷받침할 근거가 없다. 개별 기술이 추론이나 도구 사용 능력을 얼마나 개선했는지도 분리해 측정된 결과로 받아들여서는 안 된다.
1
37
Step 3.5 Flash·Step 3.7 Flash와 무엇이 다른가?
StepFun의 권장 기준은 매개변수 규모보다 작업의 성격이다. 순수 텍스트 작업에는 Step 3.5 Flash, 빠른 멀티모달 추론에는 Step 3.7 Flash를 권장한다. Step 3.7 Flash는 이미지·동영상 이해를 지원하고 추론 강도를 세 단계로 선택할 수 있다. 문맥 창은 25만 6,000토큰, 전체 매개변수는 1,980억 개, 토큰당 활성 매개변수는 약 110억 개다. Step 5 Preview의 100만 토큰·6,000억/270억 개보다 작은 규모다.
1
2
5
따라서 많은 자료를 바탕으로 여러 단계를 이어가는 작업이라면 Step 5 Preview를, 속도가 중요한 멀티모달 작업이나 텍스트 위주 작업이라면 각각 Step 3.7 Flash와 Step 3.5 Flash를 우선 검토하는 것이 StepFun의 모델별 권장 방향에 가깝다.
1