전작 Inkling(975B 총 파라미터, 활성 41B)의 약 4분의 1 크기임에도 불구하고, Inkling-Small은 몇 가지 주요 벤치마크에서 더 큰 모델과 동등하거나 이를 능가하는 성능을 보여주면서도 실행 및 파인튜닝에 필요한 하드웨어 사양을 극적으로 낮췄습니다 . 이 모델은 멀티모달 입력(텍스트, 이미지, 오디오), 100만 토큰의 컨텍스트 윈도우, 그리고 조절 가능한 사고 노력(thinking effort) 기능을 지원합니다 .
Inkling-Small은 가장 까다로운 공개 벤치마크 3개에서 Inkling을 능가하지만, 사실적 회상 능력과 수학 경시대회에서는 뒤쳐집니다 .
| 벤치마크 | Inkling-Small | Inkling | 차이 |
|---|---|---|---|
| HLE (텍스트 전용) | 31.6% | 29.7% | +1.9%p |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6%p |
| GPQA Diamond | 89.5% | 87.2% | +2.3%p |
| AA Index v4.1 | 40 | 41 | -1점 |
| AIME 2026 | 95.5% | 97.1% | -1.6%p |
| SimpleQA Verified | 20.6% | 43.9% | -23.3%p |
출처:
핵심 요점:
Inkling-Small은 42개의 레이어로 구성된 희소 MoE 트랜스포머로, 각 토큰에 대해 256개의 전문가 중 6개와 2개의 공유 전문가가 활성화됩니다 . 이 모델은 하이브리드 어텐션(전체 어텐션과 슬라이딩 윈도우 어텐션 혼합)을 사용하며, 조절 가능한 사고 노력 기능을 지원하여 개발자가 지연 시간과 추론 깊이 사이에서 균형을 맞출 수 있습니다 .
아키텍처는 Inkling과 동일한 MoE 패밀리이지만, 총 전문가 수가 더 적고(256개, Inkling은 약 576개) 레이어당 활성화되는 전문가 수도 적습니다. 그 결과 추론 시에는 12B 파라미터의 덴스 모델처럼 동작하지만, 가중치에는 276B 모델의 용량을 그대로 유지합니다 .
Thinking Machines은 현재 업계 표준 포스트 트레이닝 기법으로 연구되고 있는 2단계 레시피를 사용했습니다 :
이 레시피는 학생 모델이 단 2주간의 추가 RL만으로 여러 작업에서 교사 모델을 능가했다는 점에서 주목할 만하며, 이는 온폴리시 증류를 통한 약-강 일반화(Weak-to-Strong Generalization)에 대한 최근 연구 결과와 일치합니다 .
Inkling-Small은 오픈 웨이트 모델의 하드웨어 진입 장벽을 대폭 낮췄습니다. 다음은 모델 카드에 명시된 공식 구성입니다 :
| 형식 | 총 VRAM | 예시 구성 |
|---|---|---|
| BF16 | ~600 GB | NVIDIA B300 4장 또는 H200 8장 |
| NVFP4 (W4A16) | ~180 GB | NVIDIA H200 2장 |
| NVFP4 (W4A4) | ~180 GB | NVIDIA B300 1장 (SM100+ 필요) |
참고로, Inkling의 BF16 체크포인트는 약 1.9TB의 총 VRAM이 필요했습니다 . Inkling의 공식 NVFP4 양자화 버전은 약 600GB가 필요했습니다 .
이 약 3배의 VRAM 감소로 인해 Inkling-Small은 Thinking Machines 제품군 중 중간 규모의 팀도 대규모 멀티노드 클러스터 없이 LoRA 및 풀 파라미터 파인튜닝을 현실적으로 수행할 수 있는 첫 번째 모델이 되었습니다 . 이 모델은 BF16, MXFP8, NVFP4 수치 형식을 지원합니다 .
Inkling-Small은 여러 방식으로 사용할 수 있습니다 :
Thinking Machines Lab은 2024년 OpenAI를 떠난 전 OpenAI CTO 미라 무라티(Mira Murati) 가 설립했습니다. 존 슐먼(John Schulman) (전 OpenAI RLHF 팀 공동 창립자)도 공동 창업자입니다. 초기 창립 멤버였던 릴리안 웽(Lilian Weng) 은 Thinking Machines Lab을 떠나 OpenAI로 복귀했습니다. 이에 따라 미라 무라티와 존 슐먼만이 남은 공동 창업자가 되었습니다 .
Inkling-Small은 Thinking Machines Lab의 강력한 자신감을 보여줍니다. 올바른 포스트 트레이닝 레시피를 사용하면, 4분의 1 크기의 모델이 더 큰 교사 모델을 추론 및 에이전트 코딩 작업에서 능가할 수 있을 뿐만 아니라 따라잡을 수도 있습니다. Inkling(1.9TB VRAM)을 실행하는 데 부담을 느꼈던 개발자와 조직에게 Inkling-Small은 600GB(BF16) 또는 180GB(NVFP4)라는 훨씬 낮은 하드웨어 요구 사항으로 문을 열어줍니다. 사실적 회상 능력에서 눈에 띄는 손실이 있지만, 코딩, 추론 및 명령 수행 워크로드에 있어서 Inkling-Small은 2026년 7월 현재 가장 실용적인 오픈 웨이트 선택지입니다.