雖然佢得前輩 Inkling(975B 總參數,41B 活躍)四分之一咁大,Inkling-Small 喺幾個關鍵 benchmark 上面追平甚至打敗大佬,而且硬件要求低好多。佢支援多模態(文字、圖像、音訊),有 100 萬 token 嘅上下文窗口,仲可以控制「思考力度」。
Inkling-Small 喺三個最難嘅公開 benchmark 贏 Inkling,但係事實 recall 同數學競賽就輸 。
| Benchmark | Inkling-Small | Inkling | 差距 |
|---|---|---|---|
| HLE (淨文字) | 31.6% | 29.7% | +1.9 pp |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 pp |
| GPQA Diamond | 89.5% | 87.2% | +2.3 pp |
| AA Index v4.1 | 40 | 41 | –1 分 |
| AIME 2026 | 95.5% | 97.1% | –1.6 pp |
| SimpleQA Verified | 20.6% | 43.9% | –23.3 pp |
來源:
重點分析:
Inkling-Small 係個 42 層嘅稀疏 MoE 變壓器,每層開 6 個專家(總共 256 個),再加 2 個共享專家 。佢用混合注意力機制(full + sliding-window attention),仲可以調節思考力度,等開發者可以喺延遲同推理深度之間取捨 。
結構同 Inkling 屬於同一家族,但係專家數量少啲(256 vs 約 576),每層開嘅專家亦少啲。結果令到推論時好似 12B 嘅密集模型咁快,但權重容量仲有 276B 。
Thinking Machines 用咗兩步曲,業界已經開始研究呢個做法 :
On-policy 蒸餾自 Inkling—先用 Inkling 做老師,訓練早前版本嘅 Inkling-Small preview。呢個方法叫 on-policy distillation (OPD),學生自己採樣本,老師逐個 token 畀監督 。
再兩個禮拜嘅 agent-focused 強化學習—團隊繼續放大規模嘅 agentic coding RL,令到模型喺推理同編碼 benchmark 上超越 Inkling 。
呢個做法嘅亮點係:學生用咗兩個禮拜 RL 就超越老師—同最近研究弱到強泛化(weak-to-strong generalization)嘅結果吻合 。
Inkling-Small 大幅降低開源模型嘅硬件門檻。以下係官方建議配置 :
| 格式 | 總 VRAM 需求 | 例子配置 |
|---|---|---|
| BF16 | ~600 GB | 4× NVIDIA B300 或 8× H200 |
| NVFP4 (W4A16) | ~180 GB | 2× NVIDIA H200 |
| NVFP4 (W4A4) | ~180 GB | 1× NVIDIA B300(要 SM100+) |
比較吓:Inkling 嘅 BF16 checkpoint 要 ~1.9 TB VRAM ,NVFP4 版都要 ~600 GB 。
即係 Inkling-Small 係 Thinking Machines 系列第一個令 中型團隊都玩到 LoRA 甚至 full-parameter fine-tuning 嘅模型,唔使再靠巨量多節點集群 。佢支援 BF16、MXFP8 同 NVFP4 數值格式 。
Inkling-Small 有幾種玩法 :
Thinking Machines Lab 由前 OpenAI CTO Mira Murati(2024 年離開 OpenAI)創立。John Schulman(前 OpenAI RLHF 團隊聯創)都係聯創。Lilian Weng 最初係創始團隊成員,但已經離開 Thinking Machines Lab 返咗 OpenAI。所以而家得返 Mira Murati 同 John Schulman 做聯創 。
Inkling-Small 係 Thinking Machines Lab 嘅一個強烈信號:只要後訓練方法啱,四分之一大嘅模型唔止追得上老師,仲可以喺推理同 agentic coding 任務上超越佢。對於之前因為 Inkling(1.9 TB VRAM)太貴而玩唔起嘅開發者同機構,Inkling-Small 以 600 GB(BF16)甚至 180 GB(NVFP4)開咗度門。代價係事實 recall 差一截,但如果你嘅 workload 係 coding、推理同跟 instruction,截至 2026年7月,Inkling-Small 係更實際嘅開源選擇。