尽管参数总量仅为前代 Inkling(975B 总参数,41B 活跃参数)的四分之一,Inkling-Small 在多个关键基准上与之持平甚至反超,同时硬件部署和微调门槛大幅降低 。模型支持多模态输入(文本、图像、音频)、100 万 Token 上下文窗口,以及可调思考深度 。
Inkling-Small 在三项最严苛的公开基准上 超越 Inkling,但在事实性召回和竞赛数学方面存在短板 。
| 基准 | Inkling-Small | Inkling | 差值 |
|---|---|---|---|
| HLE(文本仅) | 31.6% | 29.7% | +1.9 百分点 |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 百分点 |
| GPQA Diamond | 89.5% | 87.2% | +2.3 百分点 |
| AA Index v4.1 | 40 | 41 | –1 点 |
| AIME 2026 | 95.5% | 97.1% | –1.6 百分点 |
| SimpleQA Verified | 20.6% | 43.9% | –23.3 百分点 |
来源:
关键要点:
Inkling-Small 是一个 42 层稀疏 MoE 变压器,每 Token 激活 6 个专家(共 256 个),外加 2 个共享专家 。模型采用混合注意力机制(全注意力和滑动窗口注意力混合),并支持可控思考深度,让开发者可以在延迟和推理深度之间灵活取舍 。
其架构与 Inkling 同属 MoE 家族,但专家数量更少(256 vs. 约 576),每层激活的专家也更少。结果就是,模型在推理时行为类似于一个 12B 参数的密集模型,但其权重中保留了 276B 模型的容量 。
Thinking Machines 使用了一个两阶段方案,目前业界正将其视为标准的后训练基本方法 :
基于 Inkling 的在线蒸馏(On-Policy Distillation)——早期检查点(Inkling-Small 预览版)以 Inkling 为教师模型进行训练。学生模型自行采样轨迹,教师模型则在 Token 级别提供密集监督——这种方法称为在线蒸馏(OPD)。该技术兼顾了蒸馏的样本效率与在线训练的分布真实性。
额外两周的智能体强化学习——团队继续扩大智能体编程 RL 的规模,这使模型在推理和编程基准上超越了 Inkling 。
该方案值得关注的一点是,学生模型在仅接受两周的额外 RL 后便在其老师最为擅长的任务上实现了反超——这与近期关于通过在线蒸馏实现“弱到强”泛化的研究结果一致 。
Inkling-Small 大幅降低了开源权重模型的硬件门槛。以下是官方配置 :
| 格式 | 聚合 VRAM | 示例配置 |
|---|---|---|
| BF16 | ~600 GB | 4× NVIDIA B300 或 8× H200 |
| NVFP4(W4A16) | ~180 GB | 2× NVIDIA H200 |
| NVFP4(W4A4) | ~180 GB | 1× NVIDIA B300(需 SM100+ 架构) |
作为对比,Inkling 的 BF16 检查点需要约 1.9 TB 的聚合 VRAM 。Inkling 的官方 NVFP4 量化版本则需约 600 GB 。
这一 3 倍 VRAM 缩减,使 Inkling-Small 成为 Thinking Machines 产品线中首个中等规模团队无需庞大集群即可进行 LoRA 和全参数微调 的模型 。模型支持 BF16、MXFP8 和 NVFP4 数值精度 。
Inkling-Small 可通过以下途径获取 :
Thinking Machines Lab 由前 OpenAI CTO Mira Murati 于 2024 年离开 OpenAI 后创立。John Schulman(前 OpenAI RLHF 团队联合创始人)同为联合创始人。Lilian Weng——最初也是创始团队成员——已离开 Thinking Machines Lab 并重返 OpenAI。这意味着 Mira Murati 和 John Schulman 是目前仅剩的联合创始人 。
Inkling-Small 是 Thinking Machines Lab 的一次有力表态:只要后训练方案得当,一个四分之一大小的模型不仅能够匹敌、甚至可以在推理和智能体编程任务上超越其更大的教师模型。对于那些因 Inkling(1.9 TB VRAM)而望而却步的开发者与组织,Inkling-Small 以 600 GB(BF16)乃至 180 GB(NVFP4)的配置敞开了大门。代价是事实性召回能力明显下降,但对于编程、推理和指令遵循等工作负载而言,截至 2026 年 7 月,Inkling-Small 是更务实的开源权重选择。