儘管其規模僅約為前代模型 Inkling(975B 總參數,41B 活躍參數)的四分之一,Inkling-Small 在多項關鍵基準上與之並駕齊驅甚至超越,同時所需硬體大幅減少 。該模型支援多模態輸入(文字、圖像與音訊)、100 萬 token 的脈絡視窗以及可變的思考努力(thinking effort)。
Inkling-Small 在三項最具挑戰的公開基準上 超越 Inkling,但在事實回憶與競賽數學方面則略遜一籌 。
| 基準測試 | Inkling-Small | Inkling | 差距 |
|---|---|---|---|
| HLE(純文字) | 31.6% | 29.7% | +1.9 百分點 |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 百分點 |
| GPQA Diamond | 89.5% | 87.2% | +2.3 百分點 |
| AA Index v4.1 | 40 | 41 | –1 分 |
| AIME 2026 | 95.5% | 97.1% | –1.6 百分點 |
| SimpleQA Verified | 20.6% | 43.9% | –23.3 百分點 |
來源:
關鍵觀察:
Inkling-Small 是一個 42 層的稀疏 MoE Transformer,每個 token 從 256 個專家(experts)中啟動 6 個,外加 2 個共享專家 。該模型採用混合注意力機制(hybrid attention,結合完整注意力與滑動視窗注意力),並支援可控的思考努力,讓開發者能在延遲與推理深度之間取得平衡 。
其架構與 Inkling 同屬 MoE 系列,但總專家數較少(256 個 vs. Inkling 約 576 個),且每層啟動的專家也較少。結果是:在推理時,它表現得像一個 12B 參數的密集模型,但其權重中保留了 276B 模型的容量 。
Thinking Machines 採用了一個兩階段的配方,目前業界正將其視為標準的後訓練基本流程進行研究 :
基於同策略的蒸餾(On-policy distillation from Inkling) — 早期的一個檢查點(Inkling-Small 預覽版)以 Inkling 為教師進行訓練。學生模型自行取樣軌跡,同時教師提供密集的 token 級別監督 — 這種方法稱為同策略蒸餾(OPD)。此技術結合了蒸餾的樣本效率與同策略訓練的分佈真實性。
額外兩週的代理強化學習 — 團隊持續擴展代理程式碼 RL,使模型在推理與程式碼基準上超越了 Inkling 。
此配方的突出之處在於,學生模型在僅進行了兩週的額外 RL 後,就在多項任務上超越了其教師模型 — 這一結果與近期關於透過同策略蒸餾實現「弱到強泛化」(weak-to-strong generalization)的研究相符 。
Inkling-Small 大幅降低了開放權重模型的硬體門檻。以下是官方模型卡提供的配置 :
| 格式 | 聚合 VRAM | 範例配置 |
|---|---|---|
| BF16 | ~600 GB | 4× NVIDIA B300 或 8× H200 |
| NVFP4 (W4A16) | ~180 GB | 2× NVIDIA H200 |
| NVFP4 (W4A4) | ~180 GB | 1× NVIDIA B300(需 SM100+) |
作為對比,Inkling 的 BF16 檢查點需要 約 1.9 TB 的聚合 VRAM 。Inkling 的官方 NVFP4 量化版本則需要約 600 GB 。
這項 約 3 倍的 VRAM 減少,使 Inkling-Small 成為 Thinking Machines 產品線中,第一個讓中型團隊在無需龐大多節點叢集的情況下,即可實際進行 LoRA 與全參數微調 的模型 。該模型支援 BF16、MXFP8 與 NVFP4 數值格式 。
Inkling-Small 可透過多種方式取得 :
Thinking Machines Lab 由前 OpenAI 技術長 Mira Murati 於離開 OpenAI 後創立。John Schulman(前 OpenAI 共同創辦人,RLHF 團隊領導者)也是共同創辦人。最初共同創辦團隊中的 Lilian Weng 已離開 Thinking Machines Lab 並返回 OpenAI。這使得 Mira Murati 與 John Schulman 成為該新創公司僅存的共同創辦人 。
Inkling-Small 是 Thinking Machines Lab 發出的一張強而有力的聲明:只要採用正確的後訓練配方,一個規模僅四分之一大小的模型,不僅能與其更大的教師模型並駕齊驅,甚至在推理與代理程式碼任務上還能超越它。對於那些因 Inkling(1.9 TB VRAM)的高昂成本而卻步的開發者與組織而言,Inkling-Small 以 600 GB(BF16)甚至 180 GB(NVFP4)的門檻打開了大門。其代價是在事實回憶方面有明顯的妥協,但對於程式碼、推理與指令遵循等工作負載,截至 2026 年 7 月,Inkling-Small 是更實用的開放權重選擇。