サイズは前身モデルInkling(975B総パラメータ、41B活性)の約4分の1ですが、主要ベンチマークのいくつかではこれを凌駕または同等の性能を示し、実行やファインチューニングに必要なハードウェアは劇的に少なくて済みます。このモデルはマルチモーダル入力(テキスト、画像、音声)に対応し、100万トークンのコンテキストウィンドウ、そして思考の強さを調節可能な機能も備えています。
Inkling-Smallは、最も要求の厳しい公開ベンチマークのうち3つでInklingを上回りましたが、事実知識の想起と競技数学では劣ります。
| ベンチマーク | Inkling-Small | Inkling | 差分 |
|---|---|---|---|
| HLE(テキストのみ) | 31.6% | 29.7% | +1.9 ppt |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 ppt |
| GPQA Diamond | 89.5% | 87.2% | +2.3 ppt |
| AA Index v4.1 | 40 | 41 | –1 ポイント |
| AIME 2026 | 95.5% | 97.1% | –1.6 ppt |
| SimpleQA Verified | 20.6% | 43.9% | –23.3 ppt |
出典:
主なポイント:
Inkling-Smallは、42層のスパースMoEトランスフォーマーで、256のエキスパートのうちトークンあたり6つが活性化され、さらに2つの共有エキスパートを持ちます。ハイブリッドアテンション(フルアテンションとスライディングウィンドウアテンションの混合)を採用し、思考の強さを制御可能で、開発者はレイテンシと推論の深さをトレードオフできます。
アーキテクチャはInklingと同じMoEファミリーですが、総エキスパート数が少なく(Inklingの約576に対し256)、レイヤーあたりの活性エキスパート数も少なくなっています。結果として、推論時には12Bパラメータの高密度モデルのように振る舞いながら、重みとしては276Bモデルの容量を保持します。
Thinking Machinesは現在、業界で標準的なポストトレーニング手法として研究されている2段階のレシピを採用しました:
Inklingからのオンポリシー蒸留——初期のチェックポイント(Inkling-Smallプレビュー)は、Inklingを教師モデルとして学習されました。生徒モデルが自身の軌跡をサンプリングし、教師がトークンレベルの詳細な監督信号を提供する——オンポリシー蒸留(OPD)として知られる手法です。この手法は、蒸留のサンプル効率とオンポリシー学習の分布的な現実性を組み合わせたものです。
2週間の追加エージェント特化強化学習——チームはエージェント型コーディングの強化学習を継続的にスケールさせ、推論とコーディングのベンチマークでInklingを超えました。
このレシピが注目されるのは、生徒モデルがわずか2週間の追加強化学習の後に、複数のタスクで教師モデルを凌駕した点です——これはオンポリシー蒸留による弱から強への一般化に関する最近の研究結果と一致しています。
Inkling-Smallは、オープンウェイトモデルのハードウェア障壁を劇的に引き下げました。以下はモデルカードからの公式構成です:
| 形式 | 総VRAM | 構成例 |
|---|---|---|
| BF16 | ~600 GB | NVIDIA B300 4基または H200 8基 |
| NVFP4 (W4A16) | ~180 GB | NVIDIA H200 2基 |
| NVFP4 (W4A4) | ~180 GB | NVIDIA B300 1基(SM100+必須) |
参考までに、InklingのBF16チェックポイントには約1.9 TBの総VRAMが必要でした。Inklingの公式NVFP4量子化版でも約600 GBが必要でした。
この3倍のVRAM削減により、Inkling-SmallはThinking Machinesのラインナップで初めて、大規模なマルチノードクラスターなしで中規模チームによるLoRAおよびフルパラメータファインチューニングが現実的に可能なモデルとなりました。このモデルはBF16、MXFP8、NVFP4の数値形式をサポートします。
Inkling-Smallは複数の方法で利用可能です:
Thinking Machines Labは、2024年にOpenAIを退社した元CTOのMira Murati(ミラ・ムラティ) によって設立されました。John Schulman(ジョン・シュルマン)(OpenAIのRLHFチームの共同創設者)も共同創業者です。当初は創業チームの一員だったLilian Weng(リリアン・ウェン) は、その後Thinking Machines Labを離れ、OpenAIに復帰しました。これにより、Mira MuratiとJohn Schulmanがスタートアップの残る共同創業者となっています。
Inkling-Smallは、Thinking Machines Labによる力強い声明です。適切なポストトレーニングのレシピがあれば、4分の1のサイズのモデルが、推論とエージェントコーディングタスクにおいて、より大きな教師モデルに匹敵するだけでなく、それを上回ることができるのです。Inklingを実行するにはハードルが高すぎた(1.9 TB VRAM)開発者や組織にとって、Inkling-Smallは600 GB(BF16)、さらには180 GB(NVFP4)でその扉を開きます。トレードオフとして事実知識の想起には大きな打撃がありますが、コーディング、推論、指示追従のワークロードにおいては、2026年7月時点でInkling-Smallはより実用的なオープンウェイトの選択肢です。