Im Vergleich zum ursprünglichen Inkling mit 975 Milliarden Gesamtparametern und 41 Milliarden aktiven Parametern ist Inkling-Small damit ungefähr ein Viertel so groß. Trotzdem erreicht es in mehreren wichtigen Tests mindestens die Leistung des größeren Modells oder übertrifft sie sogar – bei deutlich geringeren Anforderungen an den Betrieb und das Fein-Tuning .
Beide Modelle verarbeiten Text, Bilder und Audio, bieten ein Kontextfenster von bis zu 1 Million Tokens und erlauben eine variable Denkintensität. Entwickler können damit zwischen höherer Antwortqualität und geringerer Latenz abwägen .
Inkling-Small gewinnt nicht in jeder Kategorie. Besonders überzeugend ist das Modell bei komplexem Schlussfolgern, wissenschaftlichen Aufgaben und agentenbasiertem Programmieren. Beim Abruf konkreter Fakten und bei Wettbewerbs-Mathematik hat dagegen Inkling die Nase vorn .
| Benchmark | Inkling-Small | Inkling | Differenz |
|---|---|---|---|
| HLE, nur Text | 31,6 % | 29,7 % | +1,9 Prozentpunkte |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 Prozentpunkte |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 Prozentpunkte |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 Punkt |
| AIME 2026 | 95,5 % | 97,1 % | −1,6 Prozentpunkte |
| SimpleQA Verified | 20,6 % | 43,9 % | −23,3 Prozentpunkte |
Quellen:
Die wichtigsten Ergebnisse:
Die Ergebnisse bedeuten daher nicht, dass das kleinere Modell den Vorgänger generell ersetzt. Für Rechercheaufgaben, bei denen präziser Faktenabruf entscheidend ist, kann Inkling weiterhin die bessere Wahl sein. Für Coding- und Reasoning-Workloads ist Inkling-Small jedoch die praktischere Variante.
Inkling-Small ist ein 42-lagiger, sparsamer MoE-Transformer. Pro Token werden sechs von 256 Experten aktiviert; zusätzlich kommen zwei gemeinsam genutzte Experten zum Einsatz . Eine hybride Aufmerksamkeitsarchitektur kombiniert vollständige mit auf ein Fenster begrenzter Aufmerksamkeit. Die variable Denkintensität ermöglicht es, Rechenzeit und Antworttiefe an den jeweiligen Anwendungsfall anzupassen .
Das Modell gehört zur selben MoE-Familie wie Inkling, arbeitet aber mit deutlich weniger Gesamtexperten – 256 statt ungefähr 576 – und aktiviert weniger Experten pro Schicht. Beim Ausführen verhält es sich dadurch ungefähr wie ein dichtes Modell mit 12 Milliarden aktiven Parametern, bewahrt in seinen Gewichten aber die Kapazität eines 276-Milliarden-Parameter-Modells .
Wichtig für die Planung: „12 Milliarden aktiv“ bedeutet nicht, dass der gesamte Checkpoint nur die Größe eines 12B-Modells hat. Für das Laden des Modells muss die Hardware weiterhin die Gesamtgewichte berücksichtigen .
Thinking Machines setzte auf einen zweistufigen Prozess, der die Stärken von Destillation und Reinforcement Learning verbinden soll .
Bemerkenswert ist vor allem, dass der kleinere Student seinen größeren Lehrer in mehreren Aufgaben nach nur zwei zusätzlichen RL-Wochen übertreffen konnte. Das passt zu aktueller Forschung über Weak-to-Strong-Generalization und On-Policy-Destillation . Die Benchmark-Ergebnisse sind allerdings keine Garantie dafür, dass Inkling-Small in jedem praktischen Szenario besser abschneidet.
Der größte praktische Unterschied liegt beim Speicherbedarf. Nach Angaben der offiziellen Model Card gelten folgende Mindestkonfigurationen :
| Format | Aggregierter VRAM-Bedarf | Beispielkonfiguration |
|---|---|---|
| BF16 | etwa 600 GB | 4 × NVIDIA B300 oder 8 × H200 |
| NVFP4 (W4A16) | etwa 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | etwa 180 GB | 1 × NVIDIA B300, SM100+ erforderlich |
Zum Vergleich: Der BF16-Checkpoint von Inkling benötigte ungefähr 1,9 TB aggregierten VRAM. Die offizielle quantisierte NVFP4-Variante von Inkling lag bei etwa 600 GB .
Die Verringerung auf rund 600 GB bei BF16 beziehungsweise 180 GB bei NVFP4 macht Inkling-Small zum bislang zugänglichsten Modell der Thinking-Machines-Reihe für mittlere Teams. LoRA- und vollständiges Parameter-Feintuning werden damit möglich, ohne zwingend auf sehr große Multi-Node-Cluster zurückgreifen zu müssen . Unterstützt werden BF16, MXFP8 und NVFP4 .
Inkling-Small ist über mehrere Wege erhältlich :
Die offene Lizenz erlaubt es Entwicklern und Unternehmen, die Gewichte herunterzuladen, anzupassen und in eigenen Anwendungen einzusetzen – vorbehaltlich der Bedingungen der Apache-2.0-Lizenz.
Thinking Machines Lab wurde von der früheren OpenAI-Technikchefin Mira Murati gegründet, nachdem sie OpenAI verlassen hatte. John Schulman, einer der früheren OpenAI-Mitgründer und Mitglied des RLHF-Teams, ist ebenfalls Mitgründer. Lilian Weng, die zunächst zum Gründungsteam gehörte, hat Thinking Machines Lab inzwischen verlassen und ist zu OpenAI zurückgekehrt. Damit verbleiben Mira Murati und John Schulman als die beiden derzeitigen Mitgründer des Start-ups .
Inkling-Small ist ein starkes Signal für die These, dass Modellgröße allein nicht über die praktische Leistungsfähigkeit entscheidet. Durch die Kombination aus sparsamer MoE-Architektur, On-Policy-Destillation und agentenorientiertem RL übertrifft das Modell seinen viermal größeren Lehrer bei mehreren Reasoning-, Wissenschafts- und Coding-Tests.
Der Preis dafür ist klar: Beim faktenbasierten Abruf fällt Inkling-Small deutlich zurück. Wer jedoch vor allem Coding-Agenten, Schlussfolgerungsaufgaben oder anpassbare Open-Weights-Modelle benötigt, erhält eine wesentlich leichter betreibbare Alternative. Statt rund 1,9 TB VRAM für Inkling reichen je nach Format etwa 600 GB in BF16 oder 180 GB in NVFP4 . Stand Juli 2026 ist Inkling-Small damit die pragmatischere Wahl für viele anspruchsvolle Entwicklungs- und Agentenanwendungen – auch wenn es nicht in jeder Disziplin den größeren Inkling ersetzt.