Mặc dù chỉ bằng khoảng một phần tư kích thước của người tiền nhiệm Inkling (975B tổng, 41B kích hoạt), Inkling-Small đạt hiệu suất ngang bằng hoặc vượt trội so với mô hình lớn hơn trên một số benchmark quan trọng, đồng thời yêu cầu phần cứng ít hơn đáng kể để vận hành và tinh chỉnh . Mô hình hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh và âm thanh), ngữ cảnh lên tới 1 triệu token và khả năng kiểm soát mức độ suy luận (variable thinking effort) .
Inkling-Small vượt trội so với Inkling trên ba benchmark khó nhất, nhưng lại tụt hậu về khả năng ghi nhớ sự kiện và toán học cạnh tranh .
| Benchmark | Inkling-Small | Inkling | Chênh lệch |
|---|---|---|---|
| HLE (chỉ văn bản) | 31,6% | 29,7% | +1,9 pp |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 pp |
| GPQA Diamond | 89,5% | 87,2% | +2,3 pp |
| AA Index v4.1 | 40 | 41 | –1 điểm |
| AIME 2026 | 95,5% | 97,1% | –1,6 pp |
| SimpleQA Verified | 20,6% | 43,9% | –23,3 pp |
Nguồn:
Những điểm chính:
Inkling-Small là một Transformer MoE thưa 42 tầng với 6 trong số 256 chuyên gia (experts) được kích hoạt mỗi token, cùng với 2 chuyên gia dùng chung (shared experts) . Mô hình sử dụng cơ chế attention lai (kết hợp full attention và sliding-window attention) và hỗ trợ kiểm soát mức độ suy luận, cho phép các nhà phát triển đánh đổi giữa độ trễ và độ sâu suy luận .
Kiến trúc này thuộc cùng họ MoE với Inkling nhưng có ít chuyên gia tổng thể hơn (256 so với khoảng 576 của Inkling) và ít chuyên gia kích hoạt hơn mỗi tầng. Kết quả là một mô hình hoạt động như một mô hình dày đặc 12B tham số trong suy luận nhưng vẫn giữ được năng lực của một mô hình 276B tham số trong các trọng số của nó .
Thinking Machines đã sử dụng một công thức hai giai đoạn hiện đang được nghiên cứu như một kỹ thuật hậu huấn luyện tiêu chuẩn trong ngành :
Chưng cất on-policy từ Inkling — Một checkpoint trước đó (Inkling-Small preview) được huấn luyện sử dụng Inkling làm giáo viên. Mô hình học sinh tự tạo ra các quỹ đạo (trajectories) của riêng mình trong khi giáo viên cung cấp sự giám sát dày đặc ở cấp độ token — một phương pháp được gọi là chưng cất on-policy (OPD) . Kỹ thuật này kết hợp hiệu quả mẫu của chưng cất với tính thực tế về phân phối của huấn luyện on-policy.
Hai tuần học tăng cường tập trung vào tác tử (agent-focused RL) — Nhóm nghiên cứu tiếp tục mở rộng quy mô RL về lập trình tác tử, giúp mô hình vượt qua Inkling ở các benchmark suy luận và lập trình .
Điều đáng chú ý là mô hình học sinh đã vượt qua giáo viên của nó ở một số nhiệm vụ chỉ sau hai tuần RL bổ sung — một kết quả phù hợp với các nghiên cứu gần đây về khái quát hóa từ yếu đến mạnh (weak-to-strong generalization) thông qua chưng cất on-policy .
Inkling-Small giảm đáng kể rào cản phần cứng cho các mô hình trọng số mở. Dưới đây là các cấu hình chính thức từ model card :
| Định dạng | VRAM tổng hợp | Cấu hình ví dụ |
|---|---|---|
| BF16 | ~600 GB | 4× NVIDIA B300 hoặc 8× H200 |
| NVFP4 (W4A16) | ~180 GB | 2× NVIDIA H200 |
| NVFP4 (W4A4) | ~180 GB | 1× NVIDIA B300 (yêu cầu SM100+) |
Để so sánh, checkpoint BF16 của Inkling yêu cầu ~1,9 TB VRAM tổng hợp . Phiên bản NVFP4 chính thức của Inkling yêu cầu ~600 GB .
Việc giảm VRAM 3 lần này giúp Inkling-Small trở thành mô hình đầu tiên trong dòng sản phẩm của Thinking Machines có thể tiếp cận thực tế cho việc tinh chỉnh LoRA và full-parameter bởi các đội nhóm quy mô vừa mà không cần cụm multi-node khổng lồ . Mô hình hỗ trợ các định dạng số BF16, MXFP8 và NVFP4 .
Inkling-Small có sẵn theo một số cách :
Thinking Machines Lab được thành lập bởi cựu CTO của OpenAI, Mira Murati, sau khi bà rời OpenAI vào năm 2024. John Schulman (cựu đồng sáng lập nhóm RLHF tại OpenAI) cũng là một nhà đồng sáng lập. Lilian Weng — người ban đầu là thành viên của đội ngũ sáng lập — đã rời khỏi Thinking Machines Lab và quay trở lại OpenAI. Điều này để lại Mira Murati và John Schulman là những nhà đồng sáng lập còn lại của startup này .
Inkling-Small là một tuyên bố mạnh mẽ từ Thinking Machines Lab: với công thức hậu huấn luyện phù hợp, một mô hình chỉ bằng một phần tư kích thước có thể không chỉ sánh ngang mà còn vượt qua người thầy lớn hơn của nó ở các tác vụ suy luận và lập trình tác tử. Đối với các nhà phát triển và tổ chức không đủ khả năng chạy Inkling (1,9 TB VRAM), Inkling-Small mở ra cánh cửa với chỉ 600 GB (BF16) hoặc thậm chí 180 GB (NVFP4). Sự đánh đổi là một sự sụt giảm đáng kể về khả năng ghi nhớ sự kiện, nhưng đối với các khối lượng công việc lập trình, suy luận và làm theo hướng dẫn, Inkling-Small là lựa chọn thực tế hơn trong số các mô hình trọng số mở tính đến tháng 7 năm 2026.