คำตอบการวิจัย
ประเด็นสำคัญ Inkling Small เปิดตัวเมื่อวันที่ 30 กรกฎาคม 2026 เป็นโมเดล Mixture of Experts ขนาด 276B พารามิเตอร์ แต่เปิดใช้งานเพียง 12B ต่อโทเคน และใช้ไลเซนส์ Apache 2.0 โมเดลทำคะแนนเหนือกว่า Inkling รุ่นใหญ่ใน Humanity’s Last Exam, SWE Bench Verified และ GPQA Diamond แต่ยังตามหลังอย่างมากใน SimpleQA Verified ซึ่งวัดการเรียกคืนข้อเท็จจริง สูตรฝึกสองขั้นตอนประกอบด้วยการกลั่นแบบ on policy จาก Inkling ตามด้วยการทำ reinforcement learning ที่เน้นงานเอเจนต์และการเขียนโค้ดอีกสองสัปดาห์ ความต้องการ VRAM ลดลงจากราว 1.9TB ของ Inkling รุ่น BF16 เหลือประมาณ 600GB ใน Inkling Small รุ่น BF16 หรือ 180GB เมื่อใช้ NVFP4 What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa Inkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM. AI พรอมต์ Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com Inkling-Small คืออะไร
Inkling-Small คือโมเดล Transformer แบบ Sparse Mixture-of-Experts (MoE) จาก Thinking Machines Lab เปิดตัวเมื่อวันที่ 30 กรกฎาคม 2026 ภายใต้ไลเซนส์ Apache 2.0 ซึ่งเป็นไลเซนส์แบบเปิดที่อนุญาตให้นักพัฒนาดาวน์โหลด นำไปปรับแต่ง และใช้งานต่อได้ค่อนข้างยืดหยุ่น
โมเดลมีพารามิเตอร์ทั้งหมด 276 พันล้านพารามิเตอร์ (276B) แต่เปิดใช้งานเพียงประมาณ 12B ต่อโทเคน แนวทางนี้ทำให้โมเดลยังคงความจุของน้ำหนักจำนวนมากไว้ ขณะเดียวกันก็ไม่ต้องใช้พลังประมวลผลเต็มขนาดของโมเดลทั้งหมดในทุกครั้งที่ประมวลผล
คนยังถาม คำตอบสั้น ๆ สำหรับ "Inkling-Small: โมเดล MoE ขนาด 276B ที่ใช้ทรัพยากรน้อยกว่า แต่แซงหน้า Inkling รุ่นใหญ่" คืออะไร Inkling Small เปิดตัวเมื่อวันที่ 30 กรกฎาคม 2026 เป็นโมเดล Mixture of Experts ขนาด 276B พารามิเตอร์ แต่เปิดใช้งานเพียง 12B ต่อโทเคน และใช้ไลเซนส์ Apache 2.0
ประเด็นสำคัญที่ต้องตรวจสอบก่อนคืออะไร? Inkling Small เปิดตัวเมื่อวันที่ 30 กรกฎาคม 2026 เป็นโมเดล Mixture of Experts ขนาด 276B พารามิเตอร์ แต่เปิดใช้งานเพียง 12B ต่อโทเคน และใช้ไลเซนส์ Apache 2.0 โมเดลทำคะแนนเหนือกว่า Inkling รุ่นใหญ่ใน Humanity’s Last Exam, SWE Bench Verified และ GPQA Diamond แต่ยังตามหลังอย่างมากใน SimpleQA Verified ซึ่งวัดการเรียกคืนข้อเท็จจริง
ฉันควรทำอย่างไรต่อไปในทางปฏิบัติ? สูตรฝึกสองขั้นตอนประกอบด้วยการกลั่นแบบ on policy จาก Inkling ตามด้วยการทำ reinforcement learning ที่เน้นงานเอเจนต์และการเขียนโค้ดอีกสองสัปดาห์
แม้มีขนาดรวมราวหนึ่งในสี่ของ Inkling รุ่นก่อนหน้า ซึ่งมี 975B พารามิเตอร์และเปิดใช้งาน 41B ต่อโทเคน แต่ Inkling-Small กลับทำคะแนนได้เทียบเท่าหรือสูงกว่าในหลายการทดสอบสำคัญ พร้อมลดภาระด้านฮาร์ดแวร์สำหรับการรันและการปรับแต่งโมเดลลงอย่างมาก
Inkling-Small รองรับอินพุตทั้ง ข้อความ ภาพ และเสียง มีหน้าต่างบริบทสูงสุด 1 ล้านโทเคน และเปิดให้ผู้พัฒนาควบคุมระดับความพยายามในการคิด เพื่อแลกเปลี่ยนระหว่างความลึกของการให้เหตุผลกับเวลาในการตอบสนอง
ผลทดสอบ: รุ่นเล็กชนะในงานคิดและเขียนโค้ด แต่ไม่ใช่ทุกด้าน จุดเด่นของ Inkling-Small ไม่ได้อยู่ที่การชนะทุกการทดสอบ แต่คือการแสดงให้เห็นว่าโมเดลที่เล็กกว่ามากสามารถแซงหน้ารุ่นใหญ่ได้ในงานที่ต้องใช้การให้เหตุผลและการทำงานแบบเอเจนต์
การทดสอบ Inkling-Small Inkling ผลต่าง HLE (ข้อความเท่านั้น) 31.6% 29.7% +1.9 จุดเปอร์เซ็นต์ SWE-Bench Verified 80.2% 77.6% +2.6 จุดเปอร์เซ็นต์ GPQA Diamond 89.5% 87.2% +2.3 จุดเปอร์เซ็นต์ Artificial Analysis Intelligence Index v4.1 40 41 -1 คะแนน AIME 2026 95.5% 97.1% -1.6 จุดเปอร์เซ็นต์ SimpleQA Verified 20.6% 43.9% -23.3 จุดเปอร์เซ็นต์
จุดที่ Inkling-Small ทำได้ดีกว่า
การให้เหตุผล: ใน Humanity’s Last Exam หรือ HLE แบบข้อความเท่านั้น Inkling-Small ได้ 31.6% เทียบกับ 29.7% ของ Inkling และยังรักษาความได้เปรียบไว้ได้ในทุกระดับงบประมาณการคิดที่ทดสอบ
การเขียนโค้ดโดยเอเจนต์: SWE-Bench Verified ซึ่งทดสอบการแก้ปัญหาในโค้ดจากคลังซอฟต์แวร์จริง ได้ 80.2% เทียบกับ 77.6% ของ Inkling โดยการประเมินใช้ชุดทดสอบแบบ Bash-only และเส้นทางการทำงานยาว 256K โทเคน
ความรู้วิทยาศาสตร์ระดับผู้เชี่ยวชาญ: GPQA Diamond อยู่ที่ 89.5% สูงกว่า Inkling ซึ่งได้ 87.2%
ดัชนีจาก第三ฝ่าย: Artificial Analysis Intelligence Index v4.1 ให้ Inkling-Small ได้ 40 คะแนน ตามหลัง Inkling เพียง 1 คะแนน
จุดที่ยังเสียเปรียบ ข้อแลกเปลี่ยนสำคัญคือ ความแม่นยำในการเรียกคืนข้อเท็จจริง โดย Inkling-Small ได้เพียง 20.6% ใน SimpleQA Verified ขณะที่ Inkling ได้ 43.9% ผลดังกล่าวสะท้อนแนวทางการฝึกที่ให้น้ำหนักกับการให้เหตุผลและการทำงานเชิงเอเจนต์มากกว่าการจดจำข้อเท็จจริงโดยตรง
โมเดลรุ่นเล็กยังตามหลังใน AIME 2026 ซึ่งเป็นการทดสอบคณิตศาสตร์แข่งขัน โดยได้ 95.5% เทียบกับ 97.1% ของ Inkling ดังนั้น Inkling-Small จึงอาจเหมาะกับงานเขียนโค้ดและการแก้ปัญหาแบบหลายขั้นตอนมากกว่าโจทย์ที่ต้องอาศัยการเรียกคืนความรู้ที่แม่นยำเป็นหลัก
เบื้องหลังสถาปัตยกรรม 276B แต่เปิดใช้งานเพียง 12B Inkling-Small เป็นโมเดล MoE แบบกระจายบาง มีทั้งหมด 42 เลเยอร์ และเลือกใช้ 6 จาก 256 experts ต่อโทเคน พร้อม experts ที่ใช้ร่วมกันอีก 2 ชุด
พูดง่าย ๆ คือ โมเดลมี “ความเชี่ยวชาญ” จำนวนมากเก็บอยู่ในน้ำหนักทั้งหมด แต่ในแต่ละคำถาม ระบบจะเลือกใช้เฉพาะกลุ่ม experts ที่เหมาะกับโทเคนนั้น ไม่ได้เปิดใช้งานพารามิเตอร์ทั้ง 276B ทุกครั้ง
สถาปัตยกรรมยังอยู่ในตระกูลเดียวกับ Inkling แต่มีจำนวน experts รวมลดลงจากประมาณ 576 เหลือ 256 และเปิดใช้งาน experts ต่อเลเยอร์น้อยกว่า ผลลัพธ์คือในช่วงการอนุมาน โมเดลใช้ทรัพยากรใกล้เคียงกับโมเดลแบบหนาแน่นขนาด 12B แต่ยังรักษาความจุโดยรวมจากน้ำหนัก 276B เอาไว้
ระบบยังใช้ attention แบบผสมระหว่าง full attention และ sliding-window attention รวมถึงรองรับการควบคุมระดับความพยายามในการคิด นักพัฒนาจึงสามารถเลือกระหว่างการตอบเร็วขึ้นกับการใช้เวลาประมวลผลเพื่อการให้เหตุผลที่ลึกขึ้น
สูตรฝึกสองขั้นตอนที่ทำให้รุ่นเล็กแซงรุ่นครูได้
การกลั่นแบบ on-policy จาก Inkling — ในช่วงแรก โมเดลนักเรียนจะสร้างเส้นทางการแก้ปัญหาด้วยตัวเอง ขณะที่ Inkling ซึ่งทำหน้าที่เป็นโมเดลครูจะให้คำแนะนำแบบละเอียดในระดับโทเคน วิธีนี้เรียกว่า on-policy distillation เพราะนักเรียนได้ฝึกจากเส้นทางที่ตัวเองสร้างขึ้นจริง แทนที่จะเลียนแบบคำตอบสำเร็จรูปจากครูเพียงอย่างเดียว
การทำ reinforcement learning ที่เน้นเอเจนต์อีกสองสัปดาห์ — ทีมยังฝึกต่อด้วย RL สำหรับงานเอเจนต์ โดยเฉพาะงานเขียนโค้ดและการใช้เครื่องมือ ส่งผลให้ Inkling-Small แซงหน้า Inkling ในการทดสอบด้านการให้เหตุผลและการเขียนโค้ดหลายรายการ
ผลลัพธ์นี้น่าสนใจเพราะโมเดลนักเรียนสามารถทำได้ดีกว่าโมเดลครูในบางงาน หลังผ่าน RL เพิ่มเติมเพียงสองสัปดาห์ แนวทางดังกล่าวสอดคล้องกับงานวิจัยช่วงหลังเกี่ยวกับการถ่ายทอดความสามารถจากโมเดลที่อ่อนกว่าไปยังโมเดลที่แข็งแรงกว่า ผ่านการกลั่นแบบ on-policy
ฮาร์ดแวร์: ลดความต้องการ VRAM ลงประมาณ 3 เท่า Inkling-Small ลดข้อจำกัดด้านฮาร์ดแวร์ลงอย่างเห็นได้ชัดเมื่อเทียบกับ Inkling รุ่นใหญ่ โดยการ์ดโมเดลระบุข้อกำหนดโดยประมาณไว้ดังนี้
รูปแบบตัวเลข VRAM รวมที่ต้องใช้ ตัวอย่างการจัดเครื่อง BF16 ประมาณ 600GB NVIDIA B300 จำนวน 4 ใบ หรือ H200 จำนวน 8 ใบ NVFP4 (W4A16) ประมาณ 180GB NVIDIA H200 จำนวน 2 ใบ NVFP4 (W4A4) ประมาณ 180GB NVIDIA B300 จำนวน 1 ใบ โดยต้องใช้สถาปัตยกรรม SM100 ขึ้นไป
เพื่อเปรียบเทียบ จุดตรวจสอบ BF16 ของ Inkling ต้องใช้ VRAM รวมประมาณ 1.9TB ขณะที่รุ่น Inkling-Small ใช้ประมาณ 600GB ในโหมด BF16 หรือ 180GB ในโหมด NVFP4 ซึ่งเป็นการลดลงราว 3 เท่า
ผลต่อการปรับแต่งโมเดล
Full-parameter fine-tuning แบบ BF16: ต้องใช้คลัสเตอร์ 4× B300 หรือ 8× H200 แม้ยังเป็นการลงทุนระดับสูง แต่เริ่มอยู่ในขอบเขตที่บริษัทสตาร์ตอัปที่มีเงินทุนและห้องปฏิบัติการมหาวิทยาลัยขนาดกลางอาจจัดหาได้
LoRA fine-tuning แบบ NVFP4: ใช้ H200 จำนวน 2 ใบตามการกำหนดค่าทางการ ช่วยลดอุปสรรคในการปรับแต่งโมเดลสำหรับงานเฉพาะทาง
การอนุมานแบบ NVFP4: โหมด W4A4 สามารถทำงานบน B300 จำนวน 1 ใบได้ โดยต้องเป็นฮาร์ดแวร์ที่รองรับ SM100 ขึ้นไป
ทั้งนี้ “เปิดน้ำหนัก” ไม่ได้หมายความว่าโมเดลจะรันได้บนคอมพิวเตอร์ทั่วไป เพราะข้อกำหนดขั้นต่ำยังอยู่ในระดับ GPU ดาต้าเซ็นเตอร์ แต่เมื่อเทียบกับ Inkling รุ่นใหญ่ Inkling-Small ทำให้การทดลองและการปรับแต่งโดยทีมขนาดกลางเป็นไปได้จริงมากขึ้น
การเปิดให้ใช้งานและค่าใช้บริการ Inkling-Small เปิดให้เข้าถึงได้หลายช่องทาง
น้ำหนักโมเดลเต็ม: ดาวน์โหลดได้ผ่าน Hugging Face ภายใต้ไลเซนส์ Apache 2.0
Tinker Playground: ทดลองสนทนาด้วยข้อความ ภาพ และเสียง
Tinker API: ใช้สำหรับปรับแต่งโมเดลด้วย LoRA โดยราคาผลลัพธ์อยู่ที่ 1.20 ดอลลาร์สหรัฐต่อ 1 ล้านโทเคน
การ fine-tuning บน Tinker: รองรับการปรับแต่งโมเดลผ่านแพลตฟอร์ม Tinker
บริบทผู้ก่อตั้ง Thinking Machines Lab Thinking Machines Lab ก่อตั้งโดย Mira Murati อดีตประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ OpenAI หลังเธอออกจากบริษัทในปี 2024 ส่วน John Schulman อดีตผู้ร่วมก่อตั้ง OpenAI และหนึ่งในผู้บุกเบิกทีม RLHF ก็เป็นผู้ร่วมก่อตั้งบริษัทด้วย
Lilian Weng ซึ่งเคยอยู่ในทีมผู้ก่อตั้งช่วงแรก ได้ออกจาก Thinking Machines Lab และกลับไปทำงานที่ OpenAI ทำให้ Mira Murati และ John Schulman เป็นผู้ร่วมก่อตั้งที่ยังอยู่กับสตาร์ตอัปแห่งนี้
สรุป: เล็กกว่าไม่ได้แปลว่าอ่อนกว่าเสมอไป Inkling-Small เป็นการสาธิตที่ชัดเจนว่า ขนาดพารามิเตอร์รวมไม่ใช่ตัวชี้วัดความสามารถเพียงอย่างเดียว ด้วยการออกแบบ MoE และสูตร post-training ที่เหมาะสม โมเดล 276B พารามิเตอร์ซึ่งเปิดใช้งานเพียง 12B ต่อโทเคน สามารถทำได้ดีกว่า Inkling รุ่น 975B ในการให้เหตุผล การเขียนโค้ด และการตอบคำถามวิทยาศาสตร์บางประเภท
จุดแข็งของมันคือการลดข้อกำหนดด้านฮาร์ดแวร์จากประมาณ 1.9TB VRAM ใน Inkling รุ่น BF16 เหลือ 600GB ใน Inkling-Small รุ่น BF16 หรือ 180GB เมื่อใช้ NVFP4 ทำให้เหมาะกับทีมที่ต้องการสร้างเอเจนต์เขียนโค้ด ปรับแต่งโมเดลสำหรับงานเฉพาะ และทดลองระบบ AI แบบเปิดน้ำหนัก
อย่างไรก็ตาม ผู้ใช้ควรคำนึงถึงข้อแลกเปลี่ยนด้าน factual recall ด้วย เพราะ Inkling-Small ทำคะแนน SimpleQA Verified ต่ำกว่า Inkling อย่างมาก ดังนั้น ณ เดือนกรกฎาคม 2026 Inkling-Small จึงเป็นตัวเลือกที่ใช้งานได้จริงกว่าในงานให้เหตุผลและเขียนโค้ด แต่ไม่ได้แทนที่ Inkling รุ่นใหญ่ในทุกประเภทงาน
x.com Post