Ling 3.0 flash มีพารามิเตอร์รวม 124B แต่เปิดใช้ราว 5.1B ต่อโทเค็น จึงเป็นตัวอย่างว่าความจุของโมเดลขนาดใหญ่กับต้นทุนคำนวณต่อการตอบหนึ่งครั้งอาจแยกออกจากกันได้ หน้าต่างบริบทแบบเนทีฟ 256K โทเค็น ซึ่งขยายได้ถึง 1M โทเค็น และการเน้นงานเขียนโค้ด เรียกใช้เครื่องมือ และเอเจนต์ ทำให้โมเดลนี้เหมาะกับการทดสอบในเวิร์กโฟลว์ที่มี...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Ling-3.0-flash ของ Ant Group สะท้อนการเปลี่ยนโจทย์สำคัญของการนำ AI ไปใช้งานจริง โดยเฉพาะงานเขียนโค้ด การเรียกใช้เครื่องมือ และขั้นตอนเวิร์กโฟลว์ที่เกิดซ้ำบ่อย คำถามอาจไม่ใช่เพียง “โมเดลไหนมีพารามิเตอร์มากที่สุด” แต่เป็น “โมเดลไหนทำงานได้ดีพอภายใต้ความหน่วงและต้นทุนอินเฟอเรนซ์ที่ต่ำที่สุด”
โมเดลนี้มีพารามิเตอร์รวม 124B แต่เปิดใช้จริงประมาณ 5.1B พารามิเตอร์ต่อโทเค็น Ant วางตำแหน่งให้เป็นโมเดล hybrid reasoning ที่เน้นความคุ้มค่าสำหรับงานความถี่สูง พร้อมหน้าต่างบริบทแบบเนทีฟ 256K โทเค็น และขยายได้ถึง 1M โทเค็น
Ling-3.0-flash ใช้แนวทาง mixture-of-experts (MoE) หรือการรวม “ผู้เชี่ยวชาญ” หลายชุด แทนที่จะให้พารามิเตอร์ทั้งหมดทำงานกับทุกโทเค็น ระบบจะเลือกส่งงานไปยังผู้เชี่ยวชาญเพียงบางส่วน ทำให้โมเดลเก็บความรู้และความสามารถไว้ในชุดพารามิเตอร์ขนาดใหญ่ได้ แต่ใช้ทรัพยากรจริงต่อการสร้างคำตอบน้อยกว่าอย่างมาก
Ant ระบุว่า Ling-3.0-flash มีจำนวนพารามิเตอร์รวมราว 12.4% และจำนวนพารามิเตอร์ที่เปิดใช้ราว 8.1% ของโมเดล Ring-2.6-1T ระดับ 1T ของบริษัท เอกสารเปิดตัวยังอธิบายถึงสถาปัตยกรรม hybrid linear attention ที่สลับเลเยอร์ KDA และ MLA ร่วมกับการจัดเส้นทางแบบ sparse MoE
ไม่ได้หมายความว่าจำนวนพารามิเตอร์รวมไม่มีความสำคัญ เพราะยังส่งผลต่อขอบเขตความสามารถที่โมเดลเรียนรู้ได้ และคุณภาพของการเลือกผู้เชี่ยวชาญก็เป็นตัวตัดสินว่า MoE จะทำศักยภาพนั้นออกมาได้มากแค่ไหน อย่างไรก็ดี การเปิดใช้แบบ sparse เปลี่ยนสมการด้านต้นทุน: ความเร็วและค่าเสิร์ฟโมเดลสัมพันธ์กับพารามิเตอร์และการคำนวณ attention ที่ใช้จริงต่อโทเค็น มากกว่าขนาดรวมของพารามิเตอร์ที่เก็บอยู่ทั้งหมด
Ant ระบุว่า Ling-3.0-flash ทำผลงานเทียบเท่าหรือดีกว่า Ring-2.6-1T ในการเปรียบเทียบส่วนใหญ่ที่บริษัทเผยแพร่ ขณะที่บัญชี Ling ของ Ant บน X ระบุว่าโมเดลทำได้เท่าหรือดีกว่าเรือธง 1T ในเบนช์มาร์กส่วนใหญ่ แม้มีพารามิเตอร์รวมประมาณหนึ่งในแปด และพารามิเตอร์ที่เปิดใช้ประมาณหนึ่งในสิบสองของโมเดลดังกล่าว
นี่เป็นการเปรียบเทียบภายในที่น่าสนใจ โดยเฉพาะเมื่อโมเดลถูกออกแบบมาสำหรับเวิร์กโหลดเอเจนต์ในระบบผลิตจริง แต่ยัง ไม่ใช่ หลักฐานว่า Ling-3.0-flash ดีกว่าโมเดลทั่วไปขนาดใหญ่ทุกตัวในทุกงาน
ข้อควรระวังหลักมีดังนี้
สำหรับทีมที่กำลังพิจารณาใช้โมเดล วิธีทดสอบที่เหมาะสมที่สุดคือใช้เวิร์กโหลดตัวแทนของงานจริง ทั้งสคีมาของเครื่องมือ บริบทจากรีโพซิทอรี ข้อกำหนดด้านความหน่วง พฤติกรรมการลองใหม่ และต้นทุนเมื่อระบบทำผิดพลาด
โมเดลการ์ดระบุการประเมิน เช่น SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas และ SkillsBench รวมถึงการใช้งานร่วมกับสภาพแวดล้อมสำหรับเอเจนต์อย่าง Claude Code, Kilo Code, Qwen Code, Hermes Agent และ OpenClaw 1
งานเหล่านี้สำคัญเพราะระบบเอเจนต์สามารถใช้โทเค็นจำนวนมหาศาล เวิร์กโฟลว์หนึ่งอาจต้องอ่านไฟล์ เรียกเครื่องมือ รับผลลัพธ์ ปรับแผน และลองทำใหม่หลายรอบ จึงใช้โทเค็นมากกว่าการสนทนาหนึ่งครั้งมาก ในบริบทเช่นนี้ โมเดลราคาต่ำที่ทำขั้นตอนปฏิบัติการทั่วไปได้อย่างเชื่อถือ อาจมีคุณค่ากว่าโมเดลอเนกประสงค์ที่แพงกว่าหากต้องใช้กับทุกเทิร์น
แนวทางที่สมเหตุสมผลจึงเป็นระบบแบบแบ่งชั้น:
Ant ระบุหน้าต่างบริบทแบบเนทีฟ 256K โทเค็น และสามารถขยายเป็น 1M โทเค็น ซึ่งเป็นประโยชน์ต่อโค้ดเบสขนาดใหญ่ บันทึกการเรียกเครื่องมือที่ยาว หรือสถานะการทำงานที่ต้องเก็บต่อเนื่อง
OpenRouter ระบุหน้าต่างบริบทที่ให้บริการอยู่ที่ 262,144 โทเค็น 6
อย่างไรก็ตาม บริบทยาวเพียงอย่างเดียวไม่ควรถูกตีความว่าเป็นความสามารถ multi-agent ที่ผ่านการพิสูจน์แล้ว แม้จะช่วยเก็บข้อมูลร่วมกันในเวิร์กโฟลว์ได้ง่ายขึ้น แต่ระบบ multi-agent ที่เชื่อถือได้ยังขึ้นอยู่กับการประสานงาน การออกแบบหน่วยความจำ สิทธิ์ในการใช้เครื่องมือ การส่งต่องาน และการประเมินผล แหล่งข้อมูลที่มีสนับสนุนสเปกบริบทยาวและการวางตำแหน่งด้านเอเจนต์ แต่ไม่ได้ยืนยันเชิงปริมาณว่าโมเดลเหนือกว่าคู่แข่งในการใช้งาน multi-agent
Ling-3.0-flash เปิดตัวเมื่อวันที่ 24 กรกฎาคม 2026 โดย Ant เปิดให้ใช้ API ฟรีแบบจำกัดเวลาบน OpenRouter และแพลตฟอร์มของ Ant ถึงวันที่ 3 สิงหาคม ตามโพสต์เปิดตัวของบริษัท โมเดลยังมีให้ใช้งานบน Hugging Face ซึ่งโครงการระบุถึงจุดเน้นด้านเบนช์มาร์กและเฟรมเวิร์กเอเจนต์ 1
บน OpenRouter ราคาที่ระบุคือ 0.021 ดอลลาร์ต่อ 1 ล้านโทเค็นขาเข้า และ 0.063 ดอลลาร์ต่อ 1 ล้านโทเค็นขาออก พร้อมบริบท 262,144 โทเค็น 6 ตัวเลขนี้ทำให้การทดลองกับเวิร์กโฟลว์ปริมาณสูงทำได้จริงมากขึ้น แม้ต้นทุนจริง ความหน่วง ความพร้อมใช้งาน และคุณภาพผลลัพธ์อาจต่างกันไปตามผู้ให้บริการและเงื่อนไขการติดตั้ง
หน้าค้นหาโมเดลของ OpenRouter แสดงเปอร์เซ็นไทล์แยกด้าน intelligence, coding และ agentic ที่ 49, 56 และ 54 ตามลำดับ ยิ่งตอกย้ำว่าอันดับเดียวไม่เพียงพอสำหรับประเมินโมเดลที่มุ่งเน้นงานปฏิบัติการ 12
การเปิดตัวเกิดขึ้นในช่วงเดียวกับโพสต์แรกบน X ของ Jensen Huang ซีอีโอ Nvidia ซึ่งเขาแชร์จดหมายที่เสนอว่าโมเดลแบบเปิดช่วยเสริมความปลอดภัยและไซเบอร์ซีเคียวริตี้ เร่งนวัตกรรมและการเผยแพร่เทคโนโลยี และสนับสนุนอธิปไตยทางเทคโนโลยีควบคู่กับโมเดลปิดระดับแนวหน้า
จังหวะดังกล่าวทำให้ Ling-3.0-flash เป็นตัวอย่างที่เข้ากับการถกเถียงเรื่อง AI แบบ open-weight: นักพัฒนาสามารถตรวจสอบ โฮสต์ ปรับแต่ง และผสานโมเดลได้โดยตรงมากขึ้นเมื่อเข้าถึงน้ำหนักโมเดลได้ แต่เหตุการณ์ทั้งสองไม่ได้ยืนยันว่ามีความร่วมมือหรือความเชื่อมโยงทางเทคนิคร่วมกันระหว่าง Nvidia กับ Ant Group
จุดเด่นที่สุดของ Ling-3.0-flash คือการเป็นหลักฐานเชิงปฏิบัติของกลยุทธ์ โมเดลสำหรับงานปฏิบัติการที่คำนึงถึงต้นทุน Sparse MoE สามารถจับคู่ความจุที่เก็บไว้ในโมเดลขนาดใหญ่กับการเปิดใช้พารามิเตอร์ต่อโทเค็นที่เล็กกว่ามาก ซึ่งอาจทำให้ลูปการทำงานของเอเจนต์ที่เกิดบ่อยมีต้นทุนต่ำลงและตอบสนองเร็วขึ้น โดยไม่ต้องยอมรับข้อจำกัดของโมเดลขนาดเล็กมาก
คำกล่าวอ้างด้านประสิทธิภาพยังควรได้รับการทดสอบซ้ำโดยอิสระ และไม่ควรมองว่าเป็นตัวแทนทดแทนโมเดลอเนกประสงค์ขนาดใหญ่ในทุกกรณี แต่ด้วยสเปกที่เน้นเอเจนต์ บริบทยาว และราคา API ที่ระบุไว้ต่ำ Ling-3.0-flash เป็นโมเดลที่น่าทดลองอย่างยิ่งในงานที่ต้นทุนอินเฟอเรนซ์และความหน่วงเป็นข้อจำกัดหลัก 1
6
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Ling 3.0 flash มีพารามิเตอร์รวม 124B แต่เปิดใช้ราว 5.1B ต่อโทเค็น จึงเป็นตัวอย่างว่าความจุของโมเดลขนาดใหญ่กับต้นทุนคำนวณต่อการตอบหนึ่งครั้งอาจแยกออกจากกันได้
Ling 3.0 flash มีพารามิเตอร์รวม 124B แต่เปิดใช้ราว 5.1B ต่อโทเค็น จึงเป็นตัวอย่างว่าความจุของโมเดลขนาดใหญ่กับต้นทุนคำนวณต่อการตอบหนึ่งครั้งอาจแยกออกจากกันได้ หน้าต่างบริบทแบบเนทีฟ 256K โทเค็น ซึ่งขยายได้ถึง 1M โทเค็น และการเน้นงานเขียนโค้ด เรียกใช้เครื่องมือ และเอเจนต์ ทำให้โมเดลนี้เหมาะกับการทดสอบในเวิร์กโฟลว์ที่มีปริมาณโทเค็นสูง
ผลเปรียบเทียบกับโมเดล 1T ของ Ant เป็นผลที่ผู้พัฒนาเผยแพร่เอง จึงควรประเมินด้วยงานจริงของแต่ละทีม ไม่ควรตีความว่าเหนือกว่าโมเดลขนาดใหญ่ทุกตัวในทุกโจทย์