ZDTaichu5.0 9B คือโมเดลวิสัยทัศน์ ภาษาขนาดราว 9 พันล้านพารามิเตอร์จาก TaichuAI ใช้ตัวถอดรหัสภาษา Qwen3.5 9B ควบคู่กับตัวเข้ารหัสภาพ C RADIOv4 H จุดเด่นคือ Entropy Gated Adaptive Recurrent Reasoning ซึ่งเพิ่มการปรับแต่งใน latent space ให้เฉพาะโทเค็นที่ยากหรือมีความไม่แน่นอนสูง แทนการใช้คอมพิวต์เพิ่มเท่ากันทุกโทเค็น โ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B คือโมเดลพื้นฐานแบบมัลติโหมดที่เปิดเผยจาก TaichuAI ซึ่งตั้งเป้าไปไกลกว่าการบรรยายภาพทั่วไป โดยเน้นความเข้าใจภาพ การให้เหตุผลเชิงพื้นที่ การใช้เครื่องมือในรูปแบบเอเจนต์ และงานวิจัยด้าน embodied AI หรือ AI ที่รับรู้และวางแผนการกระทำในโลกกายภาพ 2
จุดที่น่าสนใจสำหรับนักพัฒนาและนักวิจัยคือความสามารถในการวิเคราะห์ความสัมพันธ์ของวัตถุ การเปลี่ยนมุมมอง หลักฐานจากหลายภาพ และวิดีโอที่มีบริบทยาว ไม่ใช่เพียงระบุว่าในภาพมีอะไรอยู่บ้าง 2
โมเดลนี้รวมตัวถอดรหัสภาษา Qwen3.5-9B ขนาดราว 9 พันล้านพารามิเตอร์ เข้ากับตัวเข้ารหัสภาพ C-RADIOv4-H รองรับอินพุตข้อความ ภาพเดี่ยว ภาพหลายภาพ และวิดีโอ โดยเอกสารระบุว่ารับข้อมูลภาพความละเอียดใดก็ได้ และมีหน้าต่างบริบทสูงสุด 128K โทเค็น 2
ขอบเขตการใช้งานที่ผู้พัฒนาระบุครอบคลุมเอกสาร กราฟ แผนภาพ OCR หรือการอ่านข้อความจากภาพ การตอบคำถามเกี่ยวกับภาพ และคณิตศาสตร์จากข้อมูลภาพ รวมถึงการตีความฉากโดยรวม 2
TaichuAI เน้นความสามารถด้านพื้นที่และ embodied AI ซึ่งมักเป็นโจทย์ที่โมเดลวิสัยทัศน์-ภาษาทั่วไปทำได้ยาก โดยระบุความสามารถไว้ เช่น
โมเดลยังรองรับปฏิสัมพันธ์แนวเอเจนต์ด้วย แต่ควรแยกให้ออกระหว่าง “การวางแผนเรียกใช้เครื่องมือ” กับ “การลงมือทำเอง” โมเดลสามารถช่วยวางแผนการเรียกเครื่องมือและทำงานหลายขั้นตอนหรือหลายรอบได้ ส่วนแอปพลิเคชันโฮสต์ยังต้องเป็นผู้เรียกใช้ ตรวจสอบความถูกต้อง และรักษาความปลอดภัยของเครื่องมือเหล่านั้น 2
ข้อเสนอทางเทคนิคหลักของ ZDTaichu5.0-9B คือ Entropy-Gated Adaptive Recurrent Reasoning กล่าวคือ แทนที่จะเพิ่มการประมวลผลเพื่อการให้เหตุผลเท่า ๆ กันในทุกโทเค็น ระบบจะใช้ระดับความไม่แน่นอนเพื่อพิจารณาว่าจุดใดควรได้รับการปรับแต่งซ้ำเพิ่มเติมใน latent space 2
อธิบายแบบง่าย ๆ คือ ขั้นตอนที่ตอบได้ตรงไปตรงมาสามารถเดินหน้าต่อได้ตามปกติ แต่การคาดการณ์ที่กำกวมหรือยากจะได้รับการกลั่นกรองภายในเพิ่มอีกระดับ เป้าหมายคือเพิ่มความลึกของการคำนวณในจุดที่เป็นโจทย์หนัก โดยไม่ต้องเพิ่มภาระการคำนวณให้ทั้งคำตอบอย่างสม่ำเสมอ 2
แนวทางนี้เหมาะกับคำถามเชิงพื้นที่เป็นพิเศษ เพราะความกำกวมเพียงจุดเดียว เช่น กล้องเปลี่ยนมุม หรือวัตถุชิ้นหนึ่งอยู่สัมพันธ์กับอีกชิ้นอย่างไร อาจทำให้ข้อสรุปสุดท้ายผิดไปทั้งหมดได้
เอกสารของ TaichuAI รายงานผลดังนี้
| หมวดประเมิน | เบนช์มาร์ก | คะแนนที่รายงาน |
|---|---|---|
| เชิงพื้นที่ / embodied | ViewSpatial | 62.50 |
| เชิงพื้นที่ / embodied | MMSI-Bench | 47.20 |
| เชิงพื้นที่ / embodied | MindCube-tiny | 78.27 |
| เชิงพื้นที่ / embodied | ERQA | 48.00 |
| เชิงพื้นที่ / embodied | RoboSpatial | 56.00 |
| เอเจนต์ / ทำตามคำสั่ง | TAU2-Bench | 87.70 |
| เอเจนต์ / ทำตามคำสั่ง | Claw-Eval | 71.40 |
| เอเจนต์ / ทำตามคำสั่ง | IFEval | 93.70 |
โครงการวางตำแหน่งโมเดลนี้ว่าเด่นด้านการให้เหตุผลเชิงพื้นที่และ embodied reasoning เมื่อเทียบกับโมเดล VLM อเนกประสงค์ขนาดราว 10B ที่อยู่ในการเปรียบเทียบของตน ขณะเดียวกันยังรักษาความสามารถด้านภาพทั่วไปไว้ในระดับสูง 2
อย่างไรก็ดี นี่ไม่ใช่อันดับสากล ผลเปรียบเทียบดังกล่าวขึ้นอยู่กับรุ่นโมเดล พรอมป์ต์ การเตรียมข้อมูล การตั้งค่าการถอดรหัส และรูปแบบการประเมินที่ผู้พัฒนาเลือกใช้ จึงควรมีการทำซ้ำโดยหน่วยงานอิสระ พร้อมเปิดเผยรายละเอียดเหล่านี้ ก่อนสรุปว่าเป็นผลเปรียบเทียบที่ยืนยันแล้ว 2
ZDTaichu5.0-9B เปิดให้ใช้งานผ่านคลัง Hugging Face ของ TaichuAI โดยรุ่นที่เผยแพร่ระบุว่าเป็นโมเดลที่ใช้โค้ดเฉพาะ และลิงก์ไปยังเอกสารเกี่ยวกับ recurrent reasoning และการติดตั้งใช้งาน 2
เงื่อนไขสิทธิ์ที่ระบุสำหรับวัสดุโมเดลที่เผยแพร่คือ NVIDIA Open Model License ขณะที่ส่วนประกอบของ Qwen3.5 มีประกาศสิทธิ์แบบ Apache-2.0 ทีมที่ต้องการเผยแพร่ต่อหรือใช้เชิงพาณิชย์ควรตรวจสอบไฟล์ใบอนุญาตและประกาศล่าสุดในคลังโครงการโดยตรง 2
ด้านการเสิร์ฟโมเดล TaichuAI มีเอกสารสำหรับ vLLM 0.26.0 แบบปรับแต่งและ Docker รวมถึงพรีเซ็ตการสุ่มตัวอย่างที่แยกสำหรับงานระบุตำแหน่งเชิงพื้นที่ และงานทั่วไป 2
ZDTaichu5.0-9B เป็นโมเดลมัลติโหมดแบบเปิดขนาดราว 9B ที่มีจุดยืนชัดเจน: ไม่ได้มุ่งแค่รู้จำเนื้อหาในภาพ แต่ต้องการให้เหตุผลข้ามภาพ มุมมอง ฉาก และวิดีโอได้ด้วย หน้าต่างบริบท 128K อินพุตภาพที่ไม่จำกัดความละเอียด และแนวคิด recurrent reasoning แบบปรับตามความไม่แน่นอน ทำให้เป็นตัวเลือกที่น่าจับตาสำหรับผู้ที่ทำงานกับ VLM เชิงพื้นที่, embodied AI และเวิร์กโฟลว์เอเจนต์ที่มีแอปพลิเคชันโฮสต์คุมการใช้เครื่องมือ 2
ผลทดสอบที่เผยแพร่มีสัญญาณเชิงบวก โดยเฉพาะในเบนช์มาร์กเชิงพื้นที่ แต่ควรมองว่าเป็นหลักฐานจากผู้พัฒนา ไม่ใช่ข้อยืนยันอิสระ จนกว่าจะมีบุคคลที่สามทดสอบซ้ำภายใต้เงื่อนไขที่โปร่งใส 2
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ZDTaichu5.0 9B คือโมเดลวิสัยทัศน์ ภาษาขนาดราว 9 พันล้านพารามิเตอร์จาก TaichuAI ใช้ตัวถอดรหัสภาษา Qwen3.5 9B ควบคู่กับตัวเข้ารหัสภาพ C RADIOv4 H
ZDTaichu5.0 9B คือโมเดลวิสัยทัศน์ ภาษาขนาดราว 9 พันล้านพารามิเตอร์จาก TaichuAI ใช้ตัวถอดรหัสภาษา Qwen3.5 9B ควบคู่กับตัวเข้ารหัสภาพ C RADIOv4 H จุดเด่นคือ Entropy Gated Adaptive Recurrent Reasoning ซึ่งเพิ่มการปรับแต่งใน latent space ให้เฉพาะโทเค็นที่ยากหรือมีความไม่แน่นอนสูง แทนการใช้คอมพิวต์เพิ่มเท่ากันทุกโทเค็น
โมเดลและเอกสารการติดตั้งเผยแพร่ผ่าน Hugging Face โดยมีแนวทางเสิร์ฟด้วย vLLM 0.26.0 แบบปรับแต่งและ Docker แต่ผลเบนช์มาร์กที่เผยแพร่ยังเป็นข้อมูลจากผู้พัฒนาและควรรอการทดสอบยืนยันโดยอิสระ