ZDTaichu5.0 9B เป็นโมเดลภาษาที่เข้าใจภาพขนาดราว 9 พันล้านพารามิเตอร์ เปิดให้ดาวน์โหลดเพื่อวิจัยการเข้าใจความสัมพันธ์เชิงพื้นที่และ AI ที่โต้ตอบกับสภาพแวดล้อมจริง โดยระบุว่ารองรับบริบทสูงสุด 128K โทเค็น [2] โมเดลรับข้อความ ภาพหนึ่งภาพหรือหลายภาพ และวิดีโอ มีรุ่น FP8 และ NVFP4 รวมถึงแนวทางติดตั้งผ่าน vLLM ที่ TaichuAI...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
หากกำลังพัฒนาระบบที่ต้องดูภาพแล้วตอบว่า «วัตถุชิ้นไหนอยู่ตรงไหน» หรือ «เมื่อเปลี่ยนมุมกล้อง ความสัมพันธ์ของวัตถุเปลี่ยนไปอย่างไร» ZDTaichu5.0-9B เป็นโมเดลที่นำไปทดลองต่อได้ TaichuAI วางตำแหน่งให้เป็นโมเดลภาษาที่เข้าใจภาพสำหรับการรับรู้ฉาก การให้เหตุผลเชิงพื้นที่ และงานเอเจนต์ที่ใช้เครื่องมือ ซึ่งเกี่ยวข้องกับการวิจัย embodied AI หรือ AI ที่ต้องรับรู้และโต้ตอบกับสภาพแวดล้อมจริง อย่างไรก็ดี การตอบคำถามเกี่ยวกับภาพได้ไม่เท่ากับพิสูจน์ว่าระบบควบคุมหุ่นยนต์ในสถานการณ์นั้นได้อย่างปลอดภัย 2
20
โมเดลใช้ Qwen3.5-9B เป็นส่วนประมวลผลภาษา และ C-RADIOv4-H เป็นส่วนเข้ารหัสภาพ รองรับข้อความ ภาพเดี่ยว หลายภาพ และวิดีโอ TaichuAI ระบุว่ารับข้อมูลภาพได้โดยไม่จำกัดไว้ที่ความละเอียดเดียว และรองรับบริบท สูงสุด 128K โทเค็น คุณสมบัติเหล่านี้เปิดทางให้ทดลองโจทย์ที่ต้องพิจารณาฉากจากหลายมุมมอง แต่ไม่ได้ยืนยันว่าโมเดลจะทำงานได้ดีเท่ากันในทุกขนาดอินพุตหรือทุกความยาวบริบท 2
จุดที่ผู้พัฒนาเน้นคือวิธี entropy-gated adaptive recurrent reasoning: โมเดลสามารถเพิ่มรอบปรับปรุงการประมวลผลภายในให้กับโทเค็นที่ยาก แทนที่จะใช้การคำนวณเพิ่มเท่ากันทุกตำแหน่ง แนวคิดนี้มุ่งเพิ่มความลึกของการให้เหตุผลเฉพาะจุดที่จำเป็น แต่ผลในงานของแต่ละทีมยังต้องทดสอบจริง 20
ในการเปรียบเทียบกับโมเดลภาษาที่เข้าใจภาพแบบอเนกประสงค์ขนาดใกล้เคียงกัน TaichuAI รายงานว่า ZDTaichu5.0-9B ได้ 62.50 คะแนนบน ViewSpatial, 78.27 บน MindCube-tiny, 47.20 บน MMSI-Bench, 48.00 บน ERQA และ 56.00 บน RoboSpatial โดยผู้พัฒนาระบุว่าผลงานด้านพื้นที่อยู่ในกลุ่มนำของโมเดลที่นำมาเทียบ ตัวเลขเหล่านี้เป็น ผลที่รายงานโดยผู้พัฒนา ไม่ใช่ผลที่บทความนี้ตรวจสอบซ้ำอย่างอิสระ นักวิจัยจึงควรประเมินอีกครั้งกับภาพ ฉาก และรูปแบบเอเจนต์ที่จะใช้จริง 1
20
TaichuAI เผยแพร่โมเดลหลักบน Hugging Face พร้อมรุ่น FP8 และ NVFP4 และมี DSpark ซึ่งเป็นโมเดลร่างสำหรับเทคนิค speculative decoding เพื่อใช้ร่วมกับ ZDTaichu5.0-9B ใน vLLM สำหรับการให้บริการโมเดล ผู้พัฒนามีทั้ง Docker image และสาขา vLLM ที่ปรับให้เข้ากับโมเดลนี้ จึงควรเริ่มจากคำแนะนำเฉพาะรุ่น แทนการคาดว่าการติดตั้ง vLLM รุ่นทั่วไปจะทำงานเหมือนกัน 2
4
5
3
17
--max-model-len 220000 ขณะที่สเปกโมเดลระบุ สูงสุด 128K โทเค็น ค่าที่ตั้งให้เซิร์ฟเวอร์ไม่ใช่หลักฐานว่ามีการยืนยันประสิทธิภาพของบริบท 220,000 โทเค็นแล้ว Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ZDTaichu5.0 9B เป็นโมเดลภาษาที่เข้าใจภาพขนาดราว 9 พันล้านพารามิเตอร์ เปิดให้ดาวน์โหลดเพื่อวิจัยการเข้าใจความสัมพันธ์เชิงพื้นที่และ AI ที่โต้ตอบกับสภาพแวดล้อมจริง โดยระบุว่ารองรับบริบทสูงสุด 128K โทเค็น [2]
ZDTaichu5.0 9B เป็นโมเดลภาษาที่เข้าใจภาพขนาดราว 9 พันล้านพารามิเตอร์ เปิดให้ดาวน์โหลดเพื่อวิจัยการเข้าใจความสัมพันธ์เชิงพื้นที่และ AI ที่โต้ตอบกับสภาพแวดล้อมจริง โดยระบุว่ารองรับบริบทสูงสุด 128K โทเค็น [2] โมเดลรับข้อความ ภาพหนึ่งภาพหรือหลายภาพ และวิดีโอ มีรุ่น FP8 และ NVFP4 รวมถึงแนวทางติดตั้งผ่าน vLLM ที่ TaichuAI จัดทำไว้ แต่คะแนนทดสอบที่เผยแพร่เป็นผลที่ผู้พัฒนารายงานเอง [2][4][5][17][1][20]