ZDTaichu5.0 9B nhận văn bản, một hoặc nhiều ảnh và video; thông số công bố cho biết cửa sổ ngữ cảnh lên tới 128K token. Các điểm đánh giá không gian do TaichuAI báo cáo là cơ sở để thử nghiệm, không phải bằng chứng độc lập về hiệu quả trong môi trường robot thực.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Một hệ thống robot cần nhiều hơn khả năng gọi tên đồ vật trong ảnh: nó còn phải phân biệt vị trí tương đối của chúng khi góc nhìn thay đổi. ZDTaichu5.0-9B là mô hình thị giác–ngôn ngữ có thể tải về mà TaichuAI hướng tới các nghiên cứu như vậy, đồng thời hỗ trợ thử nghiệm tác nhân sử dụng công cụ. Tuy nhiên, trả lời đúng câu hỏi về một cảnh vật không đồng nghĩa với việc có thể hành động an toàn trong cảnh đó. 2
20
ZDTaichu5.0-9B kết hợp bộ giải mã ngôn ngữ Qwen3.5-9B với bộ mã hóa hình ảnh C-RADIOv4-H. Theo thông số TaichuAI công bố, mô hình nhận văn bản, một ảnh, nhiều ảnh hoặc video; đầu vào thị giác được mô tả là hỗ trợ mọi độ phân giải, còn cửa sổ ngữ cảnh lên tới 128K token. Đây là những đặc điểm hữu ích nếu nhóm nghiên cứu muốn đặt câu hỏi dựa trên nhiều góc nhìn, nhưng không tự chứng minh chất lượng kết quả ở mọi kích thước đầu vào hay độ dài ngữ cảnh. 2
Điểm khác biệt TaichuAI nhấn mạnh là suy luận lặp thích ứng có điều tiết bằng entropy: mô hình có thể dành thêm các bước tinh chỉnh bên trong cho những token khó, thay vì tăng mức tính toán như nhau ở mọi vị trí. Với bài toán không gian, đây là một hướng đáng thử khi tác nhân phải theo dõi vị trí vật thể qua các góc nhìn hoặc diễn giải quan hệ vật lý trước khi sử dụng công cụ. Nó vẫn là một mô hình phục vụ nghiên cứu, chưa phải hệ thống robot đầu–cuối đã được kiểm chứng. 20
2
Trong các so sánh do TaichuAI báo cáo với những mô hình thị giác–ngôn ngữ đa dụng có quy mô tương đương, ZDTaichu5.0-9B đạt 62,50 trên ViewSpatial, 78,27 trên MindCube-tiny, 47,20 trên MMSI-Bench, 48,00 trên ERQA và 56,00 trên RoboSpatial. TaichuAI cho rằng mô hình dẫn đầu về năng lực không gian trong nhóm được so sánh. Đây là kết quả do bên phát triển công bố, chưa được kiểm chứng độc lập trong bài viết này; nhóm nghiên cứu vẫn cần đánh giá lại trên cảnh vật, cách thiết lập tác nhân và môi trường vật lý của mình. 1
20
TaichuAI đăng mô hình chính trên Hugging Face, cùng các biến thể FP8, NVFP4 và mô hình dự thảo DSpark dùng cho giải mã suy đoán với vLLM. Tài liệu của hãng cũng nêu một Docker image vLLM riêng và một nhánh vLLM đã chỉnh sửa. Đây là điểm khởi đầu phù hợp hơn việc mặc định bản vLLM chưa chỉnh sửa sẽ hoạt động tương tự. 2
4
5
3
17
Trước khi dùng lại mô hình, nên kiểm tra giấy phép của bản gốc, các thành phần và mọi bộ trọng số đã chuyển đổi. Một bản chuyển đổi GGUF của bên thứ ba ghi Apache-2.0, trong khi một danh mục mô hình khác mô tả cách cấp phép khác; nhãn trên bản chuyển đổi không đủ để kết luận điều khoản của bản gốc. 8
6 Ngoài ra, lệnh vLLM mẫu đặt
--max-model-len 220000, còn thông số mô hình ghi lên tới 128K token. Giá trị cấu hình máy chủ không phải bằng chứng rằng ngữ cảnh hiệu dụng 220.000 token đã được kiểm chứng. 17
2
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
ZDTaichu5.0 9B nhận văn bản, một hoặc nhiều ảnh và video; thông số công bố cho biết cửa sổ ngữ cảnh lên tới 128K token.
ZDTaichu5.0 9B nhận văn bản, một hoặc nhiều ảnh và video; thông số công bố cho biết cửa sổ ngữ cảnh lên tới 128K token. Các điểm đánh giá không gian do TaichuAI báo cáo là cơ sở để thử nghiệm, không phải bằng chứng độc lập về hiệu quả trong môi trường robot thực.
Trước khi tái sử dụng, cần kiểm tra điều khoản cấp phép từ nguồn gốc và làm theo hướng dẫn vLLM dành riêng cho mô hình.