Ra mắt tháng 9/2026 trên nền tảng Qwen AI, mô hình nhận trực tiếp bốn loại đầu vào và hỗ trợ cửa sổ ngữ cảnh tối đa 1 triệu token. Alibaba công bố điểm trung bình cao hơn hơn 25% so với Qwen3.5 Omni Plus qua 29 bài đánh giá; xử lý video có chọn lọc nhằm giảm lượng token cần dùng.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Qwen3.8-Omni-Flash là mô hình AI đa phương thức của Alibaba, được đưa lên nền tảng Qwen AI trong tháng 9/2026. Mô hình có thể nhận trực tiếp văn bản, hình ảnh, âm thanh và video trong cùng một quy trình, với cửa sổ ngữ cảnh tối đa 1 triệu token — tức dung lượng thông tin mô hình có thể xét trong một lượt xử lý. Thay vì chỉ mô tả nội dung đã xem, hướng sử dụng được Alibaba nhấn mạnh là để tác nhân AI hiểu dữ liệu, lập kế hoạch, gọi công cụ và tạo ra kết quả phục vụ công việc. Bản Qwen3.8-Omni-Flash thông thường trả về văn bản; không nên nhầm nó với biến thể Realtime có đầu ra âm thanh. 2
1
5
16
Với video dài, tác nhân có thể dựa vào câu hỏi để chọn những thời điểm liên quan rồi kiểm tra kỹ hơn, thay vì liên tục xử lý mọi khung hình. Alibaba báo cáo cách xử lý có chọn lọc dùng ít hơn 51,8% token so với cách hiểu video tĩnh trong phép thử OmniVideoBench. Hãng cũng cho biết điểm trung bình của Qwen3.8-Omni-Flash cao hơn hơn 25% so với Qwen3.5-Omni-Plus qua 29 bài đánh giá. Đó là kết quả thử nghiệm do hãng công bố, không đồng nghĩa mọi video hay ứng dụng thực tế đều tiết kiệm được từng ấy. 12
16
Một tình huống dễ hình dung là cuộc họp kéo dài một giờ: mô hình có thể đối chiếu lời nói với hình ảnh để phân biệt người phát biểu, chép nội dung và gắn lời nói với từng người. Từ đó, tác nhân có thể lập biên bản hoặc danh sách việc cần làm, rồi dùng công cụ để tiếp tục quy trình nếu được tích hợp và cho phép. Cửa sổ ngữ cảnh lớn giúp mô hình xử lý lượng tư liệu hỗn hợp kéo dài, nhưng kết quả vẫn cần được kiểm tra khi dùng cho quyết định quan trọng. 52
2
6
Alibaba mở rộng Qwen-MM-Plugins, bộ công cụ mã nguồn mở giúp các hệ thống tác nhân tiếp cận khả năng âm thanh–video và thực hiện quy trình dài. Qwen-Live Harness là bộ khung mã nguồn mở riêng cho tương tác trực tiếp. Đây là các công cụ đi kèm, không có nghĩa bản thân trọng số của mô hình Qwen3.8-Omni-Flash được phát hành mã nguồn mở. 1
52
5
Biến thể Qwen3.8-Omni-Flash-Realtime hỗ trợ tương tác âm thanh và video trực tiếp, xuất văn bản hoặc âm thanh, cùng các tính năng như âm thanh đa kênh, tổng hợp thông tin video và kết nối công cụ MCP từ xa. MCP là giao thức để tác nhân kết nối với công cụ hoặc nguồn dữ liệu bên ngoài. 1
Về chi phí, Alibaba cho biết giá API tính trên mỗi giờ đầu vào âm thanh giảm hơn 98%, còn đầu vào kết hợp âm thanh–video giảm hơn 93%. Kết hợp với việc chỉ xem kỹ những đoạn video cần thiết, mức giá này có thể giúp các tác nhân phải liên tục nghe, xem và gọi công cụ dễ triển khai hơn về mặt kinh tế. Tuy nhiên, hóa đơn thực tế vẫn phụ thuộc vào lượng tư liệu được xử lý, số token sử dụng, đầu ra và các công cụ được gọi; các tỷ lệ giảm giá nói trên không phải mức giảm được bảo đảm cho toàn bộ quy trình. 12
16
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt tháng 9/2026 trên nền tảng Qwen AI, mô hình nhận trực tiếp bốn loại đầu vào và hỗ trợ cửa sổ ngữ cảnh tối đa 1 triệu token.
Ra mắt tháng 9/2026 trên nền tảng Qwen AI, mô hình nhận trực tiếp bốn loại đầu vào và hỗ trợ cửa sổ ngữ cảnh tối đa 1 triệu token. Alibaba công bố điểm trung bình cao hơn hơn 25% so với Qwen3.5 Omni Plus qua 29 bài đánh giá; xử lý video có chọn lọc nhằm giảm lượng token cần dùng.
Chi phí API tính theo giờ được Alibaba cho biết giảm hơn 98% với đầu vào âm thanh và hơn 93% với đầu vào kết hợp âm thanh–video.