DeepSeek V4.1 Flash hỗ trợ ngữ cảnh tối đa một triệu token; mỗi token kích hoạt khoảng 8 tỷ tham số khi đọc đầu vào và 16 tỷ khi tạo câu trả lời. DeepSeek công bố bộ nhớ đệm KV toàn cục ở mức 890 byte/token, khoảng một phần tư V4 Flash.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Một tác tử AI có thể phải đọc lại lịch sử hội thoại, tài liệu và kết quả từ các công cụ trước khi viết một câu trả lời ngắn. DeepSeek-V4.1-Flash được thiết kế cho kiểu công việc nhiều đầu vào này: đây là mô hình đa phương thức dạng mixture-of-experts (MoE), có 552 tỷ tham số trong kiến trúc nền và hỗ trợ ngữ cảnh tối đa một triệu token. Con số đó nói lên lượng đầu vào được hỗ trợ, không bảo đảm mô hình sẽ tìm lại chính xác mọi chi tiết trong một phiên dài. 2
8
Mô hình có 40 lớp, gồm 20 lớp encoder nhân quả để xử lý đầu vào, tiếp theo là 20 lớp decoder để tạo đầu ra. Bộ nhớ đệm key–value (KV) toàn cục của decoder được tạo từ trạng thái cuối của encoder, thay vì được tạo riêng từ trạng thái của từng lớp decoder. Theo DeepSeek, ở giai đoạn prefill — khi đọc đầu vào — mô hình kích hoạt khoảng 8 tỷ tham số cho mỗi token; ở giai đoạn decode — khi sinh đầu ra — con số là 16 tỷ. Sự chênh lệch này phù hợp với các phiên tác tử đọc nhiều hơn viết. 2
8
Với lịch sử dài, thách thức còn nằm ở bộ nhớ đệm KV: dữ liệu được giữ lại để mô hình không phải tính toán lại toàn bộ ngữ cảnh mỗi khi tạo token tiếp theo. Cơ chế Compressed Sparse Attention 2 (CSA2) chia các lớp attention thành ba chế độ cố định — Full, Reindex và Reuse — nhằm chia sẻ dữ liệu KV và tái sử dụng các lựa chọn attention thưa. Kết hợp với việc lưu bộ nhớ đệm KV chính ở định dạng FP4, DeepSeek công bố dung lượng KV toàn cục là 890 byte/token, khoảng một phần tư so với DeepSeek-V4-Flash. Đây là so sánh về dung lượng bộ nhớ đệm, không phải bằng chứng rằng tổng chi phí của mọi hệ thống triển khai đều giảm tương ứng. 6
8
Một tối ưu khác, SWA Bounded Replay, tái tạo các trạng thái KV còn thiếu của cơ chế attention theo cửa sổ trượt bằng cách chạy lại phần token gần nhất, thay vì lưu các trạng thái đó lâu dài trên ổ SSD. Tài liệu mô hình ước tính dung lượng KV cần lưu bền vững còn khoảng một phần tám so với V4-Flash. Mốc một phần tám này đo phần lưu trữ bền vững, khác với mốc một phần tư của KV toàn cục ở trên. 5
9
Một tài liệu giới thiệu mô hình cho biết DeepSeek-V4.1-Flash được huấn luyện từ đầu trên tập dữ liệu đa phương thức 45 nghìn tỷ token; attention thưa được huấn luyện với chuỗi dài 64.000 token, rồi ngữ cảnh được mở rộng lên một triệu token tại mốc 34 nghìn tỷ token. DeepSeek cũng nhắc đến các phương pháp tiền huấn luyện mới và giai đoạn hậu huấn luyện bằng học tăng cường ở quy mô lớn hơn, nhưng những nguồn được dẫn chưa đủ để mô tả chi tiết quy trình hậu huấn luyện. 9
16
Mô hình xử lý văn bản và hình ảnh; DeepSeek cho biết API của phiên bản này hỗ trợ đa phương thức. Các trích đoạn nguồn hiện có không cung cấp kết quả chi tiết cho những bài kiểm tra năng lực thị giác. 2
16
Trong đánh giá do DeepSeek công bố, bản base có năng lực kiến thức, suy luận và lập trình tương đương V4-Pro-Base, đồng thời cao hơn 5%–10% trên các tập đánh giá giữ lại, dù dùng khoảng một phần ba tổng số tham số và một phần tư số tham số được kích hoạt. DeepSeek còn nói phiên bản phát hành vượt V4-Pro ở các tác vụ tác tử AI; nguồn được dẫn chưa đủ để đối chiếu đáng tin cậy từng bài kiểm tra. Đây không phải kết quả so sánh độc lập. 1
16
Tên mô hình trên API là deepseek-flash. Bộ trọng số được công bố theo giấy phép MIT; tài liệu mô hình mô tả cách triển khai bằng SGLang, còn các danh mục mô hình cũng nêu khả năng chạy với Transformers và vLLM. Trước khi triển khai, nên kiểm tra môi trường chạy cụ thể có hỗ trợ đầy đủ tính năng đa phương thức và ngữ cảnh dài hay không. 8
9
16
DeepSeek thông báo V4-Flash và V4-Flash-Vision-Exp đã ngừng hoạt động như các phiên bản riêng; những tên API cũ của chúng tạm thời được chuyển sang V4.1-Flash. Hãng cũng thông báo từ 14/9/2026, yêu cầu gửi đến deepseek-v4-pro sẽ được chuyển sang V4.1-Flash với mức giá Flash trong lúc chờ V4.1-Pro. Nếu ứng dụng phụ thuộc vào hành vi riêng của bản Pro, cần xác nhận mô hình thực sự xử lý yêu cầu thay vì chỉ dựa vào tên API. 16
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek V4.1 Flash hỗ trợ ngữ cảnh tối đa một triệu token; mỗi token kích hoạt khoảng 8 tỷ tham số khi đọc đầu vào và 16 tỷ khi tạo câu trả lời.
DeepSeek V4.1 Flash hỗ trợ ngữ cảnh tối đa một triệu token; mỗi token kích hoạt khoảng 8 tỷ tham số khi đọc đầu vào và 16 tỷ khi tạo câu trả lời. DeepSeek công bố bộ nhớ đệm KV toàn cục ở mức 890 byte/token, khoảng một phần tư V4 Flash.
Mô hình có thể xử lý văn bản và hình ảnh, được cung cấp qua API với tên deepseek flash; các so sánh hiệu năng hiện nêu trong bài là kết quả do DeepSeek báo cáo.