DeepSeek V4.1 Flash ra mắt ngày 10/9/2026, là mẫu Flash hiện hành có hỗ trợ hiểu hình ảnh gốc và được gọi qua API bằng tên deepseek flash. V4 Flash và V4 Flash Vision Exp đã ngừng hoạt động; các ID cũ tạm thời được chuyển sang V4.1 Flash với mức phí Flash.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash ra mắt ngày 10/9/2026 dưới dạng mô hình trọng số mở, đa phương thức. Điểm đáng chú ý không chỉ là quy mô: DeepSeek kết hợp kiến trúc Mixture-of-Experts (MoE) 552 tỷ tham số với cơ chế kích hoạt thưa và KV cache nhỏ hơn đáng kể, nhằm giúp suy luận trên ngữ cảnh rất dài khả thi hơn. 17
35
Với nhà phát triển dùng API DeepSeek, V4.1 Flash là lựa chọn Flash hiện tại, gọi bằng định danh deepseek-flash. Mô hình hỗ trợ hiểu hình ảnh gốc bên cạnh đầu vào văn bản. 15
17
Hai mẫu cũ là V4 Flash và V4 Flash Vision Exp đã bị ngừng. DeepSeek cho biết các định danh cũ deepseek-v4-flash và deepseek-v4-flash-vision-exp vẫn được chấp nhận trong giai đoạn tương thích, nhưng yêu cầu thực tế sẽ được phục vụ bằng V4.1 Flash và tính phí theo mức Flash. 15
23
V4 Pro là trường hợp khác. Một số thông tin chuyển đổi ban đầu nói lưu lượng V4 Pro sẽ được chuyển sang V4.1 Flash trong khi chờ V4.1 Pro. Tuy nhiên, nhật ký thay đổi API chính thức cập nhật sau đó cho biết DeepSeek sẽ tiếp tục cung cấp dịch vụ API V4 Pro sau ngày 14/9/2026 theo nhu cầu người dùng, với cách tính phí không đổi. Vì vậy, các đội ngũ cần hành vi tái lập nên dùng định danh mô hình đang được tài liệu hóa và chạy kiểm thử hồi quy, thay vì mặc định một tuyến API cũ luôn trỏ đến V4.1 Flash. 15
23
V4.1 Flash là mô hình Mixture-of-Experts (MoE) với 552 tỷ tham số nền tảng. Trong MoE, hệ thống chỉ chọn một phần tham số phù hợp cho từng token, thay vì vận hành toàn bộ mô hình ở mọi bước.
DeepSeek cho biết mô hình kích hoạt 8 tỷ tham số khi xử lý đầu vào (prefill) và 16 tỷ tham số khi sinh đầu ra (decoding). Mô hình sử dụng kiến trúc mà hãng gọi là Causal Encoder–Decoder. Sự phân tách này đáng chú ý vì prompt dài và câu trả lời dài tạo ra các kiểu chi phí suy luận khác nhau. 17
35
Dù vậy, kích hoạt thưa không đồng nghĩa mô hình chắc chắn rẻ hoặc nhanh trong mọi môi trường triển khai. Thông lượng thực tế còn phụ thuộc phần cứng, batching, lượng tử hóa, phần mềm phục vụ, độ dài ngữ cảnh và cơ cấu yêu cầu. Nhưng đây là nền tảng cho định hướng tối ưu hiệu quả của V4.1 Flash.
V4.1 Flash hỗ trợ ngữ cảnh tối đa 1 triệu token. 35
Trở ngại vận hành lớn của ngữ cảnh dài là key-value cache (KV cache) — trạng thái attention được lưu lại để mô hình tiếp tục sinh từng token mới. Prompt và phản hồi càng dài, lượng bộ nhớ này càng dễ trở thành nút thắt của hệ thống phục vụ.
Theo model card của DeepSeek, kiến trúc Causal Encoder–Decoder tạo KV cache toàn cục của decoder từ các trạng thái ẩn cuối cùng của encoder, thay vì tạo riêng từ từng lớp decoder. Bản phát hành còn kết hợp Compressed Sparse Attention 2 với FP4 KV caching. DeepSeek cho biết bộ nhớ KV cache toàn cục đạt khoảng 890 byte cho mỗi token, tương đương khoảng một phần tư mức của DeepSeek V4 Flash. 35
39
Con số này không có nghĩa mọi tác vụ 1 triệu token đều rẻ hoặc chính xác. Khả năng chứa ngữ cảnh không đồng nghĩa với khả năng truy xuất thông tin, suy luận hay tuân thủ chỉ dẫn một cách đáng tin cậy trên toàn bộ prompt. Với kho mã nguồn lớn, tập tài liệu hoặc lịch sử agent, cần đo riêng độ chính xác truy xuất, độ trễ và chi phí trên dữ liệu sát thực tế.
DeepSeek đã phát hành trọng số V4.1 Flash trên Hugging Face theo giấy phép MIT. Model card mô tả đây là bản phát hành trọng số mở, cho phép tổ chức tải xuống và triển khai theo điều khoản giấy phép này. 35
Đây là lựa chọn khác với các mô hình chỉ cung cấp qua API: đội ngũ có thể đánh giá mô hình trên hạ tầng riêng và kiểm soát ngăn xếp phục vụ. Điều đó không xóa đi độ phức tạp triển khai, nhất là với nền tảng 552 tỷ tham số, nhưng mở ra con đường tự host và tối ưu sâu hơn.
DeepSeek cho biết các phương pháp tiền huấn luyện mới và hậu huấn luyện reinforcement learning ở quy mô lớn hơn đã tạo ra kết quả benchmark vượt các mẫu đầu bảng, trong đó có V4 Pro. Hãng cũng dẫn các thử nghiệm của nhiều bên cho rằng V4.1 Flash hơn V4 Pro về hiệu năng, chi phí, tốc độ và tổng thời gian chạy. 17
Đây là các kết quả đáng chú ý do nhà cung cấp công bố, nhưng không phải phán quyết áp dụng cho mọi trường hợp. Benchmark phụ thuộc vào lựa chọn bài toán, cách prompt, cấu hình công cụ, phương pháp chấm điểm và phiên bản mô hình được thử. Trước khi chuyển quy trình sản xuất, nên đánh giá cả hai trên những tiêu chí thực sự quan trọng: suy luận khó, tỷ lệ mã được chấp nhận, dùng công cụ, độ chính xác đa phương thức, độ ổn định, cơ chế an toàn, độ trễ và tổng chi phí.
V4.1 Flash xuất hiện trong bối cảnh DeepSeek và các nhà cung cấp mô hình Trung Quốc khác đã có lưu lượng đáng kể trên OpenRouter. Nền tảng này xếp hạng theo số token prompt và completion đi qua API của chính họ. Ở bảng xếp hạng ngày 13/9, OpenRouter ghi nhận DeepSeek V4.1 Flash đạt 4,94 nghìn tỷ token và được đánh dấu là mới; DeepSeek V4 Flash 0731 đạt 11,6 nghìn tỷ, V4 Flash 0423 đạt 4,36 nghìn tỷ, còn Xiaomi MiMo-V2.5 đạt 7,77 nghìn tỷ token. 57
Một ảnh chụp dữ liệu vào tháng 8 cũng cho thấy thứ hạng có thể biến động rất nhanh: V4 Flash từng đạt 7,1 nghìn tỷ token theo tuần, và chín trong 10 mô hình được dùng nhiều nhất trong bảng xếp hạng đó là mô hình Trung Quốc. 50
Điểm cần lưu ý là phạm vi đo lường. Số token của OpenRouter phản ánh lưu lượng đi qua OpenRouter, không đại diện cho tổng mức dùng AI toàn cầu, mức triển khai doanh nghiệp, doanh thu hay chất lượng mô hình. Đây là chỉ dấu hữu ích về nhu cầu trên một nền tảng dành cho nhà phát triển, không phải bằng chứng rằng một mô hình đã thắng toàn thị trường.
Lý do thuyết phục nhất để thử V4.1 Flash là tổ hợp giữa đa phương thức gốc, ngữ cảnh 1 triệu token, trọng số mở và kiến trúc được thiết kế để giảm chi phí bộ nhớ của suy luận dài. 17
35
Lộ trình chuyển đổi hợp lý gồm:
deepseek-flash cho các tích hợp Flash mới.Các tuyên bố kỹ thuật của V4.1 Flash, đặc biệt là mức 890 byte KV cache mỗi token và thiết kế kích hoạt thưa, là đáng kể. Ý nghĩa thực tế của chúng sẽ phụ thuộc vào việc các lợi ích đó có chuyển thành hiệu năng ổn định và chi phí phù hợp trên những khối lượng công việc mà nhà phát triển thực sự vận hành hay không.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek V4.1 Flash ra mắt ngày 10/9/2026, là mẫu Flash hiện hành có hỗ trợ hiểu hình ảnh gốc và được gọi qua API bằng tên deepseek flash.
DeepSeek V4.1 Flash ra mắt ngày 10/9/2026, là mẫu Flash hiện hành có hỗ trợ hiểu hình ảnh gốc và được gọi qua API bằng tên deepseek flash. V4 Flash và V4 Flash Vision Exp đã ngừng hoạt động; các ID cũ tạm thời được chuyển sang V4.1 Flash với mức phí Flash.
Trên bảng xếp hạng OpenRouter ngày 13/9, V4.1 Flash ghi nhận 4,94 nghìn tỷ token được xử lý; các biến thể V4 Flash cũ và MiMo V2.5 của Xiaomi vẫn có lượng sử dụng lớn.