DeepSeek V4 Flash là phiên bản hiệu quả của dòng DeepSeek V4, được thiết kế cho các khối lượng công việc lớn, yêu cầu độ trễ thấp. Nó sử dụng kiến trúc MoE với tổng số 284 tỷ tham số, trong đó chỉ có 13 tỷ tham số được kích hoạt cho mỗi token . Điều này có nghĩa là mô hình có quyền truy cập vào một kho kiến thức chuyên biệt khổng lồ trong khi vẫn đảm bảo tốc độ suy luận nhanh và chi phí thấp.
| Thuộc tính | Giá trị |
|---|---|
| Tổng tham số | 284B (304B với mô-đun DSpark) |
| Tham số kích hoạt | 13B mỗi token |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Cửa sổ ngữ cảnh | 1 triệu token |
| Đầu ra tối đa | 384K token |
| Độ chính xác (Precision) | Hỗn hợp FP4 + FP8 |
| Giấy phép | MIT |
| Kích thước tải về | ~160 GB |
Nguồn:
Cả V4 Flash và phiên bản lớn hơn V4 Pro đều được phát hành dưới giấy phép MIT cởi mở, cho phép sử dụng thương mại, sửa đổi và phân phối không giới hạn mà không phải trả tiền bản quyền . Trọng số của mô hình có sẵn trên Hugging Face và có thể được tự lưu trữ trên cơ sở hạ tầng riêng. DeepSeek V4 là dòng mô hình trọng số mở duy nhất trong phân khúc của nó có cửa sổ ngữ cảnh 1 triệu token và được cấp phép mềm dẻo theo giấy phép MIT .
Mô hình V4 Flash đạt được cửa sổ ngữ cảnh khổng lồ 1 triệu token nhờ kiến trúc attention lai kết hợp hai cơ chế mới:
Mô hình luân phiên sử dụng các lớp CSA và HCA: các lớp chẵn từ lớp 2 trở đi sử dụng CSA (nén 4:1), trong khi các lớp lẻ từ lớp 3 trở đi sử dụng HCA (nén 128:1). Một nhánh sliding-window trên 128 token thô gần nhất luôn được duy trì để đảm bảo tính thời sự .
Trọng số của mô hình sử dụng lượng tử hóa hỗn hợp để thu nhỏ bộ nhớ:
nvidia/DeepSeek-V4-Flash-NVFP4) .Ở định dạng FP8, toàn bộ trọng số của mô hình 284B nặng khoảng 284 GB. Để tự lưu trữ, cấu hình tối thiểu được khuyến nghị để sử dụng đầy đủ ngữ cảnh 1M là 4x NVIDIA H200 SXM5 (tổng cộng 564 GB VRAM) .
DeepSeek V4 Flash cung cấp tham số reasoning_effort có thể cấu hình, cho phép các nhà phát triển chọn chế độ suy luận của mô hình:
Tham số này cho phép các nhà phát triển đánh đổi giữa tốc độ phản hồi và độ sâu suy luận, giúp mô hình có thể thích ứng cho nhiều trường hợp sử dụng từ phân loại đơn giản đến tạo mã nâng cao và lập kế hoạch đa bước .
DeepSeek V4 Flash có giá $0,14 mỗi triệu token đầu vào (cache miss) và $0,28 mỗi triệu token đầu ra . Đối với các đầu vào đã được lưu trong bộ nhớ đệm (cache hit) (các system prompt lặp lại hoặc các tiền tố phổ biến), giá giảm xuống còn $0,0028 mỗi triệu token — giảm 98% .
Để so sánh, đầu ra của V4 Flash rẻ hơn 54 lần so với Sonnet 4.6 ($15/M) và rẻ hơn 107 lần so với GPT-5.5 ($30/M) . Nhiều nguồn mô tả nó là "API rẻ nhất ở phân khúc frontier hiện có" .
Bản phát hành sản xuất ngày 31 tháng 7 (V4-Flash-0731) đã mang lại những cải tiến lớn về khả năng agent và lập trình thông qua việc tái huấn luyện (re-post-training) thay vì thay đổi kiến trúc . Nhật ký cập nhật chính thức báo cáo:
Bản ghi chú phát hành cho biết mô hình hiện "hoạt động ở mức tương đương với phiên bản lớn hơn là V4-Pro trong các benchmark agent và lập trình" . Điều này đã xóa nhòa ranh giới hiệu suất truyền thống giữa Pro và Flash đối với các khối lượng công việc agent .
DeepSeek cũng đang đẩy mạnh vào lĩnh vực AI agent. Vào ngày 1 tháng 8 năm 2026, công ty bắt đầu tuyển dụng các nhà phát triển mã nguồn mở cho chương trình thử nghiệm beta kín của DeepSeek Harness . Framework này được thiết kế để biến các mô hình ngôn ngữ lớn thành các tác nhân AI có thể tự động thực thi tác vụ, quản lý ngữ cảnh và gọi công cụ .
Cái tên này lần đầu tiên xuất hiện trong nhật ký thay đổi của V4-Flash-0731 vào ngày 31 tháng 7 với ghi chú "sẽ sớm được phát hành" . Nhóm kỹ thuật Harness được thành lập vào tháng 3 năm 2026, khi Cui Tianyi gia nhập DeepSeek để xây dựng nhóm từ đầu .
Để tham gia chương trình thử nghiệm beta, các nhà phát triển phải có kinh nghiệm với các dự án Agent Harness và gửi ID GitHub cùng với các sản phẩm tiêu biểu của họ .
Cách tiếp cận của DeepSeek dưới sự lãnh đạo của CEO Liang Wenfeng tập trung vào việc xây dựng các mô hình rẻ và mạnh như một con đường dẫn đến AGI . Giá của V4 Flash — $0,14/$0,28 mỗi triệu token — và chiến lược trọng số mở MIT là bằng chứng vận hành rõ ràng nhất cho triết lý này. Như một nguồn tin đã chỉ ra, "V4-Flash ở mức $0,28/M đầu ra rẻ hơn khoảng 107 lần so với GPT-5.5" .
DeepSeek phải đối mặt với sự cạnh tranh trong nước từ Alibaba (dòng Qwen), ByteDance (Doubao), Moonshot AI, MiniMax và Z.AI, nhưng dòng V4 là dòng mô hình trọng số mở duy nhất trong phân khúc của nó có sẵn dưới giấy phép MIT mềm dẻo . Nhiều nguồn cũng đề cập đến việc DeepSeek được cho là đang chuẩn bị IPO, mặc dù ngày cụ thể hoặc các tổ chức bảo lãnh phát hành vẫn chưa được xác nhận .
Mặc dù các nguồn tin thu thập được vẽ nên một bức tranh toàn diện, một số tuyên bố vẫn chưa thể được xác minh độc lập:
Những chi tiết này có thể có sẵn trong các báo cáo rộng hơn của ngành và có thể được xác nhận với các tìm kiếm có mục tiêu bổ sung.